最近几个月,我发现自己订阅的 token 套餐数量不断增加,然而使用的 token 却总是显得不够。这让我感到困惑,不知道是我的项目增多了,还是各大厂商提供的 token 数量减少了。无论如何,我在这方面的投入没有减少,但 token 的焦虑却越来越明显。直到前几天,阿里发布了 Qwen3.8-27B,这一款官方的模型在性能测试中的表现竟然能与 Claude Opus 4.6 媲美,更值得注意的是,它几乎全部基于 Claude Code 的性能进行的评测,且是开源的,任何人都可以免费下载。这个消息引起了极大的关注,发布后的48小时内便登上了 Hugging Face 趋势榜的第一位,还在 Hacker News 排名第一,并且在 LM Studio 上线后38分钟内下载量突破一万,在 Ollama 的单一渠道中,前五天累计下载达到了36万次。编程工具 Cline 也发表声明称,仅上线四天,Qwen3.8-27B 就成为 Cline 开发者最喜欢的本地模型。多家媒体如 CNBC 和 The Information 也对此进行了详细报道。在 Hugging Face 趋势榜中,Qwen3.8-27B 的表现无与伦比,Ollama、vLLM 和 SGLang 等也作为第一时间支持者加入了其中,就连 Cloudflare 也迅速将其纳入了 Workers AI 模型库,AMD 也推出了 Ryzen AI Max 的部署指导。这种待遇在今年的开源模型中实属罕见,从而激发了我的好奇心,决定将其安装到我的 Mac 上,亲自测试它的性能到底如何。
首先,Qwen3.8-27B 是一个参数达270亿的稠密模型,这意味着它在每一次生成文本时都会调动全部的270亿个参数来工作,而不是仅仅使用一部分。根据 Apache 2.0 协议开源,权重可以随意下载并用于商业用途。官方声称此次发布的主题是“编程与协作的全新标杆”,强调了其在编程及办公协作方面的应用。此外,它还有一个重量级的兄弟,Qwen3.8-2.4T-A95B,其参数高达2.4万亿,这次的权重也是首次公开,但由于是纯文本模型,普通用户几乎无法运行,真正适合普通人的则是27B版本。Qwen3.8-27B 是原生的多模态模型,能够理解图片和视频,官方表示甚至能处理小时级别的长视频。值得注意的是,它的能力在于“理解”,而非“生成”,如果你想让它进行绘图,那就不合适了。它的边界框检测能力相当精准,能够准确标识出照片中的鹈鹕等对象。这种能力在 agent 流程中非常有价值,可用于识别图像、读取文档和处理代码等任务。它的上下文容量为262K,官方表示可以通过名为 YaRN 的技术扩展到1M,但请注意,1M 目前只是理论推测,实际使用中大家大多在262K范围内。
接下来,大家为何都称其为“本地 Opus 4.6”?因为 Opus 4.6 发布时的用户体验及其显著的性能提升,给使用者留下了深刻印象。因此,当社区出现新的模型时,总是第一时间拿来与 Opus 4.6 进行对比,它已成为了衡量标准。尽管官方给出的模型跑分确实很高,但我们需要明确的是,这些数据都是官方自己的测试结果,可能存在偏差,通常可以先打个折扣来看。Qwen3.8-27B 的文本跑分在 SWE-bench Pro 中为61.7,Claude Opus 4.6 Max 的相比数值为53.4,而在 Terminal Bench 和 LiveCodeBench 中分别为73.0和90.3。官方的多模态测试数据也非常有竞争力,电脑操作在 OSWorld-Verified 中得分84.3,文档理解在 OmniDocBench 中得分91.1。官方表示其整体表现已经超过了此前的 Qwen3.7-Plus 版本。尽管数据上令人满意,但实际使用感受如何呢?根据最近几天社区的实测结果表明,在日常编程和 agent 任务中,它与云端旗舰模型的差距已小到用户需要仔细分辨才能感受到;不过在较为复杂的长推理任务上,云端的表现依旧更加稳定。经过我的亲自测试,我确实认为这个模型的表现不错,无论是在中文写作还是基础编程上都应对自如,但相对云端 API,其速度依然较慢,对于实际项目而言,等待时间本身也是一种成本。此外,第三方的排名也出炉,Artificial Analysis 最近将 Qwen3.8-27B 收录至其 Agentic Index 中,得分为51,位列第七。这一得分比其前代 Qwen3.6-27B 的28分高出不少,足以超越 DeepSeek V4 Pro 和 GPT-5.6 Luna,但仍然落后于 Claude Opus 5、GLM-5.3 和 Grok 4.6 这三者,它们得分均为59分。因此,可以准确说,本地模型首次跻身这一榜单的第一梯队,尽管与“超越所有闭源旗舰”的目标还有一段距离。另一份专注于评估 agent 复杂任务的第三方榜单 Agents' Last Exam 也公布了成绩,27B 以42.9%的得分维持着其旗舰地位。
2026-08-22
2026-08-22