据动察 Beating 监测,千问正式开源 Qwen3.8-27B,官方跑分也一起公布。这个只有 27B 参数的本地模型,在官方列出的 8 项可直接对比测试中,全部超过 Meta 刚发布的 30B 模型 Muse Glimmer。
差距在 Agent 和编程上尤其明显。Terminal-Bench 2.1,Qwen3.8-27B 得分 73.0,Muse Glimmer 为 51.7;SWE-bench Pro 是 61.7 对 51.2;OSWorld-Verified 则是 84.3 对 65.9。通用推理、文档和视觉测试也全部领先。
更夸张的是和 Claude Opus 4.6 对比。两边都有成绩的 19 项测试中,Qwen3.8-27B 赢了 15 项。SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld 和多项视觉任务都已经反超;Terminal-Bench、GPQA、HLE 和 NL2Repo 仍落后。
一个能在个人电脑本地跑的 27B 模型,官方跑分已经摸到了上一代闭源旗舰的水平。
币须知道