加密知识一站通
行情·工具·策略

Qwen3.8 Max重测后追平Opus 4.8,仍没打过Kimi K3

动察 Beating 监测,评测机构 Artificial Analysis 重测 Qwen3.8 Max 后,将其 Intelligence Index 从 53 分上调到 56 分。此前测试接口出现间歇性异常,这次改用阿里云官方 API 重跑。新成绩追平 Claude Opus 4.8,但仍比 Kimi K3 低 1 分。

千问进步最明显的是 Agent 任务。GDPval-AA 得分达到 1739,超过 Kimi K3 的 1685 和 GPT-5.6 Sol 的 1730,仅落后 Claude Opus 5。终端操作、科学推理和编程评测也普遍上涨。

代价是更费 Token。Qwen3.8 Max 的 Token 单价比上一代更低,但完成一道综合评测任务的平均成本,仍从 0.53 美元涨到 1.14 美元,高于 Kimi K3 的 0.86 美元。主要原因是它在 Agent 任务中调用更多轮次,生成的内容也更多。

它的知识可靠性还出现倒退。AA-Omniscience 准确率基本没变,幻觉率却从上一代的 23% 升到 40%。

赞(0)
未经允许不得转载:币须知道 » Qwen3.8 Max重测后追平Opus 4.8,仍没打过Kimi K3

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址