加密知识一站通
行情·工具·策略

腾讯自建Agent基准,结果自家CodeBuddy没打过Claude Code

据动察 Beating 监测,腾讯做了一套 Agent 基准 WorkBuddy Bench,顺手让自家 CodeBuddy Code 和 Claude Code 正面对打。

260 道真实工作题分成代码、Web、办公、安全四类,7 个模型都用两套 Harness 各跑一遍。Harness 就是模型外面的 Agent 执行层,负责上下文、工具调用和任务执行。

28 组同模型对比,Claude Code 赢了 17 组,CodeBuddy 只赢 11 组。代码更是 7:0,7 个模型换成 Claude Code 后全部涨分。

CodeBuddy 也没有全面挨打。Web 和办公都是 4:3 小胜,安全则被 Claude Code 4:3 拿下。

同一个模型只换 Harness,成绩就能差十几分。所以看 Agent 强不强,已经不能只看底层模型。

但腾讯这份榜单也有明显软肋。260 道题拆成四类后,每类只有 50 到 80 题。社区有人直接追问:再加几道难题,排名会不会就变了?GitHub 上也有人嫌只测了两套 Harness,连 Codex 都没有。

赞(0)
未经允许不得转载:币须知道 » 腾讯自建Agent基准,结果自家CodeBuddy没打过Claude Code

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址