据动察 Beating 监测,AI Agent 基础设施公司 Composio 把 DeepSeek V4 Flash 接进 8 套 Harness,用同一批 30 个 Agent 任务测试。Harness 就是模型外面的执行框架,负责上下文、工具调用和任务执行。任务涉及 Gmail、GitHub、Slack、Calendar、Notion 等真实应用。
8 套 Harness 的通过情况分别是:
1. Pi Agent:20/30
2. Oh My Pi:17/30
3. Claude Code:16/30
4. Codex:16/30
5. Deep Agents:16/30
6. Hermes Agent:15/30
7. Prime Agent:15/24
8. OpenCode:14/30
仅仅更换 Harness,DeepSeek V4 Flash 就能从通过 14 个任务变成 20 个。
成本和速度也差得很大。Pi Agent 每个成功任务只花约 0.028 美元,Claude Code 为 0.195 美元,接近 7 倍。Claude Code 最快,中位耗时 122.7 秒;Oh My Pi 最慢,为 272.4 秒。
不过 Pi 的测试配置与统一条件有差异:它使用 high 而非 max 推理强度,30 个任务中还有 24 个走 DeepSeek 官方 API,而非 OpenRouter。因此这组差距不一定能完全归因于 Harness。
Composio 此前还用 Kimi K3 做过另一轮 Harness 横评。当时 Oh My Pi 以 22/25 排第一,原版 Pi Agent 为 18/25。OMP 本身就是从 Pi 分叉出来的 Coding 增强版,加入了子 Agent 等能力。换成 DeepSeek V4 Flash 后,反而是原版 Pi 跑到了第一。
币须知道