据动察 Beating 监测,在长程软件工程基准 DeepSWE 上,DeepSeek-V4-Flash 正式版拿到 54.4 分,接近 Claude Opus 4.8 的 59 分,远高于 V4-Pro-Preview 此前的 8 分。
这个成绩低于 Kimi K3 的 69 分,但高于 GLM-5.2 的 44 分,已进入国产模型第一梯队。
不过,这不是完全相同条件下的模型裸测。正式版 V4-Flash 使用 DeepSeek 自己尚未发布的 Harness 极简模式,Agent 成绩会同时受到模型和执行框架影响。
币须知道