动察 Beating AI 快讯,DeepSeek 一个新的视觉模型 deepseek-v4-flash-vision-exp 开始浮出水面。社区已经有人通过 API 跑通,可以直接传图提问。更直接的信号是,DeepSeek Harness 今天已经把这个模型加入默认模型目录,并明确标记为支持图片输入。对应代码 PR 的标题就叫「publish the vision model」。目前 DeepSeek 还没有正式官宣,官方 API 文档里也暂未出现。
DeepSeek 其实早就能识图。网页和 App 已经上线识图模式。此前 DeepSeek 视觉团队公开的研究基于 V4-Flash,让模型把点和边界框直接插进推理链,相当于一边「指」着图片,一边完成视觉 CoT 推理。
这次发布也早有伏笔。两天前的 DeepSeek Harness RC.8 刚给官方 DeepSeek 适配器补上原生图片输入。实现笔记当时已经写出 deepseek-v4-flash-vision-exp,但特意没有放进默认模型目录,理由是要等模型端点准备好。
两天后,这个限制被正式拿掉。Harness v0.1.1-rc.1 已经把 deepseek-v4-flash-vision-exp 列为默认视觉模型。此前还是「等端点准备好」,现在已经直接进入官方模型列表,新视觉模型即将发布。
币须知道