DeepSeek小模型长了眼睛,Agent基准干翻顶级闭源模型
DeepSeek发布V4-Flash-Vision-Exp多模态视觉实验版,在Agents' Last Exam和ZeroBench等Agent基准测试中超越Opus-4.8等顶级闭源模型;视觉能力加入后文本性能未下降,且图片token消耗仅384个,Files API免费;该模型聚焦Agent工作流闭环,验证了轻量级多模态Agent能力的可行性。
V4-Flash-Vision-Exp在Agent基准测试中胜出
8月21日,DeepSeek正式发布V4-Flash-Vision-Exp——V4-Flash的多模态视觉实验版。名字里带个"Exp",但跑出来的数据一点不像实验品。

先说最炸裂的数字。在Agents' Last Exam这个专门考Agent综合能力的基准上,V4-Flash-Vision-Exp拿到27.3分,而Opus-4.8是25.7。ZeroBench上也是同样的剧本,35.0对34.0,小模型赢了。别小看这一两个百分点的差距——这是一家以性价比著称的公司,用一个"Flash"级别的轻量模型,在多模态Agent赛道上正面击败了当前公认最强的闭源模型。
视觉增强未牺牲文本性能
更值得注意的是,加了视觉能力之后,文本性能没有掉。这在多模态模型里其实很难做到。很多模型加了图片理解之后,纯文本任务会出现不同程度的退化,就像一个人同时学两门外语,母语水平反而下降了。V4-Flash-Vision-Exp在Terminal Bench、DeepSWE、Toolathlon这些纯文本Agent基准上,成绩和V4-Flash-0731基本持平,DeepSWE甚至从54.4涨到了59.3,Toolathlon从70.3涨到了75.9。加了眼睛,手也变灵了。
低成本视觉编码与Files API设计
这背后的技术逻辑值得拆解。V4-Flash本身就是Flash级别的轻量架构,推理速度快、成本低。在此基础上叠加视觉能力,每张图片最多消耗384个token,定价和纯文本V4-Flash一样。对比那些动辄上千token图片编码的大模型,这个成本控制相当激进。同时上线的Files API还是免费的——上传一次图片,拿到file_id,后续请求直接引用,不用反复传。这对需要处理大量图片的Agent工作流来说,省的不只是钱,还有延迟。

聚焦Agent工作流闭环而非聊天能力
说到Agent工作流,这才是这次发布真正瞄准的战场。纯看聊天能力,多模态大模型早就够用了。但Agent需要的是"看懂图→理解意图→调用工具→完成任务"这条完整链路。V4-Flash-Vision-Exp在ApexBench上从26.2跳到36.5,涨幅接近40%,说明它不只是能看图,而是能把视觉信息有效地融入决策过程。官方演示里,模型分析一张复杂的西藏远征营销长图,从视觉元素到文案意图到营销策略,一气呵成。这种能力放在电商运营、数据分析、自动化办公这些场景里,实用价值远超聊天机器人。
实验版定位与能力边界
当然也要说清楚局限。名字里带"Exp"不是客气,这确实还是实验版。在NL2Repo、DSBench-Hard这些任务上,和顶级闭源模型还有明显差距,Cybergym甚至比上一版微跌。Agent能力的全面提升不是一夜之间的事,但方向已经很清楚了。
我的判断是:V4-Flash-Vision-Exp的意义不在于全面超越谁,而在于证明了一件事——多模态Agent能力的门槛正在被迅速拉低。以前你想要这种级别的视觉理解和Agent协作,要么用顶级闭源模型烧钱,要么等开源社区慢慢追。现在一个Flash级别的模型就能做到,而且API定价没涨。这对整个行业的压力是实打实的:当小模型也能干大模型的活,靠卖算力赚钱的逻辑就要重新算账了。
同期发布的DeepSeek Harness 0.1.1也透露了野心——不只是做模型,还要做Agent开发的基础设施。模型加框架,这是要建生态的意思。
JOTO 企业落地观察
- 轻量多模态Agent模型的出现,使企业无需依赖高成本GPU集群即可部署具备图像理解能力的智能体,显著降低FDE驻场共创中的硬件适配复杂度。
- Files API免费+低token开销的设计,意味着RAG知识工程中非结构化图像资料的接入成本大幅下降,但要求团队重构文档预处理流水线以适配file_id引用机制。
- 视觉能力未导致文本性能退化,说明该类模型在AI安全治理中可减少因多模态引入带来的不可控行为漂移风险,但需额外验证跨模态提示注入攻击面。
- 实验版定位提醒企业:在将此类模型纳入生产级Agent系统前,必须建立针对NL2Repo、DSBench-Hard等硬性任务的专项评估流程,不能仅依赖主流基准分数。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


