昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!
DeepSeek Harness于8月20日发布v0.1.0-rc.8版本,共14项更新,重点增强多模态输入能力,支持原生图片请求与图文混合指令;新增OCR、颜色统计、像素扫描等工具层视觉方案,使纯文本模型可间接处理图像;同时扩充Claude Code与Codex子代理支持,并优化Windows终端体验与自定义网关兼容性。
多模态正式补齐,直接“看图”
DeepSeek Harness v0.1.0-rc.8最明显的变化是进一步补齐多模态输入。根据官方更新日志,DeepSeek模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness可以直接把图片送进模型;/goal、/plan等指令也已经支持图文混合输入。
输入框中的@菜单新增文件和会话引用,用户可以直接把本地文件、已有会话等内容拉进当前任务。这意味着,过去主要围绕文本、代码和工具调用展开的Agent工作流,现在可以进一步把截图、图片等视觉信息纳入任务上下文。
子代理体系也继续扩充。新版支持把Claude Code和Codex作为Profile Bundle按需安装。其中,Codex支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同Codex子代理。
Windows用户这次也被重点照顾。DeepSeek Harness的PTY终端加入持久PowerShell会话,并在极简模式预设中默认开启,减少命令执行过程中频繁重建终端环境的问题。
除了新能力,这次更新还集中修掉了一批公测后暴露的问题。比如,当单张图片尺寸过大,或者历史会话中累积图片过多时,此前可能导致模型请求直接失败;新版对此进行了处理。取消一次流式生成后,已经显示出来的回复前缀此前也可能不会被带入下一轮提问或者分叉会话,这一问题目前已经修正。对于使用自定义OpenAI兼容网关的开发者,新版还修复了部分网关因请求格式差异而无法调用,以及推理内容回传缺失的问题。

纯文本模型也能“看图”
DeepSeek Harness补上原生图片请求之外,一个有意思的细节很快被开发者扒了出来。网友Yinsen测试DeepSeek Harness处理图片时发现,当所调用的模型本身没有声明图像输入能力,直接调用read_image会首先失败。
但任务并没有就此停下。从其展示的执行轨迹来看,Harness随后会退化到另一套工具链:先进行OCR文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。
例如,一张包含文字和简单图形的图片,可以被拆成“文字内容及坐标”“背景颜色比例”“特定区域像素变化”“图片尺寸”等多组信息。最后,这些结构化结果会被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据“脑补”出整张图的大致内容。
因此,这种能力和视觉大模型直接理解图片仍然有明显区别。对于PPT截图、流程图、界面截图等结构相对明确的图片,它可以借助OCR和像素特征得到不少有效信息;面对真实照片、复杂空间关系等内容,这种工具链能够恢复的信息则会受到明显限制。
事实上,在官方加强多模态支持之前,DeepSeek Harness社区已经围绕视觉能力出现了一批插件,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通过pi2dsh桥接的pi-vision等。其中一些方案就是通过OCR、像素分析、结构化证据或者独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置input: [text, image],直接接收图片。rc.8上线后,原生多模态模型和这类工具层视觉方案可以进一步配合使用。


上线不到一周加速迭代
8月13日公测时,DeepSeek Harness团队就强调,其核心设计思路是“一切皆插件”:模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合和替换。当Agent Harness拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。
此次rc.8又继续强化了这种插件化思路:视觉模型可以原生接收图片,纯文本模型也能借助视觉工具获得部分图像信息;Claude Code和Codex则可以作为子代理按需装进同一套Harness中。
除了这些核心变化,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务、本地运行dsh web自动打开浏览器等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。

结语:一切皆插件
从8月14日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。接下来值得期待的,是这套插件化Harness能否继续把更多模型、工具和Agent装进同一个体系,并跑出更复杂、更稳定的任务流程。

JOTO 企业落地观察
- 企业部署多模态智能体时,不再必须强依赖视觉大模型底座。DeepSeek Harness通过OCR、像素分析等工具链为纯文本模型补充视觉感知能力,意味着团队可在成本、延迟与精度之间做更灵活取舍:对PPT、流程图等结构化图像任务,可优先采用轻量文本模型+工具链方案,降低GPU资源消耗。
- 这类系统将工具层视觉能力与原生多模态模型并置,实质拓展了RAG知识工程的边界——图像元信息(如尺寸、色彩分布、OCR文本坐标)本身即可作为结构化知识片段注入检索上下文,无需全部转为自然语言描述,有利于提升图文混合检索的准确率与可解释性。
- 当子代理可按需加载(如Claude Code、Codex),且终端、网关、会话等模块均以插件形式解耦,企业AI安全治理面临新挑战:需建立插件级可信评估机制,尤其对OCR、像素扫描等可能接触原始图像数据的工具,须明确其数据驻留策略、内存清理逻辑与跨代理信息泄露风险。
- FDE驻场共创中,此类高度插件化的Agent Harness降低了企业定制门槛:业务方工程师可基于现有文本模型能力,仅通过配置新增视觉工具插件,快速验证图文协同场景可行性,无需等待视觉模型采购或私有化部署完成,缩短POC周期。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


