DeepSeekHarness多模态重磅升级

8月13日正式公测开源,短短一周时间,DeepSeekHarness就完成一轮重量级版本更新。rc.8版本深夜上线,一口气带来14项调整,把大家呼声最高的多模态能力正式落地。

不同于市面上多数Agent直接依赖大模型原生视觉,这一套框架玩出了不一样思路:支持原生图文输入的同时,还给纯文本模型搭了一套工具层“眼睛”。加上子代理体系进一步扩容、Windows终端体验优化、大量线上bug修复,公测才几天的项目,正在高速补齐实战需要的各项能力。GitHub社区热度持续走高,海内外开发者第一时间上手测试,讨论也在快速发酵。虽然依旧处在早期预览版本,但这套“一切皆插件”的Agent底座,已经能看到不一样的发展方向。
一、rc.8重磅更新,多模态正式走进Agent工作流
这次rc.8版本最直观的变化,就是多模态输入能力补齐。
在此之前,DeepSeekHarness的任务大多围绕文本、代码、工具调用来展开。现在开启模型适配器配置之后,原生图片请求正式生效。用户上传截图、照片,/goal、/plan这类规划指令,都可以直接接收图文混合内容,图片直接变成任务上下文的一部分。
交互层面也做了贴心升级,输入框@菜单新增本地文件、历史会话引用。做任务的时候,不用复制粘贴大段内容,可以直接调取本地文档,或是把之前的对话会话拉入当前任务,省去来回切换复制的麻烦。
子代理体系同样迎来扩充,ClaudeCode、Codex可以作为独立配置包按需安装。其中Codex支持非交互权限模式,还能够同时运行多个实例,同一个任务里面,可以同时配置多个不同定位的Codex子代理分头干活,分工处理复杂任务。
Windows平台用户这次收获不小。PTY终端加入持久化PowerShell会话,极简模式默认开启。过去每执行一次命令就要重建终端环境,反复初始化拖慢速度,现在会话可以持续保留,命令执行更加流畅稳定。
除新功能之外,官方集中修复了公测暴露的一批实际使用故障。比如单张图片过大、历史会话堆积大量图片,导致请求直接失败的问题;取消流式生成之后,回复内容没有带入下一轮对话、会话分叉丢失上下文;自定义OpenAI兼容网关格式不匹配、推理内容回传缺失等痛点,在新版本中全部得到修正。另外web_search支持并发查询,子代理完成任务可以主动唤醒父任务,大型会话分叉、SQLite存储读写性能,也做了一轮优化提升。

二、不用多模态大模型,工具拼凑出一套“视觉”
这次更新最有意思的地方,不是直接支持图片输入,而是开发者实测扒出来的隐藏逻辑:就算底座模型本身完全不具备看图能力,Harness依旧有办法处理图片。
测试过程中,如果调用纯文本模型直接读取图片,第一次请求会直接报错失败。但任务不会就此终止,框架会自动切换一套备用工具链。先后调用OCR识别图片文字,统计图片颜色占比,扫描像素行列信息,读取图片尺寸、色彩模式等元数据。
一张截图会被拆解成多份结构化信息:识别出来的文字和坐标位置、背景颜色比例、局部像素变化、图片基础参数。整套信息整理完毕,再全部交给文本大模型,依靠这些拆解后的素材,推理还原图片大致内容。
这套方案和原生多模态模型有本质差距。面对PPT截图、软件界面、流程图,文字信息充足,它可以输出靠谱结果。可碰到真实照片、复杂空间画面,像素与OCR能提取的信息有限,还原效果会明显下降。
有意思的是,在官方正式上线这套能力之前,社区已经涌现一大批第三方视觉插件。dsh‑vision、dsh‑auto‑vision等各种方案百花齐放,有的靠OCR加像素解析,有的拉起独立视觉子代理,还有开发者做路由,把图片转发给多模态模型处理再回传结果。rc.8更新之后,原生多模态和这套工具视觉方案可以互相配合,开发者有两套路径可以自由选择。

这也体现Harness的设计思想:能力不一定全部压在大模型身上,工具链同样可以承担感知任务,不用为了视觉能力强行更换底座模型。
三、一周极速迭代,插件架构驱动快速成长
从8月13日v0.1公测开源算起,短短不到一周,从rc系列版本一路迭代到rc.8,更新节奏十分激进。背后是DeepSeekHarness最核心的设计理念——一切皆插件。
模型适配器、工具集、任务调度、子代理、存储、沙箱环境,甚至界面UI,全部被拆成可插拔组件。不需要改动底层核心代码,通过插件就可以替换、新增任意模块。别的Agent框架经常把模型、调度逻辑写死在代码内部,换一套模型就要大改源码;在Harness中,切换模型、接入第三方子代理,大多只需要调整配置文件即可完成。
rc.8版本就是这套理念的最好体现。多模态能力不强制绑定自家模型,原生视觉模型可以直接喂图;没有视觉能力,工具插件补上看图能力;想要ClaudeCode、Codex干活,直接当作子代理插件安装启用,不用重构整个任务流程。复杂任务被拆解,一部分交给底座大模型,一部分交给子代理,一部分交给工具,多方协作完成目标。
高速迭代的另一面,项目依旧处于早期阶段。社区生态火热,GitHub上相关插件仓库数量暴涨,但是第三方插件质量参差不齐,偶尔会出现版本不兼容,加载插件之后系统报错崩溃的情况,更适合有基础的开发者折腾,普通用户体验还有不小提升空间。不少海外行业开发者也关注到这个项目,Flask框架作者公开表示,Harness带来新的思路,促使团队重新审视自身Agent架构方案。

四、拆解重组模型能力,Agent框架开启新赛道
大模型竞争走到今天,单纯比拼底座参数的时代已经过去,Agent运行框架,正在成为新的角逐场。DeepSeekHarness这一轮更新,不只是简单加上图片识别功能,更在验证一套新思路:不把所有能力全部寄托在单一大模型身上,通过插件、工具、子代理,把感知、规划、执行能力拆开重组。
原生多模态模型可以直接处理图片;纯文本模型依靠OCR、像素分析,也能拿到部分视觉信息;各家的编码Agent,都可以接入进来协同工作。
当然现阶段rc.8依旧是预发布版本,还有不少打磨空间。图片解析的上限、第三方插件稳定性、普通用户上手门槛,都是接下来需要解决的现实问题。
接下来值得观察的,就是这套“赛博乐高”式的开源框架,能不能继续接入更多模型与工具,把复杂多Agent任务跑得更加稳定。当模型可以随意替换,工具能力自由拼装,未来的AI智能体,或许会跳出单一模型的束缚,走向更加灵活的组合模式。
更多推荐




所有评论(0)