
作者丨高允毅
编辑丨岑 峰
昨晚,DeepSeek V4 Pro 正式发布,性能全面逼近 Fable 5 ,价格却只有 1/57 ,再次坐实了 " 智价比之王 " 的美誉。
如果细看官方公布的十项基准测试的话,那些亮眼的数据,其实都表明 DeepSeek 想全面迈向" 工业级 Agent 生产线 ",比如它补齐了软件开发和工程能力短板,在终端报错、工具调用、长程任务都有不错表现。
另一方面,当模型的智力水平已经无限拔高,即将推出的 DeepSeek Harness,正是它补齐 Agent 落地能力的关键后手。
而今天网上爆出一份DeepSeek Harness 内测入选项目局部名单,进一步将 DeepSeek 的发力方向勾勒清晰。

因为很多高星项目做的是通用工具,未必为原生 Harness 设计。而不少小众项目,本身在做 Codex、Claude Code、Pi 插件,可以顺势适配 DeepSeek Harness。
更重要的是,DeepSeek 似乎更关注这些项目能否填补上它的生态空白,比如特殊的 UI、创新编排模式。要有实际的功能,不能是空架子。

首先,整个项目的生态要围绕 Harness 核心能力展开,这主要体现在MCP 插件与 Coding Agent项目占比最高,能解决工具调用与代码落地的核心痛点。
其次,项目还集中在 Agent Runtime(运行时)、编排框架、可视化 UI 与多智能体调度 等 Agent 适配层,直接影响环境跑起来安不安全、长任务容易跑偏、黑盒执行看不见、多模型如何协作等具体问题。
相较而言,医疗、法律、金融等垂直应用项目占比不足 4%。
01
都有哪些入选项目?
这个局部名单中,已经列出了 17 个开源项目,我们选取了其中的 4 个项目,看看都是什么类型的 Harness 工具。
▎安全操作系统 openma-ai(224 颗星)

传统的 Agent 框架大多只负责 " 让模型怎么想 ",管不了 " 代码跑起来安不安全 "。OMA 利用对 Claude Managed Agents 的开源复刻,正好补上了这一块。
首先,它可以通过在网络网关层自动注入凭证,实现了密钥与执行沙箱的全程隔离。这样 AI 干活的时候不知道密码,就不会被 Prompt 注入攻击。同时,OMA 把每步操作都以事件日志形式持久化保存,相当于给任务做了 " 自动存档 ",这样就不怕进程意外中断。它还自带沙箱和企业工具包,在 GitHub、Slack 这些协作平台可以开箱即用,让 Agent 真正变成企业的 " 数字员工 "。
面对如今各种顶尖的大模型大脑,OMA 的作用正是为 Agent 落地 " 保驾护航 "。
从技术定位上看,OMA 瞄准的是 Agent 执行层,负责管理沙箱生命周期、分发 MCP 工具、维护 WebSocket 会话广播,属于典型的执行层基础设施。
https://github.com/openma-ai/open-managed-agents
▎智能路由 role-model(97 颗星)

对于 DeepSeek-R1 而言,无论任务多简单它都倾向于 " 长思考 "。当 Agent 执行自动化流水线时,如果只是让模型去看一眼当前目录的文件列表、或者跑个简单的正则替换,每一步都要烧掉几百个 Token 的推理成本,这显然极不划算。
role-model 可以将任务按难度进行动态拆解。把简单活儿路由给毫秒级响应、极低成本的本地轻量小模型;把架构重构、找出复杂 Bug 的活儿再派给 R1,直接解决成本难题。
它还有 " 决策可解释性 ",它将每一次路由决策都固化为 Requests(请求)、Profiles(画像)、Policy(策略)、Artifacts(产物)四个标准化构件,工程师可以随时调阅 " 为什么这一步派给了模型 A 而不是模型 B"。
除此之外,它原生支持多厂商灾备,一旦主通道遇到限流、延迟抖动,能无缝切换到备用节点,保证整条 Agent 流水线不中断。
可以说,省钱和可控性都是 Agent 落地时的关键细节。它归属于 Agent 适配层的流量编排与调度层面。
https://github.com/try-works/role-model
▎端侧版龙虾 MateBot:(46 颗星)

眼下主流的编程 Agent 大多被绑在本地终端上,而很多长任务的工作需要开发者随时查看 AI 的进度,及时干预。MateBot 的作用类似于 OpenClaw,它让开发者通过手机端就能直接给本地 Agent 派活、实时查看执行日志,遇到卡点或死循环时随时可以介入中断或修正。
除了远程控制,它还有自己的 " 端侧记忆三件套 ",有自动记忆、外部记忆、失败记忆三套系统。它还有本地 " 错题本 ",可以把 Agent 犯的错误记录在知识库,下次直接避开。
对于要走向真实生产环境的 Harness 来说,MateBot 补齐了长周期任务中的人机协同闭环,也解决了模型跨会话反复踩坑的问题,属于补齐执行层工程能力。
https://github.com/aresbit/MateBot
▎多 AI 协作平台 ccteam(141 颗星)
很多开发者手里同时握着好几个编程 Agent,如何让这些 Agent 好好为自己干活,是当下工程化落地的一个关键问题。

在多 Agent 协作中,ccteam 可以让任何一个 Agent 会话都能用自然语言指挥其他 Agent 干活,比如 " 让 Codex 实现这个接口并跑测试,让 Grok 分析性能热点,最后让 Claude Code 交叉 Review"。
与此同时,开发者在 Telegram 或飞书上直接发消息就能调度所有 Agent,不用专门打开某个系统。ccteam 还组成一个集群,无论项目在哪台机器上跑,都能统一查看和管控。
它还会控制预算,钱花完了自动停工,避免 Agent 失控烧钱。
能管 AI 协作、控制进度和预算,这属于 Agent 适配层的多智能体编排调度层。
https://github.com/firstintent/ccteam
02
DeepSeek Harness
究竟在下一盘什么大棋?
在上述项目之外,如果将高频出现的 5 个方向(多模型路由、桌面 Agent、Coding Agent、框架或 SDK、以及 UI 或客户端项目,这些都是的基础设施层的热门方向)拼凑起来,DeepSeek 的战略意图已经呼之欲出:它正开始从 " 最强 API" 向 " 工业级 Agent 生产线 " 转换。
为什么大模型刚进入深水区,DeepSeek 就急着做基础设施?因为 DeepSeek 的 " 大脑 " 已经足够强了。
昨晚发布的 V4 Pro 的代码能力直接挤进全球第一梯队,R1 的长思考深度更是断崖式领先。配合 Context Caching(上下文缓存)带来的极致 Token 成本,理论上,Agent 已经具备了 " 又快又便宜 " 的落地前提。
但" 想得快 " 和" 跑得稳"是另外一回事。仔细剖析这些网传的 DeepSeek Harness 重点扶持项目,可以发现 DeepSeek 正在急切地补齐这几个短板:
▎补齐执行层安全
R1 擅长写代码,但不提供运行环境。直接在企业真实的 Terminal 上跑,一个幻觉引起的 rm -fr 删库跑路幻觉代码,就能把系统搞瘫痪。DeepSeek Harness 扶持 OMA 这类带凭证隔离、沙箱机制和审计日志的底层项目,就是要给这些可能造成破坏的 " 数字野马 " 套上缰绳,让企业可以安心交出业务控制权。
▎补齐工程可靠性
真正的软件工程任务,动辄需要 Agent 循环纠错几个小时,在这期间,网络稍微抖一下、大模型 API 超个时,如果没有持久化存档,整个任务就得从头来。
很多人会有一个严重的技术误区,觉得最新的 DeepSeek V4 Pro 已经具备了 1M 的超长输入窗口 和 384K 的超长输出能力,信息量这么大,是不是就不用管上下文管理了?
恰恰相反,超长输出解决的是 " 一口气能写多少字 " 的空间问题,而持久化解决的是 " 写到一半断了,能否重启接着写 " 的时间问题。DeepSeek Harness 吸收 MateBot 这类具备 " 自动存档 "、" 失败记忆 " 和 " 错题本 " 功能的组件,就是要确保 V4 Pro 在一次性吐出 384K 宏大内容的漫长过程中,拥有中途夭折后随时续传的工程可靠性。
▎补齐商业化 ROI
AI 越用越多,解决的问题越来越复杂,谁来控制成本?如果事事都去触发 R1 的长思考(哪怕 DeepSeek 已经把价格打骨折),或者在多 Agent 协同中产生无效的 " 来回闲聊 ",企业的 Token 账单依然会原地爆炸。
DeepSeek 引入 role-model(按难度智能路由)和 ccteam(多智能体进度与预算控制),正是希望更好分配 AI 算力,把简单的搬砖工作丢给本地小模型,把架构级的问题精准派发给 R1,这是能让 Agent 满足企业成本需求、大规模落地的唯一途径。
总结而言:过去,DeepSeek 靠 V4 Pro 和 R1 证明了自己是顶级的 " 发动机制造商 ";而现在,通过这批不起眼的 " 配件 ",才真正打造了一套完整的 " 汽车底盘 "。让 Agent 安全、可控、用得起,这些正是 DeepSeek Harness 要补的课题。
参考链接:https://x.com/NFT_Chen/status/2087500877238337930
上车,雷峰网带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。