DeepSeek Harness 开发者预览版(v0.1)全维度技术解读

深度技术解析 · Agent 基础设施
当行业还在卷模型参数时,DeepSeek 把"模型之外的一切"做成了可插拔的运行时底座

  • 发布日期:2026-08-13
  • 许可协议:MIT
  • 适用对象:Harness 开发者 / 框架爱好者
  • 说明:本文基于 DeepSeek Harness 开发者预览版公开资料整理

目录

  1. 背景:Harness 为什么会成为新战场
  2. 核心定位:Model + Harness = Agent
  3. 整体架构:一切皆插件 + Cordis 元框架
  4. 插件系统深入:服务、事件与动态运行时
  5. 工具调用流水线:一条可扩展的安全链
  6. 四种运行模式:本质是四套插件组合
  7. 多 Agent 编排:Spawn / Fork / Workflow / Ralph
  8. 统一事件流:Append-Only Trajectory 与可观测性
  9. 能力清单与运行方式
  10. 快速上手:安装与启动
  11. 与 V4 Pro 的联动及 API 峰谷定价
  12. 行业意义、优势、挑战与客观评价
  13. 结语:v0.1 只是起点

一、背景:Harness 为什么会成为新战场

过去一两年,围绕 AI Coding 的讨论重心正在发生一次静默的位移:从"模型"转向"Harness"。同一个模型被放进不同的 Agent 系统,最终表现可能相差极大——原因并不复杂:模型只负责预测下一步 token,而 Harness 决定模型能看到什么、能调用哪些工具、如何组织上下文、遇到错误怎么重试、什么时候判断任务已经完成

"Harness(马具 / 挽具)"这个比喻,源自 Anthropic。它指模型之外的整个工程化运行环境——把裸模型"套上缰绳",变成能干活、能执行、能闭环的 Agent。2025 年底至 2026 年初,随着 Claude Code 等产品的出圈,Harness 作为智能体领域的工程基础设施参考框架,引发了全行业的广泛关注,标志着 AI 工程实践从提示词工程 → 上下文工程 → 构建完整智能体运行环境的重大演进。

DeepSeek 于 2026 年组建全新 Harness 团队,资深研究员陈德里曾直言其目标:"简单来说,就是对标 Claude Code,做 DeepSeek Code Harness。"8 月 13 日晚,在 V4 全系列模型上线、并先一步公布 API 调价之后,DeepSeek 正式推出 DeepSeek Harness 开发者预览版(v0.1),并以 MIT 协议开源全部源码,仓库口号直白而极致:

Everything is a Plugin

二、核心定位:Model + Harness = Agent

DeepSeek 用一句话定义了 Harness 在整个智能体体系中的角色:

Model + Harness = Agent
大模型负责思考与推理;Harness 承担模型之外的全部工程化工作——工具调用、任务规划、执行调度、上下文管理、错误重试、完成判定。

它刻意把"模型能力"和"执行环境"解耦。这意味着:

  • 模型是插件,而非底座。 在 DSH 中,大模型只是可被替换的一个组件,你可以把它换成 DeepSeek 自家模型,也可以换成其它厂商的模型(架构层面预留了双 LLM 适配器的能力接缝,见 ADR 0010)。
  • Harness 是产品化的着力点。 DeepSeek 不再只是"对外输出可调用的模型",而是切入模型之上的开发者生态入口,与 Claude Code、Codex、Claude Cowork 正面竞争。
  • 面向 Harness 开发者,而非普通用户。 官方首先邀请的是"能改框架、写插件"的开发者共建生态(DSH = DeepSeek Harness 插件生态),而非只想下载一个客户端直接写代码的终端用户。

三、整体架构:一切皆插件 + Cordis 元框架

DSH 最鲜明的差异化,落在架构开放度上。主流 Coding Agent 普遍支持插件、MCP 或自定义工具,但可扩展边界通常集中在工具层与技能层。DSH 把插件边界进一步下沉到了整个运行时

图:所有 Agent 能力都是 Cordis 插件,由配置层自由组合

支撑这套设计的是 Cordis 插件元框架(仓库中 vendored 的版本为 cordis 4.0.1)。它的职责被刻意压到最薄——只处理插件的加载、卸载与依赖关系。具体的 Agent 能力则全部由不同的 Cordis 插件提供,插件之间通过服务(Service)事件(Event)彼此协作,再由配置层决定它们如何组合。

整个项目是一个典型的 pnpm monorepo

  • packages/:声明了 221 个公开发布包
  • apps/:存放 dsh 命令行
  • native/:提供原生沙箱(如 landlock-run
  • docs/:含架构文档与 ADR(架构决策记录)
  • examples/:提供 acp-agentcoding-agent 等示例

四、插件系统深入:服务、事件与动态运行时

4.1 服务与事件:插件之间如何协作

Cordis 的协作模型非常经典:

  • Service(服务):插件可以向运行时注册可被发现的能力,其它插件通过依赖注入获取并使用它(例如一个"文件系统服务"可被"代码编辑工具插件"消费)。
  • Event(事件):插件通过订阅/发布事件来解耦交互(例如"工具执行完成"事件可触发"记录插件"与"UI 渲染插件")。
  • 配置层组合:开发者无需改动 Harness 源码,只需改配置就能选择加载哪些插件、它们如何协作。这正是"一切皆插件"能落地的关键。

4.2 动态运行时与"创造模式"

从仓库提交记录可以看到 feat(self-modification): add dynamic Cordis plugin runtime and UI——DSH 支持动态 Cordis 插件运行时。配合"创造模式",Agent 可以:

  • 检查当前运行时状态;
  • 在内存中试验、临时装载 Cordis 插件;
  • 据此组合并创作新的运行模式

这意味着 Harness 的"配置"本身也开始成为 Agent 可以操作的对象——运行时的可组合性被同时交给了模型、配置文件、框架开发者三方。虽然距离"Agent 自己改造自己的 Harness"仍需代码与真实任务验证,但这已经把可定制边界推到了行业最前沿。

4.3 可替换范围一览

可替换范围从"某个搜索工具或 MCP Server",一路延伸到:

模型 工具 技能 会话 沙箱 存储 Agent Loop(循环) 调度 UI

甚至连 Claude Code、Codex 或支持 ACP(Agent Client Protocol) 的外部 Agent,都可以接到同一个"子 Agent 接口"后面——这套设计的架构有新意,但编排范式本身并不算突破(见第七节)。


五、工具调用流水线:一条可扩展的安全链

DSH 把"工具调用"拆成了一条可插拔的流水线,这是它区别于"功能固定的 Coding Agent"的关键工程细节:

图:工具调用流水线(请求前 / 请求后均可插入插件)

  • 执行前:Hook → 审批 → 权限检查 → 沙箱 → 超时控制。每一步都是可挂插件的关卡,安全、审计、权限都是一等公民而非写死在框架里。
  • 执行后:结果改写(rewrite)→ 记录(log)→ UI 渲染。开发者无需修改工具或 Agent Loop,即可在各个环节插入插件。
  • PTC 同样受约束:普通工具调用与程序化工具调用(PTC)入口不同,但共享同一套安全与观测机制。PTC 模式下模型生成的代码及其子调用,照样不能绕过审批与沙箱。

这使得 DSH 更像一套可组装的 Agent 运行时底座,而非一个功能固定的产品。


六、四种运行模式:本质是四套插件组合

一个关键澄清:四种模式没有分别维护四套系统,主要差异来自默认加载的插件集合。基于同一套底座,它们只是不同的"配置预设":

模式 默认插件组合 典型用途
标准模式 完整工具组合 常规 Agent 任务,开箱即用的通用开发
PTC 模式(Programmatic Tool Calling) 支持模型生成代码编排多轮工具链 把多轮工具调用"编译"成一段代码统一执行,适合复杂编排
极简模式 仅保留 shell + 文件编辑 两个工具 最小环境下做模型能力基准测试,排除其它组件干扰
创造模式 可检查运行时、内存中试验插件、创作新模式 插件开发、动态组合、自定义运行模式(最值得关注)

其中最值得玩味的是创造模式:传统 Harness 的运行方式通常由产品开发者预先写定,用户只能在既有配置里选。创造模式则让 Agent 直接理解自己所处的运行时,再按任务需要试装插件、组合能力——配置本身成了 Agent 的操作对象。


七、多 Agent 编排:Spawn / Fork / Workflow / Ralph

DSH 已内置一套相对完整的多 Agent 系统,父 Agent 与子 Agent 之间有多种协作原语:

  • Spawn:启动一个拥有全新上下文的子 Agent(干净起步)。
  • Fork:让子 Agent继承已有会话(沿用历史上下文后继续分支)。
  • Workflow 工具:模型可现场编写 JavaScript,用 parallel 组织并行任务、用 pipeline 组织流水线任务。
  • Ralph 模式:让多个全新 Agent 按轮次接力(Ralph Loop)完成复杂任务。

放进常见的五种编排范式看,DSH 最接近层级式 Supervisor–Worker:父 Agent 负责拆解、分配、汇总,子 Agent 负责执行。更准确地说,它是以层级式为主、兼容并行 / 流水线 / Ralph 循环的混合系统

它也明确还不是真正的 Swarm——任务分配与控制权集中在父 Agent 手中,缺少 Agent 间的自主发现、协商、竞争与动态接管机制。

客观评价:Spawn、Fork、Pipeline、Ralph Loop 都已有成熟先例,编排范式本身没有突破。真正特别的是——它把这些编排方式做成了可随配置替换的插件,甚至能把 Claude Code / Codex / 支持 ACP 的外部 Agent 接到同一子 Agent 接口后。架构有新意,范式无颠覆;放在开源 Harness 中已相当先进,但不宜宣传成"全新多 Agent 架构"。


八、统一事件流:Append-Only Trajectory 与可观测性

DSH 另一个核心设计,是仅追加(append-only)的会话日志 / 事件流(Trajectory)。模型看到的所有内容,都会进入同一份事件流,包括:

  • 系统提示词、推理内容(thinking)
  • 工具调用及其结果
  • 子 Agent 调度
  • 每一次上下文注入

开发者可以在 Trajectory 视图中按来源逐条检查这些信息;会话的恢复、分叉、检索与回放,也都建立在同一份事件流之上。

为什么这很重要:它首先解决可观测性——Agent 任务失败时,问题可能出在模型判断、工具返回、上下文注入、调度策略或系统提示词。若这些内容散落各处,开发者很难还原模型当时究竟"看到了什么"。统一事件流给调试、评估、回放提供了一份共同底稿。

它也为会话分叉提供了更自然的数据结构:新分支沿用分叉点之前的事件,再追加新上下文与行动,无需覆写原历史。对于一个强调插件可替换的系统,这点尤其关键——开发者可以比较"不同的 Loop / 工具 / 调度插件"在同一任务轨迹上的表现差异。


九、能力清单与运行方式

当前预览版已支持的能力:

  • 项目管理、长任务协作、多 Agent 编排
  • 上下文管理、联网搜索、Skill(自定义技能)调用
  • 运行方式覆盖 Web UI / TUI / Headless(无界面)
  • 代码场景闭环:进代码库 → 找文件 → 改代码 → 跑测试 → 按报错继续修正

与执行环境的连接层: 可接入文件系统、终端、网页、代码工具及其它智能体,统一处理上下文管理、工具调用与任务执行,让模型"不止于生成回答,而是能完成连续操作"。这也被视为 DeepSeek 补齐 "Vibe Coding" 入口的关键一步。


十、快速上手:安装与启动

在已安装 Node.js 开发工具链的系统中,最快捷的方式是一键启动 Web UI:

# 方式一:npx 一键启动 Web UI
npx @deepseek-ai/dsh web

# 方式二:从 GitHub 拉取完整 monorepo
git clone https://github.com/deepseek-ai/deepseek-harness
cd deepseek-harness
# 仓库使用 pnpm-workspace,含 packages / apps / native / docs / examples 等

仓库采用 pnpm 包管理、TypeScript 为主(Python 部分亦用 MIT),测试基于 Vitest,Lint 用 Oxlint。公开发布的 dsh 家族已声明 publishConfig.access: public,核心包(含 vendored cordis 4.0.1、landland-run 沙箱等)均已开放。

注意(v0.1 阶段):这是早期预览版,核心插件与基础接口会快速变化。现在进入生态的开发者需承受较高的迁移成本;建议以"试用 + 学习架构"为主,谨慎用于生产。


十一、与 V4 Pro 的联动及 API 峰谷定价

DSH 的发布紧随 DeepSeek-V4-Pro-0813 正式版上线。该模型要点:

  • MoE 混合专家架构,总参数约 1.6 万亿,推理时仅激活约 490 亿
  • 100 万 token 上下文窗口,最大输出 38.4 万 token
  • 支持思考 / 非思考模式,兼容多种主流 API 接口
  • 权重基于 MIT 开放,普通通用算力卡即可本地部署,降低政企私有化门槛
  • 多项 Agent / 编程评测逼近甚至超越 Claude Fable 5

同时 DeepSeek 宣布 API 峰谷定价(空闲时段价格为高峰时段的一半):

时段 时间(北京时间) 价格系数
高峰时段 9:00–12:00、14:00–18:00 基准价
空闲时段 其余时间 高峰价 × 0.5

新价格自 2026-08-17 00:00 起生效,旗舰模型输出价格涨幅较大(有报道称约 +350%)。行业整体正从价格战转向"以模型能力为核心"的智力竞争阶段。


十二、行业意义、优势、挑战与客观评价

12.1 优势

  • 架构极致开放:MIT + 全栈开源,把模型 / 工具 / Loop / 调度 / UI 全部放进可组合框架,降低对 Claude Code 类海外工具的依赖。
  • 可替换边界最深:从工具到 Agent Loop 都能换,为记忆压缩、冲突清理、路径复用、Plan 校验等"局部创新"预留了试验空间。
  • 工程细节扎实:工具调用流水线、统一事件流、动态插件运行时等设计在开源 Harness 中已属先进。

12.2 挑战

  • 接口与稳定性:插件边界越深,接口稳定性、依赖管理、版本兼容、性能开销、调试复杂度越难控制;v0.1 阶段迁移成本高。
  • "什么都能换"≠"更好用":最终效果取决于官方是否提供高质量默认插件、稳定组合范式、可信评测,以及第三方是否愿意持续共建。
  • 短期难替代 Claude Code:仅凭 0.1 预览版,业内普遍认为短期内完全替代并不现实。

12.3 专家视角:差异先押在架构开放

有业内专家指出:工具调用、记忆管理、任务规划等"大方向"已基本确定,未来大量创新发生在局部环节。例如记忆需要压缩与冲突清理;规划可复用已有路径,并增加一层"编译式"结构化校验(检查异常分支是否完整、是否含不可执行操作、是否越权)。DeepSeek "一切皆插件"的价值,正在于为这些局部能力预留替换、组合、持续试验的空间。


十三、结语:v0.1 只是起点

DeepSeek Harness 用一句 Everything is a Plugin 给出了自己的 Harness 答案:把模型之外的运行时彻底插件化,用 Cordis 元框架做最薄的调度层,再用配置把一切组合起来。它不一定是范式级的编排突破,但在架构开放度上确实押下了行业最激进的一注。

接下来真正值得观察的,是"一切皆插件"能否沉淀出一套足够稳定的开发标准,以及它最终会长成 DeepSeek 自己的 Coding 产品,还是成为更多 Agent 产品共同采用的底层 Harness。对开发者而言,v0.1 是参与共建 DSH 插件生态、提前理解下一代 Agent 运行时的最佳窗口。

一句话总结:DeepSeek Harness v0.1 是 DeepSeek 用"Cordis 插件系统 + 一切皆插件"打造的 MIT 开源智能体运行框架,把模型、工具、循环、UI 都变成可替换插件,以 Model + Harness = Agent 对标 Claude Code / Codex——能力雏形已具,生态仍待共建。


参考与说明

本文基于 DeepSeek Harness 开发者预览版(v0.1,2026-08-13 发布)的公开资料整理,包括 DeepSeek 官方公告、InfoQ 技术解读及 GitHub 仓库结构。技术细节以官方仓库 github.com/deepseek-ai/deepseek-harnessdocs/ 文档为准,预览版接口可能快速变化,请以最新源码为准。

标签:#DeepSeek #Harness #Agent #Cordis #智能体框架 #MIT开源 #ClaudeCode对标

从模型到产品:把 Agent 真正做成可用系统,需要哪几层工程?

评论

0
请遵守社区规范,文明评论。含违禁词的内容将进入审核队列。
0/2000

文章目录

    文章目录