最近研究 AI 编程工具时,我频繁看到两个名字:Pi,以及 DeepSeek Harness。
一开始我以为,它们只是 Claude Code、Codex 之后,又冒出来的两个 Coding Agent。
但仔细研究后,我发现真正值得关注的并不是“又多了两个工具”,而是 AI 编程正在发生一次很重要的变化:
大家开始从比较模型,转向比较 Harness。
理解这一点之后,你会突然明白:为什么同一个模型,放进不同的编程工具里,表现可能完全不一样。
Model、Agent 和 Harness,不是一回事
可以先记住一个简单的比喻:
模型是大脑,Harness 是身体、工具箱和工作流程,Agent 才是最终能够干活的完整系统。

当你对 Codex 说:“帮我重构这个项目的登录流程。”
真正发生的事情远不只是模型生成几段代码。
它需要读取项目、搜索引用、理解目录结构、修改文件、执行命令、运行测试、分析错误,然后继续修复。
决定模型如何完成这些动作的,正是 Harness。
DeepSeek 官方直接给出了一个公式:
Agent = Model + Harness
它把模型、工具、Skills、会话、沙箱、存储、循环、调度和 UI 都视为可以组合的能力。
所以,模型决定的是“它有多聪明”,Harness 决定的是“它如何使用这份聪明”。
Claude Code 和 Codex,其实也有 Harness
很多人容易把 Claude Code 理解成:
Claude 模型 + Terminal
实际上,它背后还有代码搜索、文件编辑、Shell、上下文管理、权限控制、错误恢复、会话管理等一整套机制。
Codex 也是一样。
它们的优势不是只提供一个强模型,而是已经把模型和一套成熟的工作方式打包成了完整产品。
Claude Code 官方将自己定义为能够读取代码库、编辑文件、执行命令并连接开发工具的 Agentic Coding Tool。
Codex CLI 同样是完整的本地 Coding Agent,而且当前已经以 Apache-2.0 协议开源。
它们更像两辆已经调校好的汽车。
你不需要研究发动机、变速箱和底盘,坐进去就能工作。
Pi:把工作方式还给开发者
Pi 的方向不同。
它对自己的定位是:
Minimal terminal coding harness。
Pi 默认给模型提供读取、写入、编辑和 Bash 等基础工具,但不会强行内置复杂的 Subagent 或 Plan Mode。
如果你需要这些能力,可以通过 Extension、Skill、Prompt Template 或 Package 自己添加。
它还提供交互模式、JSON 模式、RPC 和 SDK,可以嵌入其他应用。
所以 Pi 最吸引人的地方,不是它一定比 Claude Code 更聪明,而是它足够可塑。
你可以选择不同模型,接入自己的工具,为 React、Vue、UniApp、测试、Review、Git 提交分别编写 Skill,再按照自己的习惯组织整个 Agent Loop。
Claude Code 更像成品汽车。
Pi 更像一个可以改造成赛车、越野车或者货车的底盘。
DeepSeek Harness:想做的是 Agent 基础设施
DeepSeek Harness 的野心更大。
它采用“一切皆插件”的架构,甚至模型、工具、Skills、会话、沙箱、存储、循环和 UI 都能够替换或重新组合。
官方目前提供四种主要模式:
- Standard:完整 Coding Agent
- Code Mode:让模型用 TypeScript 组合多步工具调用
- Minimal:只保留 Bash 和文件编辑器
- Creator:创建自己的 Agent Preset
这意味着,它的目标不只是做一个编程助手。
你可以基于它构建 Coding Agent、Testing Agent、Research Agent、Review Agent,甚至把多个角色串成一条完整的软件生产流水线。
不过,它目前仍然处于 Developer Preview 阶段。官方明确提醒,核心插件和 API 仍会持续变化,而且可能出现兼容性破坏。
因此,它现在更适合研究和实验,还不适合直接承载稳定的生产工作流。
为什么 Harness 会变得越来越重要?
因为模型能力正在逐渐接近。
接下来真正拉开差距的,很可能不是模型能不能写代码,而是:
- 能不能找到正确文件
- 会不会控制上下文
- 什么时候调用工具
- 出错后如何恢复
- 测试到什么程度停止
- 如何管理长任务
- 如何协调多个 Agent
2026 年的一项预注册研究,在 24 个编码任务、7 个推理模型和两个真实 Harness 上进行了 4644 次有效实验。
研究发现,Harness 不只是界面外壳。不同设计会改变推理、工具调用、测试次数、执行时间和上下文增长;在该实验环境中,Harness 甚至让“每个成功任务的成本”出现了 5 到 30 倍的差异。
这也解释了一个常见现象:
同一个模型,在不同 Coding Agent 里,可能像两个完全不同的程序员。
现在应该放弃 Codex 和 Claude Code 吗?
我的答案很明确:
不应该。
如果你真正需要的是完成项目、修复 Bug、重构代码和交付功能,Codex 与 Claude Code 仍然应该是主力生产工具。
它们已经替你解决了大量 Harness 工程问题。
而 Pi 和 DeepSeek Harness 更适合作为实验工具:
生产环境
├── Codex
└── Claude Code
实验环境
├── Pi
└── DeepSeek Harness

Pi 适合研究如何定制自己的 Coding Agent。
DeepSeek Harness 适合观察插件化 Agent Runtime 会走向哪里。
从使用 AI,到设计 AI 的工作方式
当你开始维护 AGENTS.md、Skills、MCP、权限规则、测试流程和多 Agent 协作时,你其实已经不只是在“使用一个 AI 编程工具”。
你已经开始进行 Harness Engineering。
接下来真正值得思考的问题,可能不再是:
“Claude 和 GPT 哪个更强?”
而是:
“我怎样让不同模型,按照最适合我的方式工作?”
这才是 Pi 和 DeepSeek Harness 带来的真正启发。
你不一定要立刻造一个全新的 Agent,也不必放弃已经成熟的生产工具。
更现实的做法是:
继续用 Codex 和 Claude Code 完成项目,同时用 Pi 理解 Harness,用 DeepSeek Harness 观察 Agent 基础设施的发展。
因为未来真正属于你的竞争力,可能不是你选择了哪个模型。
而是你能否建立一套属于自己的 AI 编程系统。
参考资料
- DeepSeek Harness:https://deepseek.com/harness/en/
- DeepSeek Harness GitHub:https://github.com/deepseek-ai/deepseek-harness
- Pi Coding Agent:https://github.com/badlogic/pi-mono/tree/main/packages/coding-agent
- Codex CLI:https://github.com/openai/codex
- Claude Code 文档:https://code.claude.com/docs/en/overview
- Harness 研究论文:https://arxiv.org/abs/2608.01347
Hotline:
