欢迎来到峰行科技
AI 工具与工作流

Codex、Claude Code、Pi 到底有什么区别?一次讲清 Harness

模型只是大脑,真正决定 AI 如何编程的,是背后的 Harness。

Codex、Claude Code、Pi 到底有什么区别?一次讲清 Harness

最近研究 AI 编程工具时,我频繁看到两个名字:Pi,以及 DeepSeek Harness。

一开始我以为,它们只是 Claude Code、Codex 之后,又冒出来的两个 Coding Agent。

但仔细研究后,我发现真正值得关注的并不是“又多了两个工具”,而是 AI 编程正在发生一次很重要的变化:

大家开始从比较模型,转向比较 Harness。

理解这一点之后,你会突然明白:为什么同一个模型,放进不同的编程工具里,表现可能完全不一样。

Model、Agent 和 Harness,不是一回事

可以先记住一个简单的比喻:

模型是大脑,Harness 是身体、工具箱和工作流程,Agent 才是最终能够干活的完整系统。

当你对 Codex 说:“帮我重构这个项目的登录流程。”

真正发生的事情远不只是模型生成几段代码。

它需要读取项目、搜索引用、理解目录结构、修改文件、执行命令、运行测试、分析错误,然后继续修复。

决定模型如何完成这些动作的,正是 Harness。

DeepSeek 官方直接给出了一个公式:

Agent = Model + Harness

它把模型、工具、Skills、会话、沙箱、存储、循环、调度和 UI 都视为可以组合的能力。

所以,模型决定的是“它有多聪明”,Harness 决定的是“它如何使用这份聪明”。

Claude Code 和 Codex,其实也有 Harness

很多人容易把 Claude Code 理解成:

Claude 模型 + Terminal

实际上,它背后还有代码搜索、文件编辑、Shell、上下文管理、权限控制、错误恢复、会话管理等一整套机制。

Codex 也是一样。

它们的优势不是只提供一个强模型,而是已经把模型和一套成熟的工作方式打包成了完整产品。

Claude Code 官方将自己定义为能够读取代码库、编辑文件、执行命令并连接开发工具的 Agentic Coding Tool。

Codex CLI 同样是完整的本地 Coding Agent,而且当前已经以 Apache-2.0 协议开源。

它们更像两辆已经调校好的汽车。

你不需要研究发动机、变速箱和底盘,坐进去就能工作。

Pi:把工作方式还给开发者

Pi 的方向不同。

它对自己的定位是:

Minimal terminal coding harness。

Pi 默认给模型提供读取、写入、编辑和 Bash 等基础工具,但不会强行内置复杂的 Subagent 或 Plan Mode。

如果你需要这些能力,可以通过 Extension、Skill、Prompt Template 或 Package 自己添加。

它还提供交互模式、JSON 模式、RPC 和 SDK,可以嵌入其他应用。

所以 Pi 最吸引人的地方,不是它一定比 Claude Code 更聪明,而是它足够可塑。

你可以选择不同模型,接入自己的工具,为 React、Vue、UniApp、测试、Review、Git 提交分别编写 Skill,再按照自己的习惯组织整个 Agent Loop。

Claude Code 更像成品汽车。

Pi 更像一个可以改造成赛车、越野车或者货车的底盘。

DeepSeek Harness:想做的是 Agent 基础设施

DeepSeek Harness 的野心更大。

它采用“一切皆插件”的架构,甚至模型、工具、Skills、会话、沙箱、存储、循环和 UI 都能够替换或重新组合。

官方目前提供四种主要模式:

  • Standard:完整 Coding Agent
  • Code Mode:让模型用 TypeScript 组合多步工具调用
  • Minimal:只保留 Bash 和文件编辑器
  • Creator:创建自己的 Agent Preset

这意味着,它的目标不只是做一个编程助手。

你可以基于它构建 Coding Agent、Testing Agent、Research Agent、Review Agent,甚至把多个角色串成一条完整的软件生产流水线。

不过,它目前仍然处于 Developer Preview 阶段。官方明确提醒,核心插件和 API 仍会持续变化,而且可能出现兼容性破坏。

因此,它现在更适合研究和实验,还不适合直接承载稳定的生产工作流。

为什么 Harness 会变得越来越重要?

因为模型能力正在逐渐接近。

接下来真正拉开差距的,很可能不是模型能不能写代码,而是:

  • 能不能找到正确文件
  • 会不会控制上下文
  • 什么时候调用工具
  • 出错后如何恢复
  • 测试到什么程度停止
  • 如何管理长任务
  • 如何协调多个 Agent

2026 年的一项预注册研究,在 24 个编码任务、7 个推理模型和两个真实 Harness 上进行了 4644 次有效实验。

研究发现,Harness 不只是界面外壳。不同设计会改变推理、工具调用、测试次数、执行时间和上下文增长;在该实验环境中,Harness 甚至让“每个成功任务的成本”出现了 5 到 30 倍的差异。

这也解释了一个常见现象:

同一个模型,在不同 Coding Agent 里,可能像两个完全不同的程序员。

现在应该放弃 Codex 和 Claude Code 吗?

我的答案很明确:

不应该。

如果你真正需要的是完成项目、修复 Bug、重构代码和交付功能,Codex 与 Claude Code 仍然应该是主力生产工具。

它们已经替你解决了大量 Harness 工程问题。

而 Pi 和 DeepSeek Harness 更适合作为实验工具:

生产环境
├── Codex
└── Claude Code

实验环境
├── Pi
└── DeepSeek Harness

Pi 适合研究如何定制自己的 Coding Agent。

DeepSeek Harness 适合观察插件化 Agent Runtime 会走向哪里。

从使用 AI,到设计 AI 的工作方式

当你开始维护 AGENTS.md、Skills、MCP、权限规则、测试流程和多 Agent 协作时,你其实已经不只是在“使用一个 AI 编程工具”。

你已经开始进行 Harness Engineering。

接下来真正值得思考的问题,可能不再是:

“Claude 和 GPT 哪个更强?”

而是:

“我怎样让不同模型,按照最适合我的方式工作?”

这才是 Pi 和 DeepSeek Harness 带来的真正启发。

你不一定要立刻造一个全新的 Agent,也不必放弃已经成熟的生产工具。

更现实的做法是:

继续用 Codex 和 Claude Code 完成项目,同时用 Pi 理解 Harness,用 DeepSeek Harness 观察 Agent 基础设施的发展。

因为未来真正属于你的竞争力,可能不是你选择了哪个模型。

而是你能否建立一套属于自己的 AI 编程系统。

参考资料