2026 年 9 月,终端里同时开着三套 AI Coding Agent 已经是常态。Pi 是 2025 年 8 月起步的 MIT 开源套件,作者 Mario Zechner;Claude Code 是 Anthropic 的官方终端 Agent;Codex CLI 是 OpenAI 的官方套件,默认走 GPT-5.6 的 Sol / Terra / Luna。三者都能改文件、跑命令、对着测试修 Bug。很多人还在比「哪个模型更强」。真正该比的是套件:它往模型里塞多少固定上下文、默许什么权限、能不能换模型、账单是按订阅还是按完成一条任务算。本文不复述公开榜单,只回答选型:代码生成、修 Bug、Token 消耗、模型支持和开发成本,该怎么拆开选。
为什么 2026 年还在比模型,就已经选错了
旧方式和新方式的冲突很具体。旧方式是模型优先:先锁 Opus、GPT-5.6 或本地权重,再随手套一个 CLI。新方式是套件优先:先决定你要极简可审计、开箱带守卫,还是默认隔离并绑在一家供应商。同一条「把失败测试修绿」的指令,套件决定了每轮送进模型的字节、子 Agent 会不会把系统提示再加载一遍、以及写文件前会不会停下来问你。
这件事现在才变成排期优先级,有三个原因。第一,2026 年中开始出现把「同一模型换套件」做成内部评测的做法:公开 SWE-Bench / Terminal-Bench 容易被训练数据污染,工程团队改用自己已合并、带测试的变更当考题。第二,订阅和 API 账单已经分叉——Claude Code 的席位像保险,Pi 的优势只在你本来就按量付费时成立。第三,权限默认值差一个数量级:Pi 跟启动用户同权,Claude Code 默认先问,Codex 更偏向沙箱和策略。继续只比模型分数,会把账单和事故一起买回来。
本机税也要单独记账。推理可以在云端,CLI、编辑器、LSP、浏览器和 Docker 仍吃统一内存。内存档位怎么选,见 M6 Mac mini 内存指南;节点适不适合常驻 Agent,见 M6 Mac mini 是否适合开发者。
Pi、Claude Code、Codex 怎么分类
把三个名字摊平并列,选型一定乱。按套件厚度分成三类,缺一类就只剩口碑。
| 类型 | 代表 | 你得到什么 | 你必须自己补什么 |
|---|---|---|---|
| 极简可扩展 | Pi | 读 / 写 / 改 / 跑命令,系统提示很薄,模型可换 | 计划模式、子 Agent、MCP、权限弹窗、沙箱 |
| 开箱守卫 | Claude Code | 计划、子 Agent、MCP、权限模式、检查点、多端入口 | 换供应商的自由,以及按完成任务控 Token |
| 默认隔离 | Codex CLI | 计划模式、策略一致的沙箱、ChatGPT / Codex Web 同一账号 | 模型中立;默认产品线绑在 OpenAI |
Pi 的核心很小:一个编码 Agent CLI、一套多供应商调用、一个 TUI。社区逆向过厚套件的请求体——系统提示可以到两万 Token 量级,再加一大串工具定义。Pi 把自己压到约一千 Token 和四个内置工具。省下的不只是钱:每轮少送的内容不再占模型注意力。代价也写在文档里:没有内置计划模式、子 Agent 管理、后台 bash、权限弹窗、MCP 客户端和待办系统。那些是扩展或外部编排的事。
Claude Code 走相反的路。它把「模糊需求时该先看哪、改之前先跑什么、何时停下来问人」写进套件。对还不会写 AGENTS.md 的人,这是保险,不是浪费。订阅路径和 API 路径不要混为一谈,席位怎么拆见 Claude Code 个人月成本。
Codex 的卖点不是「又一个能改文件的 CLI」,而是默认遏制和 OpenAI 产品门在同一套账号里:CLI、IDE 扩展、Codex Web、桌面端。模型档位从高难度的 Sol 到高吞吐的 Luna,适合已经把工作流锁在 ChatGPT / Codex 的团队。协议层的工具循环怎么设计,见 Function Calling 是什么;旗舰模型的上下文和 Computer Use 边界,见 GPT-6 Astra 解析。
核心对比:入口、执行、上下文、人群
真正差异在于入口,而不是模型谁更强。三张牌必须用同一套列名,才能做决定。
| 工具 | 入口 | 执行能力 | 上下文 | 适合人群 |
|---|---|---|---|---|
| Pi | 终端 CLI / TUI,可接多家模型 | 读、写、改、bash;其余靠扩展或你自己编排 | 薄系统提示,每轮少送文件;仓库规范靠你写进仓库 | 需求写得清、按量付费、要换模型或本地权重的人 |
| Claude Code | 终端、VS Code / JetBrains、桌面、浏览器 | 改仓库、跑命令、开计划、拆子 Agent、接 MCP | 厚系统提示 + 工具目录,模糊任务有回退规则 | 要开箱守卫、已有订阅、提示词还不稳定的人 |
| Codex | CLI、IDE 扩展、Codex Web、桌面 | 改仓库、跑命令、计划模式、偏沙箱的策略执行 | OpenAI 产品线上下文与会话;默认模型在 GPT-5.6 档 | 已在 OpenAI 生态、要默认隔离和同一套账号的人 |
第二张表只补成本和权限,列名仍然对齐,避免散文式空评。
| 工具 | 入口 | 执行能力 | 上下文 | 适合人群 |
|---|---|---|---|---|
| Pi 的账单与权限 | 自带 API Key / 网关 | 无内置权限弹窗,跟启动用户同权 | Token 主要花在任务本身 | 愿意自己套容器、按完成任务核算的人 |
| Claude Code 的账单与权限 | 订阅席位或 API | 默认拒绝高风险动作,多种权限模式 | 固定提示词每轮都在,缓存只能减价不能减注意力 | 要可预期月费、不能少确认框的人 |
| Codex 的账单与权限 | ChatGPT / API / 云端 Agent | 默认遏制更强,策略更一致 | 和 OpenAI 会话、云端评审绑在一起 | 安全默认值优先、不打算换供应商的人 |
代码生成、修 Bug、Token:怎么测才算数
不要用公开练习题当验收。练习题的答案在网上,模型可能见过。用你们仓库里已经合并、带测试、不是机器人提交的变更:一道生成(按现有模块补一个接口),一道已知失败测试,一道不知道文件在哪的回归。评分只看编译和原测试绿,不要再让另一个模型当裁判。
# Same failing test, three CLIs — do not paste keys into the prompt pi --model anthropic/claude-opus-4-8 \ "Fix the failing test in auth_test.py and keep the public API stable." claude "Fix the failing test in auth_test.py and keep the public API stable." codex "Fix the failing test in auth_test.py and keep the public API stable." # After the run, record: tokens in/out, wall time, test pass/fail, files touched
代码生成上,界面改名、按现有模式填模块、补样板,Pi 通常更便宜:需求已经写清,厚套件那两万 Token 的回退规则你用不上,等于付两遍说明书。模糊需求——「这里有点慢,你看一下」——Claude Code 或 Codex 更稳,因为套件会替你补「先读哪些文件、改之前跑什么」。
修 Bug 也按位置是否已知切开。测试名和失败断言已经指到函数,Pi 够用。故障只表现为「偶发 500」或「某国家支付失败」,先用厚套件做探索,锁定文件后再把机械补丁交给 Pi。把探索和填写绑在同一套「最强模型 + 最高 effort」上,账单会先炸。
Token 不要只看每百万标价。内部成对评测里反复出现同一句话:同一模型、同一任务,Pi 每轮送进模型的内容大约是厚套件的三分之一;任务越长、改的文件越多,差距越滚。有团队在 Opus 高 effort 上看到:官方套件单任务约两美元量级,Pi 约一半,完成率只差两个点。把 effort 拧到最高档时,Pi「尽量少送」的策略可能跟不上模型自己的长推理,完成率会掉——所以验收必须带 effort 档,不能只跑一档就下结论。
还有一个容易漏的坑:子任务。厚套件把活交给子 Agent 时,每个子 Agent 往往从零再加载完整系统提示和工具定义。有记录显示,直接做约 12 万 Token 的任务,拆成两个子 Agent 可以变成 50 万以上。省下来的「并行」可能是四倍账单。订阅用户切换到 Pi 还要另付 API,半价只在你本来就按量付费时成立。
场景怎么选
| 如果你是 | 就选 | 理由 |
|---|---|---|
| 需求能写到文件、行为、边界条件,仓库有 AGENTS.md | Pi 为主 | 厚套件的说明书你已经自己写过了 |
| 提示词经常是一句「帮我修」,项目几乎没给 Agent 的文档 | Claude Code | 你买的是回退规则,不是多余功能 |
| 账号已经在 ChatGPT / Codex,安全默认值优先 | Codex | 隔离和同一套账号比模型中立更值钱 |
| 要在同一 CLI 切 Claude、GPT、Gemini 或本地模型 | Pi | 另外两套默认绑自家模型 |
| 机械改接口和模糊探 Bug 各占一半 | 并存:Pi + Claude Code 或 Codex | 按任务分流,不要互斥 |
| 企业仓库、生产密钥、审计要求写进制度 | Codex 或 Claude Code,外加远程节点;Pi 只进容器 | 默认同权不是优惠,是风险 |
推荐组合
A — 独立开发者、API 按量: Pi 做主路径。仓库根目录放一份给 Agent 读的规范:目录、测试命令、禁止改的路径。effort 先用高档而不是最高档。本机只跑只读探查;写文件和 bash 放到容器,或放到按会话隔离的远程 Mac。月费对照把 API 账单和节点租金放同一张表,定价见 Mac mini 定价。
B — 小型产品团队、已有 Claude 订阅: Claude Code 处理探索、计划和需要 MCP 的连通;接口改名、按模式填模块、测试已红的修补交给 Pi。两套并存一周,用同一三道样本任务比 Token 和返工,再定主路径。不要为了「统一工具」强行停掉更便宜的那条。
C — 企业或高安全: 日常开发用 Codex 或 Claude Code 的权限模式;Pi 只出现在已审计的镜像里,网络和密钥按任务签发。写磁盘、开浏览器、碰生产副本的会话,放到可销毁的远程 Mac,不要和办公本机混用。账号与交付边界见 帮助中心。
常见误区
- 按模型选套件: 「我们用 Opus,所以必须用官方 CLI」。同一模型换套件,完成率和单任务成本都会动。
- 用每百万 Token 标价当开发成本: 便宜模型可能多烧轮次;厚提示词即使命中缓存,仍占注意力。
- 把 Pi 的默认同权当成省事: 没有弹窗不等于安全。不熟悉的仓库和密钥先沙箱。
- 所有任务拧到最高 effort: 极简套件在最高档可能落后。验收必须带档位,不能只跑一档。
- 为了并行随便拆子 Agent: 每个子 Agent 可能重新加载整份系统提示,账单先于速度爆炸。
落地步骤:7 步
- 从本仓库挑三道样本:按现有模式生成一段代码、修一条已红测试、定位一处文件不明的回归。删掉「帮我优化一下」这种无法判分的空任务。
- 同一模型分别用 Pi 和官方套件跑这三道题。记下输入 / 输出 Token、墙钟时间、测试是否绿、改了哪些文件。禁止 Agent 去翻能泄露答案的 git 历史。
- 把任务分成机械填写和模糊探索。前者默认 Pi,后者默认 Claude Code 或 Codex。比例写进团队约定,不要每次现场拍板。
- 写清计费路径。订阅用户不要用「半价 Token」当切换理由,除非已经在付 API。按量用户用「完成一条带测试的任务多少钱」做表,不用标价。
- 给 Pi 选一种隔离:本地容器、微型虚拟机,或远程 Mac 节点。给厚套件核对应权限模式和允许的 MCP。密钥不进提示词、不进截图。
- 按场景选主套件,允许叠加。独立开发者可以 Pi 为主;小团队可以 Claude Code 探索 + Pi 填写;企业把写操作锁在已审计入口。
- 把执行放到可复现的 Mac 节点:同一镜像、同一测试命令、会话结束能清工作区。本机缓存冒充通过,不算验收。
FAQ
Pi、Claude Code 和 Codex 哪个模型更强?
问题问错了。2026 年 9 月三套都能接上一代旗舰模型;同一模型换套件,完成率和账单都会变。先比套件怎么投喂上下文、怎么拦权限、能不能换供应商。
订阅 Claude Code 还要不要装 Pi?
要,如果你已经在付 API 或有大量机械改动。订阅覆盖的是厚套件的保险;机械填写、换模型、控 Token 仍适合 Pi。两套可以并存一周再决定主路径。
Codex 是不是只能用 OpenAI 模型?
默认产品线绑在 GPT-5.6 的 Sol / Terra / Luna。它的优势是隔离策略和 ChatGPT / Codex Web 同一套账号。若你要在同一 CLI 里切 Claude、Gemini 或本地模型,选 Pi。
Token 更便宜是否等于开发成本更低?
不等于。要比「完成一条带测试的任务花多少钱」,不要只看每百万 Token 标价。便宜模型可能多烧轮次;厚套件的固定提示词即使命中缓存,仍占模型注意力。
Pi 没有权限弹窗,能直接在本机跑吗?
能跑,但不建议对不熟悉的仓库或生产密钥这么做。Pi 文档写明默认跟启动用户同权。先放进容器或远程 Mac 节点,再打开写文件和 bash。
总结
2026 年选 AI Coding Agent,不要再把模型排行榜当成购物车。先按套件厚度选入口:需求写得清、要控 Token 和换模型,用 Pi;提示词还不稳、要守卫和计划,用 Claude Code;已经在 OpenAI 生态、要默认隔离,用 Codex。 代码生成和修 Bug 按「位置是否已知」分流,账单按完成任务算,权限按默认值而不是按口碑设。按 7 步把样本任务、档位和可复现节点写进验收。远程节点从 租用页 和 定价页 查看,账户问题走 帮助中心。