2026 年 9 月,終端機裡同時開著三套 AI Coding Agent 已經是常態。Pi 是 2025 年 8 月起步的 MIT 開源套件,作者 Mario Zechner;Claude Code 是 Anthropic 的官方終端機 Agent;Codex CLI 是 OpenAI 的官方套件,預設走 GPT-5.6 的 Sol / Terra / Luna。三者都能改檔案、跑指令、對著測試修 Bug。很多人還在比「哪個模型更強」。真正該比的是套件:它往模型裡塞多少固定上下文、默許什麼權限、能不能換模型、帳單是按訂閱還是按完成一條任務算。本文不複述公開榜單,只回答選型:程式碼產生、修 Bug、Token 消耗、模型支援和開發成本,該怎麼拆開選。
為什麼 2026 年還在比模型,就已經選錯了
舊方式和新方式的衝突很具體。舊方式是模型優先:先鎖 Opus、GPT-5.6 或本地權重,再隨手套一個 CLI。新方式是套件優先:先決定你要極簡可稽核、開箱帶守衛,還是預設隔離並綁在一家供應商。同一條「把失敗測試修綠」的指令,套件決定了每輪送進模型的位元組、子 Agent 會不會把系統提示再載入一遍、以及寫檔案前會不會停下來問你。
這件事現在才變成排程優先級,有三個原因。第一,2026 年中開始出現把「同一模型換套件」做成內部評測的做法:公開 SWE-Bench / Terminal-Bench 容易被訓練資料汙染,工程團隊改用自己已合併、帶測試的變更當考題。第二,訂閱和 API 帳單已經分叉——Claude Code 的席位像保險,Pi 的優勢只在你本來就按量計費時成立。第三,權限預設值差一個數量級:Pi 跟啟動使用者同權,Claude Code 預設先問,Codex 更偏向沙箱和策略。繼續只比模型分數,會把帳單和事故一起買回來。
本機稅也要單獨記帳。推論可以在雲端,CLI、編輯器、LSP、瀏覽器和 Docker 仍吃統一記憶體。記憶體檔位怎麼選,見 M6 Mac mini 記憶體指南;節點適不適合常駐 Agent,見 M6 Mac mini 是否適合開發者。
Pi、Claude Code、Codex 怎麼分類
把三個名字攤平並列,選型一定亂。按套件厚度分成三類,缺一類就只剩口碑。
| 類型 | 代表 | 你得到什麼 | 你必須自己補什麼 |
|---|---|---|---|
| 極簡可擴充 | Pi | 讀 / 寫 / 改 / 跑指令,系統提示很薄,模型可換 | 計畫模式、子 Agent、MCP、權限彈窗、沙箱 |
| 開箱守衛 | Claude Code | 計畫、子 Agent、MCP、權限模式、檢查點、多端入口 | 換供應商的自由,以及按完成任務控 Token |
| 預設隔離 | Codex CLI | 計畫模式、策略一致的沙箱、ChatGPT / Codex Web 同一帳號 | 模型中立;預設產品線綁在 OpenAI |
Pi 的核心很小:一個編碼 Agent CLI、一套多供應商呼叫、一個 TUI。社群逆向過厚套件的請求體——系統提示可以到兩萬 Token 量級,再加一大串工具定義。Pi 把自己壓到約一千 Token 和四個內建工具。省下的不只是錢:每輪少送的內容不再占模型注意力。代價也寫在文件裡:沒有內建計畫模式、子 Agent 管理、背景 bash、權限彈窗、MCP 用戶端和待辦系統。那些是擴充或外部編排的事。
Claude Code 走相反的路。它把「模糊需求時該先看哪、改之前先跑什麼、何時停下來問人」寫進套件。對還不會寫 AGENTS.md 的人,這是保險,不是浪費。訂閱路徑和 API 路徑不要混為一談,席位怎麼拆見 Claude Code 個人月成本。
Codex 的賣點不是「又一個能改檔案的 CLI」,而是預設遏制和 OpenAI 產品門在同一套帳號裡:CLI、IDE 擴充、Codex Web、桌面端。模型檔位從高難度的 Sol 到高吞吐的 Luna,適合已經把工作流程鎖在 ChatGPT / Codex 的團隊。協議層的工具迴圈怎麼設計,見 Function Calling 是什麼;旗艦模型的上下文和 Computer Use 邊界,見 GPT-6 Astra 解析。
核心對比:入口、執行、上下文、人群
真正差異在於入口,而不是模型誰更強。三張牌必須用同一套欄名,才能做決定。
| 工具 | 入口 | 執行能力 | 上下文 | 適合人群 |
|---|---|---|---|---|
| Pi | 終端機 CLI / TUI,可接多家模型 | 讀、寫、改、bash;其餘靠擴充或你自己編排 | 薄系統提示,每輪少送檔案;倉庫規範靠你寫進倉庫 | 需求寫得清、按量計費、要換模型或本地權重的人 |
| Claude Code | 終端機、VS Code / JetBrains、桌面、瀏覽器 | 改倉庫、跑指令、開計畫、拆子 Agent、接 MCP | 厚系統提示 + 工具目錄,模糊任務有回退規則 | 要開箱守衛、已有訂閱、提示詞還不穩定的人 |
| Codex | CLI、IDE 擴充、Codex Web、桌面 | 改倉庫、跑指令、計畫模式、偏沙箱的策略執行 | OpenAI 產品線上下文與會話;預設模型在 GPT-5.6 檔 | 已在 OpenAI 生態、要預設隔離和同一套帳號的人 |
第二張表只補成本和權限,欄名仍然對齊,避免散文式空評。
| 工具 | 入口 | 執行能力 | 上下文 | 適合人群 |
|---|---|---|---|---|
| Pi 的帳單與權限 | 自帶 API Key / 閘道 | 無內建權限彈窗,跟啟動使用者同權 | Token 主要花在任務本身 | 願意自己套容器、按完成任務核算的人 |
| Claude Code 的帳單與權限 | 訂閱席位或 API | 預設拒絕高風險動作,多種權限模式 | 固定提示詞每輪都在,快取只能減價不能減注意力 | 要可預期月費、不能少確認框的人 |
| Codex 的帳單與權限 | ChatGPT / API / 雲端 Agent | 預設遏制更強,策略更一致 | 和 OpenAI 會話、雲端評審綁在一起 | 安全預設值優先、不打算換供應商的人 |
程式碼產生、修 Bug、Token:怎麼測才算數
不要用公開練習題當驗收。練習題的答案在網上,模型可能見過。用你們倉庫裡已經合併、帶測試、不是機器人提交的變更:一道產生(按現有模組補一個介面),一道已知失敗測試,一道不知道檔案在哪的回歸。評分只看編譯和原測試綠,不要再讓另一個模型當裁判。
# Same failing test, three CLIs — do not paste keys into the prompt pi --model anthropic/claude-opus-4-8 \ "Fix the failing test in auth_test.py and keep the public API stable." claude "Fix the failing test in auth_test.py and keep the public API stable." codex "Fix the failing test in auth_test.py and keep the public API stable." # After the run, record: tokens in/out, wall time, test pass/fail, files touched
程式碼產生上,介面改名、按現有模式填模組、補樣板,Pi 通常更便宜:需求已經寫清,厚套件那兩萬 Token 的回退規則你用不上,等於付兩遍說明書。模糊需求——「這裡有點慢,你看一下」——Claude Code 或 Codex 更穩,因為套件會替你補「先讀哪些檔案、改之前跑什麼」。
修 Bug 也按位置是否已知切開。測試名和失敗斷言已經指到函式,Pi 夠用。故障只表現為「偶發 500」或「某國家支付失敗」,先用厚套件做探索,鎖定檔案後再把機械補丁交給 Pi。把探索和填寫綁在同一套「最強模型 + 最高 effort」上,帳單會先炸。
Token 不要只看每百萬標價。內部成對評測裡反覆出現同一句話:同一模型、同一任務,Pi 每輪送進模型的內容大約是厚套件的三分之一;任務越長、改的檔案越多,差距越滾。有團隊在 Opus 高 effort 上看到:官方套件單任務約兩美元量級,Pi 約一半,完成率只差兩個點。把 effort 擰到最高檔時,Pi「盡量少送」的策略可能跟不上模型自己的長推論,完成率會掉——所以驗收必須帶 effort 檔,不能只跑一檔就下結論。
還有一個容易漏的坑:子任務。厚套件把活交給子 Agent 時,每個子 Agent 往往從零再載入完整系統提示和工具定義。有記錄顯示,直接做約 12 萬 Token 的任務,拆成兩個子 Agent 可以變成 50 萬以上。省下來的「並行」可能是四倍帳單。訂閱使用者切換到 Pi 還要另付 API,半價只在你本來就按量計費時成立。
場景怎麼選
| 如果你是 | 就選 | 理由 |
|---|---|---|
| 需求能寫到檔案、行為、邊界條件,倉庫有 AGENTS.md | Pi 為主 | 厚套件的說明書你已經自己寫過了 |
| 提示詞經常是一句「幫我修」,專案幾乎沒給 Agent 的文件 | Claude Code | 你買的是回退規則,不是多餘功能 |
| 帳號已經在 ChatGPT / Codex,安全預設值優先 | Codex | 隔離和同一套帳號比模型中立更值錢 |
| 要在同一 CLI 切 Claude、GPT、Gemini 或本地模型 | Pi | 另外兩套預設綁自家模型 |
| 機械改介面和模糊探 Bug 各占一半 | 並存:Pi + Claude Code 或 Codex | 按任務分流,不要互斥 |
| 企業倉庫、正式環境金鑰、稽核要求寫進制度 | Codex 或 Claude Code,外加遠端節點;Pi 只進容器 | 預設同權不是優惠,是風險 |
推薦組合
A — 獨立開發者、API 按量: Pi 做主路徑。倉庫根目錄放一份給 Agent 讀的規範:目錄、測試指令、禁止改的路徑。effort 先用高檔而不是最高檔。本機只跑唯讀探查;寫檔案和 bash 放到容器,或放到按會話隔離的遠端 Mac。月費對照把 API 帳單和節點租金放同一張表,定價見 Mac mini 定價。
B — 小型產品團隊、已有 Claude 訂閱: Claude Code 處理探索、計畫和需要 MCP 的連通;介面改名、按模式填模組、測試已紅的修補交給 Pi。兩套並存一週,用同一三道樣本任務比 Token 和返工,再定主路徑。不要為了「統一工具」強行停掉更便宜的那條。
C — 企業或高安全: 日常開發用 Codex 或 Claude Code 的權限模式;Pi 只出現在已稽核的映像裡,網路和金鑰按任務簽發。寫磁碟、開瀏覽器、碰正式環境副本的會話,放到可銷毀的遠端 Mac,不要和辦公本機混用。帳號與交付邊界見 說明中心。
常見誤區
- 按模型選套件: 「我們用 Opus,所以必須用官方 CLI」。同一模型換套件,完成率和單任務成本都會動。
- 用每百萬 Token 標價當開發成本: 便宜模型可能多燒輪次;厚提示詞即使命中快取,仍占注意力。
- 把 Pi 的預設同權當成省事: 沒有彈窗不等於安全。不熟悉的倉庫和金鑰先沙箱。
- 所有任務擰到最高 effort: 極簡套件在最高檔可能落後。驗收必須帶檔位,不能只跑一檔。
- 為了並行隨便拆子 Agent: 每個子 Agent 可能重新載入整份系統提示,帳單先於速度爆炸。
落地步驟:7 步
- 從本倉庫挑三道樣本:按現有模式產生一段程式碼、修一條已紅測試、定位一處檔案不明的回歸。刪掉「幫我優化一下」這種無法判分的空任務。
- 同一模型分別用 Pi 和官方套件跑這三道題。記下輸入 / 輸出 Token、牆鐘時間、測試是否綠、改了哪些檔案。禁止 Agent 去翻能洩漏答案的 git 歷史。
- 把任務分成機械填寫和模糊探索。前者預設 Pi,後者預設 Claude Code 或 Codex。比例寫進團隊約定,不要每次現場拍板。
- 寫清計費路徑。訂閱使用者不要用「半價 Token」當切換理由,除非已經在付 API。按量使用者用「完成一條帶測試的任務多少錢」做表,不用標價。
- 給 Pi 選一種隔離:本地容器、微型虛擬機,或遠端 Mac 節點。給厚套件核對應權限模式和允許的 MCP。金鑰不進提示詞、不進截圖。
- 按場景選主套件,允許疊加。獨立開發者可以 Pi 為主;小團隊可以 Claude Code 探索 + Pi 填寫;企業把寫操作鎖在已稽核入口。
- 把執行放到可重現的 Mac 節點:同一映像、同一測試指令、會話結束能清工作區。本機快取冒充通過,不算驗收。
FAQ
Pi、Claude Code 和 Codex 哪個模型更強?
問題問錯了。2026 年 9 月三套都能接上一代旗艦模型;同一模型換套件,完成率和帳單都會變。先比套件怎麼投餵上下文、怎麼攔權限、能不能換供應商。
訂閱 Claude Code 還要不要裝 Pi?
要,如果你已經在付 API 或有大量機械改動。訂閱覆蓋的是厚套件的保險;機械填寫、換模型、控 Token 仍適合 Pi。兩套可以並存一週再決定主路徑。
Codex 是不是只能用 OpenAI 模型?
預設產品線綁在 GPT-5.6 的 Sol / Terra / Luna。它的優勢是隔離策略和 ChatGPT / Codex Web 同一套帳號。若你要在同一 CLI 裡切 Claude、Gemini 或本地模型,選 Pi。
Token 更便宜是否等於開發成本更低?
不等於。要比「完成一條帶測試的任務花多少錢」,不要只看每百萬 Token 標價。便宜模型可能多燒輪次;厚套件的固定提示詞即使命中快取,仍占模型注意力。
Pi 沒有權限彈窗,能直接在本機跑嗎?
能跑,但不建議對不熟悉的倉庫或正式環境金鑰這麼做。Pi 文件寫明預設跟啟動使用者同權。先放進容器或遠端 Mac 節點,再打開寫檔案和 bash。
總結
2026 年選 AI Coding Agent,不要再把模型排行榜當成購物車。先按套件厚度選入口:需求寫得清、要控 Token 和換模型,用 Pi;提示詞還不穩、要守衛和計畫,用 Claude Code;已經在 OpenAI 生態、要預設隔離,用 Codex。 程式碼產生和修 Bug 按「位置是否已知」分流,帳單按完成任務算,權限按預設值而不是按口碑設。按 7 步把樣本任務、檔位和可重現節點寫進驗收。遠端節點從 租用頁 和 定價頁 查看,帳戶問題走 說明中心。