К сентябрю 2026 года нормально держать в одном терминале сразу три ИИ-агента для кода. Pi — обвязка (harness) под лицензией MIT, которую Марио Цехнер начал в августе 2025-го. Claude Code — официальный терминальный агент Anthropic. Codex CLI — официальная обвязка OpenAI и по умолчанию идёт в линейке GPT-5.6: Sol, Terra и Luna. Все три умеют править файлы, запускать команды и догонять красный тест. Многие команды всё ещё спрашивают, какая модель умнее. Лучший вопрос — какую обвязку вы обернули вокруг модели: сколько фиксированных токенов она впрыскивает каждый ход, какие права она считает своими, можно ли сменить поставщика, и платите ли вы за место или за завершённую задачу. Эта статья пропускает публичные таблицы лидеров. Она отвечает на покупной вопрос: как разделить генерацию кода, починку багов, расход токенов, поддержку моделей и стоимость разработки. Для команды в России та же метрика звучит как рубли за проверенную задачу, а не как баллы лаборатории.
Почему сравнивать сначала модели — уже неверное решение 2026 года
Старый и новый путь сталкиваются вполне конкретно. Старый путь — сначала модель: закрепить Opus, GPT-5.6 или локальные веса, затем прикрутить ближайший CLI. Новый путь — сначала обвязка: решить, нужен ли минимальный аудируемый каркас, готовые ограждения из коробки или изоляция по умолчанию, привязанная к одному вендору. Одна и та же инструкция — «сделай падающий тест зелёным» — даёт разные счета и разные аварии, потому что обвязка решает, сколько байт доходит до модели за ход, перезагружает ли дочерний агент полный системный промпт и останавливается ли запись файла ради человека.
Три вещи превратили это из хобби-сравнения в задачу планирования. Во-первых, в середине 2026 года внутренние исследования начали парить одну и ту же модель с разными CLI на частных, уже влитых изменениях, которые идут с тестами. Публичные наборы SWE-Bench и Terminal-Bench легко протекают в обучение; производственный набор обмануть труднее. Во-вторых, страхование подпиской и счётчики API разошлись. Место Claude Code может быть дешевле неряшливого API, а токенное преимущество Pi считается только если вы и так платили за токен. В-третьих, права по умолчанию отличаются на порядок. Pi наследует запускающего пользователя. Claude Code сначала спрашивает. Codex склоняется к песочнице и политике. Если вы по-прежнему покупаете только по баллу модели, вы покупаете счёт и инцидент вместе. Это особенно заметно, когда служба безопасности потом спросит, кто и когда писал на диск.
Есть ещё местный налог. Инференс может жить в облаке, пока CLI, редактор, language servers, браузер и Docker всё равно едят унифицированную память. Ступени RAM — в руководстве по памяти M6 Mac mini. Стоит ли узлу держать постоянного агента — в подходит ли M6 Mac mini разработчикам. Если агент весь день сидит рядом с Xcode и Docker, налог памяти виден быстрее любой таблицы токенов.
Как классифицировать Pi, Claude Code и Codex
Выстроить три имени как равных — гарантировать грязный шорт-лист. Классифицируйте их по толщине обвязки. Уберите один класс — останется только репутация. Толщина говорит о счёте, риске и переделках больше, чем любой слайд про флагманскую модель.
| Класс | Пример | Что вы получаете | Что нужно добавить самим |
|---|---|---|---|
| Минимальная и расширяемая | Pi | Чтение, запись, правка, bash; тонкий промпт; смена моделей | Режим плана, дочерние агенты, MCP, всплывающие права, песочница |
| С ограждениями из коробки | Claude Code | План, дочерние агенты, MCP, режимы прав, контрольные точки, много поверхностей | Свобода вендора и жёсткий контроль токенов на задачу |
| Изолированная по умолчанию | Codex CLI | Режим плана, согласованная политика песочницы, один аккаунт для ChatGPT и Codex Web | Нейтральность моделей; линейка по умолчанию — OpenAI |
Pi нарочно маленький: CLI агента для кода, мультипровайдерное API, TUI. Сообщество разбирало толстые обвязки и видело системные промпты около двадцати тысяч токенов плюс длинные каталоги инструментов. Pi держит промпт около тысячи токенов и четыре встроенных инструмента. Это экономит деньги и внимание: токены, которые вы не отправили, не размывают середину окна контекста. Документация честна про разрыв. Нет встроенного режима плана, менеджера дочерних агентов, фонового bash, всплывающего окна прав, клиента MCP и списка дел. Это расширения или ваш оркестратор. Кто знает этот разрыв заранее, планирует его, а не открывает его на незнакомом репозитории.
Claude Code ставит противоположную ставку. Он кодирует, что открыть, когда запрос расплывчат, какие команды гонять до правки и когда остановиться и спросить. Если у вас ещё нет AGENTS.md, эта страховка и есть продукт, а не мусор. Не смешивайте место и ключ API. Арифметика места — в месячной стоимости Claude Code для индивидуального разработчика. Подписка, которая ловит неясные промпты, может быть дешевле открытого API-счёта, который полностью тарифицирует каждый разведывательный ход.
Codex — не «ещё один CLI, который правит файлы». Он продаёт изоляцию по умолчанию и один аккаунт через дверь OpenAI: CLI, расширение IDE, Codex Web, десктоп. Лестница моделей от Sol для тяжёлой открытой работы до Luna для повторов с высокой пропускной способностью подходит командам, уже запертым на ChatGPT и Codex. Как должна быть устроена петля инструментов — в Что такое Function Calling. Окна контекста и границы computer use текущего флагмана — в Что такое GPT-6 Astra. Если счета, SSO и ревью уже живут в этой экосистеме, вы покупаете прежде всего согласованность, а не третий редактор.
Ядро сравнения: вход, исполнение, контекст, аудитория
Настоящая разница — во входе, а не в том, какая лаборатория опубликовала более высокий балл. Используйте один набор колонок, иначе решить нельзя. Те же пять заголовков держат сравнение честным и не дают таблице превратиться в рекламный список.
| Инструмент | Вход | Исполнение | Контекст | Лучше всего для |
|---|---|---|---|---|
| Pi | Терминальный CLI / TUI; много бэкендов моделей | Чтение, запись, правка, bash; остальное — расширение или ваш цикл | Тонкий системный промпт; меньше файлов за ход; правила репозитория живут в вашем дереве | Тех, кто пишет ясные спецификации, платит за токен и хочет менять модели или гонять локальные веса |
| Claude Code | Терминал, VS Code / JetBrains, десктоп, браузер | Правки, команды, режим плана, дочерние агенты, MCP | Толстый промпт и каталог инструментов; правила отката для размытой работы | Тех, кому нужны ограждения, кто уже платит за место и всё ещё пишет однострочные промпты |
| Codex | CLI, расширение IDE, Codex Web, десктоп | Правки, команды, режим плана, песочница с жёсткой политикой | Продуктовый контекст и сессии OpenAI; модели по умолчанию на лестнице GPT-5.6 | Тех, кто уже в экосистеме OpenAI и хочет изоляцию плюс один логин |
Вторая таблица добавляет только стоимость и права. Заголовки те же, чтобы проза не скатилась в пустые прилагательные. Читайте строки как бухгалтерию, а не как оценку вкуса.
| Инструмент | Вход | Исполнение | Контекст | Лучше всего для |
|---|---|---|---|---|
| Счёт и права Pi | Ваш API-ключ или шлюз | Нет встроенного окна прав; те же права, что у запускающего пользователя | Токены уходят в основном в задачу | Тех, кто обернёт контейнер и считает за завершённую задачу |
| Счёт и права Claude Code | Место или API | Рискованные действия по умолчанию запрещены; несколько режимов прав | Фиксированный промпт есть каждый ход; кэш снижает цену, не внимание | Тех, кому нужен предсказуемый месяц и кто не снимет подтверждения |
| Счёт и права Codex | ChatGPT, API или облачный агент | Более сильная изоляция по умолчанию и согласованная политика | Привязано к сессиям OpenAI и облачному ревью | Тех, кто ставит безопасные значения по умолчанию выше нейтральности вендора |
Генерация кода, багфиксы, токены: как выглядит честный тест
Не принимайте публичное упражнение как приёмку. Ответы на эти задачи живут в интернете и, возможно, уже сидят в обучении. Берите изменения из своего репозитория, которые уже влиты, идут с тестами и не пришли от бота. Используйте одну задачу генерации, которая заполняет модуль так, как дерево уже делает, один известный падающий тест и одну регрессию, файл которой вы не называете. Оценивайте только сборку и исходный набор. Не нанимайте другую модель судьёй. Кто мерит внутри, должен заморозить три образца до первого сравнения, иначе на следующей неделе команда сравнит уже другую историю.
# Same failing test, three CLIs — do not paste keys into the prompt pi --model anthropic/claude-opus-4-8 \ "Fix the failing test in auth_test.py and keep the public API stable." claude "Fix the failing test in auth_test.py and keep the public API stable." codex "Fix the failing test in auth_test.py and keep the public API stable." # After the run, record: tokens in/out, wall time, test pass/fail, files touched
В генерации кода переименовать интерфейс, заполнить модуль по существующему шаблону или положить шаблонный код обычно дешевле в Pi. Спецификацию вы уже написали. Руководство отката на двадцать тысяч токенов у толстой обвязки — вторая копия документа, который вы сами ведёте. Размытая работа — «этот путь ощущается медленным, посмотри» — стабильнее в Claude Code или Codex, потому что обвязка дополняет, какие файлы читать и какие команды гонять до правки. Ясная спецификация награждает тонкую обвязку; неясная фраза награждает встроенный чеклист.
Багфиксы делятся по тому, известно ли место. Если имя теста и утверждение уже указывают на функцию, Pi достаточно. Если единственный сигнал — прерывистый 500 или сбой оплаты в одной стране, исследуйте толстой обвязкой, зафиксируйте файл, затем отдайте механический патч в Pi. Привязать каждую работу к «самая сильная модель плюс максимальный effort» взрывает счёт раньше, чем улучшает набор. Оставлять разведку и заполнение в одной дорогой сессии — самый частый способ сжечь квартальный бюджет за неделю.
Не считайте ценник за миллион токенов стоимостью разработки. Парные внутренние прогоны повторяют один и тот же вывод: на той же модели и той же задаче Pi отправляет за ход примерно треть содержимого толстой обвязки. Более длинные задачи и большее число файлов заставляют разрыв расти как сложный процент. Команды видели, как Opus на высоком effort садится около двух долларов за задачу в вендорском CLI и около половины в Pi, с долей прохождения в пределах пары пунктов. Выкрутите effort на максимальную ступень — и стратегия Pi «слать как можно меньше» может отстать от длинного рассуждения самой модели. Поэтому приёмка должна включать регулятор effort. Одна ступень — не исследование. Кто гоняет только маркетинговый «max», меряет не обвязку, а самое дорогое поведение модели.
Дочерние агенты прячут ещё одну утечку. Когда толстая обвязка делегирует, каждый ребёнок часто заново грузит полный системный промпт и список инструментов с нуля. Одна измеренная задача потратила около 121 000 токенов напрямую и больше 500 000 после раскола на двоих детей. Параллелизм, который видно в интерфейсе, может быть четырёхкратным счётом. Подписчики, которые переходят на Pi, начинают ещё и платить счётчики API. Заголовок «в два раза дешевле» держится только если вы уже были на usage-биллинге. Параллелизм без учёта токенов — второе табло, а не экономия.
Как выбирать по сцене
Сцена решает раньше бренда. Сначала запишите, насколько ясны ваши спецификации, какой счёт уже оплачен и какие права агент может иметь без спроса. Только потом выбирайте обвязку. Таблица ниже — правило маршрутизации, а не рейтинг.
| Если вы | Выберите | Почему |
|---|---|---|
| Можете назвать файл, поведение и краевые случаи; в репозитории есть AGENTS.md | Сначала Pi | Вы уже написали руководство, которое толстая обвязка впрыснула бы сама |
| Всё ещё шлёте «fix this»; почти нет документов для агента | Claude Code | Вы покупаете правила отката, а не лишний хром |
| Уже на ChatGPT / Codex и ставите безопасные значения по умолчанию первыми | Codex | Изоляция и один аккаунт бьют нейтральность моделей |
| Нужны Claude, GPT, Gemini или локальная модель в одном CLI | Pi | Двое других по умолчанию сидят на своих лабораториях |
| Половина — механическая работа с интерфейсами, половина — размытая охота на баги | Оба: Pi плюс Claude Code или Codex | Делите по задаче; не делайте их взаимоисключающими |
| Корпоративный репозиторий, боевые секреты, письменные правила аудита | Codex или Claude Code плюс удалённый узел; Pi только в контейнере | Те же права пользователя — риск, а не удобство |
Рекомендуемые стеки
A — Сольный разработчик на тарифицируемом API: Pi — основной путь. Положите короткую спецификацию, читаемую агентом, в корень репозитория: раскладка, команда тестов, пути, которые нельзя менять. Начните с высокой ступени effort, не с максимума. Ноутбук оставьте только для чтения при разведке. Запись и bash — в контейнер или на удалённый Mac, который изолирует сессию. Положите счёт API и аренду узла на один лист. Тарифы узлов — на ценах Mac mini. Кто смотрит аренду и токены порознь, почти всегда занижает настоящую месячную цифру.
B — Небольшая продуктовая команда с местом Claude: Claude Code владеет разведкой, планами и подключениями MCP. Переименования, заполнение по образцу и уже красные тесты идут в Pi. Гоняйте оба неделю на тех же трёх пробных задачах. Сравните токены и переделки, затем выберите основной путь. Не убивайте более дешёвый путь только ради единой панели. Команда, которая неделю меряет два CLI, решает спокойнее, чем команда, которая в понедельник стандартизирует из принципа.
C — Предприятие или высокая безопасность: Повседневная работа остаётся на режимах прав Codex или Claude Code. Pi появляется только внутри проверенного образа, с сетью и секретами, выданными на задачу. Сессии, которые пишут на диск, открывают браузер или трогают боевую реплику, принадлежат одноразовому удалённому Mac, а не офисному ноутбуку. Границы аккаунта и поставки — в справочном центре. Аудиту нужны воспроизводимые узлы, а не агент, у которого на ноутбуке разработчика те же права, что у Slack и браузера.
Частые ловушки
- Выбирать обвязку по модели: «Мы используем Opus, значит, обязаны взять официальный CLI». Поменяйте только обвязку — и доля прохождения, и цена за задачу сдвинутся. Модель та же; счёт нет.
- Считать ценник за миллион токенов стоимостью разработки: Более дешёвая модель может сжечь больше раундов. Толстый промпт занимает внимание и после попадания в кэш. Цена за миллион — закупочная, не результат проекта.
- Читать права того же пользователя у Pi как удобство: Нет всплывающего окна — не значит безопасно. Сначала песочьте незнакомые репозитории и секреты. Отсутствие спроса — отсутствующие ворота, а не функция.
- Прибивать каждую работу к максимальному effort: Тонкая обвязка может проиграть на верхней ступени. Приёмка должна включать регулятор. Одна максимальная ступень — маркетинг, не измерение.
- Дробить дочерних агентов ради параллелизма: Каждый ребёнок может заново загрузить весь системный промпт. Счёт может обогнать ускорение. Видимый параллелизм без книги токенов часто лишь более дорогое тепло.
План действий: 7 шагов
- Выберите три образца из этого репозитория: сгенерируйте срез в существующем стиле, почините один уже красный тест и найдите регрессию, не называя файл. Удалите пустые просьбы вроде «сделай лучше». Заморозьте три задачи, прежде чем кто-то сменит обвязку.
- Прогоните эти три на той же модели в Pi и в вендорской обвязке. Запишите входные и выходные токены, настенное время, позеленели ли тесты и какие файлы изменились. Запретите агенту читать git-историю, которая выдаёт ответ. Без этого журнала следующий спор — только память.
- Разделите работу на механическое заполнение и размытую разведку. По умолчанию первое — в Pi, второе — в Claude Code или Codex. Запишите долю в командную заметку, чтобы никто не переторговывал её каждое утро. Фиксированная доля дешевле ежедневных споров о вкусе.
- Запишите путь биллинга. Держатели места не должны переключаться из-за заголовка «токены вдвое дешевле», если они ещё не платят API. Пользователи со счётчиком должны сводить доллары за протестированную задачу, а не ценник. Рубль за зелёный набор бьёт любой прайс.
- Выберите изоляцию для Pi: локальный контейнер, микро-ВМ или удалённый Mac-узел. Проверьте режимы прав и разрешённые MCP-серверы у толстой обвязки. Ключи не попадают в промпты и скриншоты. Изоляция — часть приёмки, а не мысль после утечки.
- Выберите основную обвязку по сцене и разрешите стек. Сольная работа может быть Pi-first. Небольшая команда может разведывать в Claude Code и заполнять в Pi. Предприятия запирают запись за проверенными дверями. Стек разрешён; произвол — нет.
- Положите исполнение на воспроизводимый Mac-узел: тот же образ, та же команда тестов, рабочее место стирается в конце сессии. Зелёный прогон, который живёт только в кэше ноутбука, — не приёмка. Воспроизводимость бьёт одноразовое зелёное демо.
FAQ
Какая модель сильнее: Pi, Claude Code или Codex?
Неверный вопрос. На сентябрь 2026 года все три могут сесть перед флагманской моделью. Поменяйте обвязку на той же модели — и доля прохождения, и счёт сдвинутся. Сравнивайте, как кормят контекст, как закрывают права и можно ли сменить вендора. Вопрос «какая модель» прячет более дорогой вопрос «какой слой вокруг модели».
Если я уже подписан на Claude Code, стоит ли всё равно ставить Pi?
Да, если вы уже платите за API или у вас много механических правок. Подписка покупает страховку толстой обвязки. Механическое заполнение, смена моделей и контроль токенов по-прежнему подходят Pi. Гоняйте оба неделю, прежде чем выбрать основной путь. Место не заменяет таблицу usage для повторяющихся переименований.
Codex работает только с моделями OpenAI?
Продуктовая линейка по умолчанию — GPT-5.6 Sol, Terra и Luna. Его край — изоляция плюс один аккаунт через ChatGPT и Codex Web. Если в том же CLI нужны Claude, Gemini или локальная модель, берите Pi. Codex может быть правильным продуктом, не будучи нейтральным по моделям; это свойство изоляции, а не скрытый недостаток.
Более дешёвая цена токена значит более низкую стоимость разработки?
Нет. Сравнивайте доллары за завершённую, протестированную задачу — не ценник за миллион токенов. Более дешёвая модель может сжечь больше раундов. Толстый системный промпт занимает внимание даже когда кэш попадает. Стоимость разработки — сумма раундов, переделок и времени узла, а не ячейка в прайсе.
У Pi нет всплывающих окон прав. Можно ли запускать его на ноутбуке?
Запустится. Не делайте этого на незнакомом репозитории или с боевыми секретами. Документация Pi говорит, что он наследует права запускающего пользователя. Положите его в контейнер или на удалённый Mac-узел, прежде чем включать запись и bash. Ноутбук, где почта, Slack и агент делят одни права, — не лаборатория, а общая поверхность атаки.
Вывод
Выбирать ИИ-агента для кода в 2026 году — не поручение таблице лидеров моделей. Выбирайте вход по толщине обвязки: Pi, когда спецификация ясна и нужны контроль токенов или смена моделей; Claude Code, когда промпты ещё тонкие и нужны планы и ограждения; Codex, когда вы уже живёте в OpenAI и хотите изоляцию по умолчанию. Делите генерацию кода и починку багов по тому, известно ли место. Цените завершённую задачу, не ценник. Ставьте права из значений по умолчанию, не из репутации. Запишите три образца, регулятор effort и воспроизводимый узел в приёмку. Удалённые узлы начинаются на странице аренды и странице цен. Вопросы по аккаунту — в справочный центр. Кто держит этот порядок, покупает меньше сюрпризов и больше повторяемых зелёных наборов.
Читать дальше
- Месячная стоимость Claude Code для индивидуального разработчика →
- Что такое Function Calling: OpenAI, Gemini, Claude →
- Что такое GPT-6 Astra: цена, контекст, агент для кода →
Агенту, который правит репозиторий и гоняет тесты, нужен изолированный Mac
Pi наследует права запустившего пользователя. Claude Code и Codex тоже пишут файлы и поднимают процессы. Это нельзя делить с повседневным ноутбуком. Удалённый Mac изолирует репозиторий и секреты на сессию, чтобы «один раз сработало» стало «можно перепроверить».