En septembre 2026, il est normal d'avoir trois agents de coding IA ouverts dans le même terminal. Pi est un harness sous licence MIT que Mario Zechner a commencé en août 2025. Claude Code est l'agent terminal officiel d'Anthropic. Codex CLI est le harness officiel d'OpenAI et utilise par défaut la ligne GPT-5.6 — Sol, Terra et Luna. Les trois peuvent modifier des fichiers, exécuter des commandes et poursuivre un test rouge. Beaucoup d'équipes demandent encore quel modèle est le plus intelligent. La meilleure question est de savoir quel harness vous avez enveloppé autour du modèle : combien de tokens fixes il injecte à chaque tour, quelles permissions il suppose, si vous pouvez changer de fournisseur, et si vous payez un siège ou une tâche terminée. Cet article ignore les classements publics. Il répond à une question d'achat : comment séparer génération de code, correction de bugs, consommation de tokens, support de modèles et coût de développement. En France comme ailleurs, le bon comparateur est l'euro par tâche testée, pas le score marketing du laboratoire.
Pourquoi comparer d'abord les modèles est déjà la mauvaise décision de 2026
L'ancien chemin et le nouveau se heurtent de façon concrète. L'ancien chemin est model-first : verrouiller Opus, GPT-5.6 ou un poids local, puis boulonner le CLI le plus proche. Le nouveau chemin est harness-first : décider si vous voulez un noyau minimal auditable, des garde-fous livrés avec les piles, ou un confinement par défaut lié à un seul fournisseur. La même instruction — « rends le test en échec vert » — produit des factures différentes et des accidents différents, parce que le harness décide combien d'octets atteignent le modèle à chaque tour, si un sous-agent recharge le prompt système complet, et si une écriture de fichier s'arrête pour un humain.
Trois choses en ont fait un problème de planning plutôt qu'une comparaison de hobby. D'abord, mi-2026, des études internes ont commencé à apparier le même modèle avec différents CLI sur des changements privés, déjà fusionnés, livrés avec des tests. Les jeux publics SWE-Bench et Terminal-Bench fuient facilement dans l'entraînement ; une suite de production est plus difficile à truquer. Ensuite, l'assurance abonnement et les factures API au compteur ont divergé. Un siège Claude Code peut coûter moins cher qu'un usage API négligent, et l'avantage tokens de Pi ne compte que si vous payiez déjà au token. Enfin, les permissions par défaut diffèrent d'un ordre de grandeur. Pi hérite de l'utilisateur qui le lance. Claude Code demande d'abord. Codex penche vers le bac à sable et la politique. Si vous achetez encore uniquement au score de modèle, vous achetez la facture et l'incident ensemble. C'est encore plus vrai quand une équipe sécu ou un RSSI voudra plus tard rejouer qui a écrit quoi, et quand.
Il y a aussi une taxe locale. L'inférence peut vivre dans le cloud pendant que le CLI, l'éditeur, les language servers, un navigateur et Docker continuent de mâcher la mémoire unifiée. Les paliers de RAM sont dans le guide mémoire du M6 Mac mini. Savoir si un nœud doit héberger un agent résident est dans Le M6 Mac mini convient-il aux développeurs. Laisser l'agent tourner toute la journée à côté de Xcode et Docker révèle cette taxe mémoire plus vite qu'aucune grille de tokens.
Comment classer Pi, Claude Code et Codex
Aligner les trois noms comme des pairs garantit une shortlist brouillonne. Classez-les par épaisseur de harness. Enlevez une classe et il ne reste que la réputation. L'épaisseur dit plus sur la facture, le risque et le retravail que n'importe quelle slide sur le modèle phare.
| Classe | Exemple | Ce que vous obtenez | Ce que vous devez ajouter |
|---|---|---|---|
| Minimal et extensible | Pi | Lire, écrire, éditer, bash ; un prompt mince ; modèles interchangeables | Mode plan, sous-agents, MCP, popups de permission, un bac à sable |
| Gardé dès la sortie de boîte | Claude Code | Plan, sous-agents, MCP, modes de permission, points de contrôle, plusieurs surfaces | Liberté de fournisseur et contrôle serré des tokens par tâche |
| Confiné par défaut | Codex CLI | Mode plan, politique de bac à sable cohérente, un compte pour ChatGPT et Codex Web | Neutralité de modèle ; la ligne par défaut est OpenAI |
Pi est petit exprès : un CLI d'agent de coding, une API multi-fournisseurs, un TUI. Des traces communautaires de harnesses épais ont montré des prompts système dans la zone des vingt mille tokens plus de longs catalogues d'outils. Pi garde le prompt près de mille tokens et quatre outils intégrés. Cela économise de l'argent et de l'attention : les tokens que vous n'envoyez pas ne peuvent pas diluer le milieu de la fenêtre de contexte. La documentation est honnête sur le trou. Il n'y a pas de mode plan intégré, pas de gestionnaire de sous-agents, pas de bash en arrière-plan, pas de popup de permission, pas de client MCP, pas de liste de tâches. Ce sont des extensions ou votre orchestrateur. Connaître ce trou avant le premier incident évite de le découvrir dans un dépôt inconnu.
Claude Code prend le pari inverse. Il encode quoi ouvrir quand la demande est vague, quelles commandes lancer avant une édition, et quand s'arrêter pour demander. Si vous ne tenez pas encore un AGENTS.md, cette assurance est le produit, pas du gaspillage. Ne mélangez pas un siège et une clé API. Le calcul du siège est dans Coût mensuel Claude Code pour un développeur individuel. Un abonnement qui rattrape des prompts flous peut coûter moins cher qu'un compte API ouvert qui facture chaque tour d'exploration au complet.
Codex n'est pas « un autre CLI qui édite des fichiers ». Il vend un confinement par défaut et un compte à travers la porte OpenAI : CLI, extension IDE, Codex Web, bureau. L'échelle de modèles, de Sol pour le travail ouvert difficile à Luna pour les répétitions à haut débit, convient aux équipes déjà verrouillées sur ChatGPT et Codex. Comment former une boucle d'outils est dans Qu'est-ce que le Function Calling. Les fenêtres de contexte et les limites de computer use du vaisseau amiral actuel sont dans Qu'est-ce que GPT-6 Astra. Si la facturation, le SSO et la revue vivent déjà dans cet écosystème, vous achetez surtout de la cohérence, pas un troisième éditeur.
Comparaison centrale : entrée, exécution, contexte, public
La vraie différence est l'entrée, pas quel laboratoire a publié un score plus haut. Utilisez un seul jeu de colonnes, sinon vous ne pouvez pas décider. Les cinq mêmes en-têtes gardent la comparaison honnête et empêchent le tableau de devenir une liste publicitaire.
| Outil | Entrée | Exécution | Contexte | Idéal pour |
|---|---|---|---|---|
| Pi | CLI / TUI terminal ; plusieurs backends de modèles | Lire, écrire, éditer, bash ; le reste est une extension ou votre propre boucle | Prompt système mince ; moins de fichiers par tour ; les règles du dépôt vivent dans votre arbre | Ceux qui écrivent des specs claires, paient au token, et veulent changer de modèle ou lancer des poids locaux |
| Claude Code | Terminal, VS Code / JetBrains, bureau, navigateur | Éditions, commandes, mode plan, sous-agents, MCP | Prompt épais et catalogue d'outils ; règles de repli pour le travail flou | Ceux qui veulent des garde-fous, paient déjà un siège, et écrivent encore des prompts d'une ligne |
| Codex | CLI, extension IDE, Codex Web, bureau | Éditions, commandes, mode plan, sandboxing très politique | Contexte produit OpenAI et sessions ; modèles par défaut sur l'échelle GPT-5.6 | Ceux déjà dans l'écosystème OpenAI qui veulent le confinement et un seul login |
Un second tableau n'ajoute que le coût et les permissions. Les en-têtes restent les mêmes pour que la prose ne se transforme pas en adjectifs vides. Lisez les lignes comme de la comptabilité, pas comme un jugement de goût.
| Outil | Entrée | Exécution | Contexte | Idéal pour |
|---|---|---|---|---|
| Facture et droits Pi | Votre clé API ou passerelle | Pas de popup de permission intégré ; les mêmes droits que l'utilisateur qui lance | Les tokens vont surtout à la tâche | Ceux qui envelopperont un conteneur et comptent par tâche terminée |
| Facture et droits Claude Code | Siège ou API | Actions risquées refusées par défaut ; plusieurs modes de permission | Le prompt fixe est présent à chaque tour ; le cache baisse le prix, pas l'attention | Ceux qui veulent un mois prévisible et ne supprimeront pas les confirmations |
| Facture et droits Codex | ChatGPT, API ou l'agent cloud | Confinement par défaut plus fort et politique cohérente | Lié aux sessions OpenAI et à la revue cloud | Ceux qui classent les defaults sûrs au-dessus de la neutralité fournisseur |
Génération de code, correctifs, tokens : à quoi ressemble un test équitable
N'acceptez pas un exercice public comme test d'acceptation. Les réponses à ces problèmes vivent sur internet et peuvent déjà siéger dans l'entraînement. Tirez des changements de votre propre dépôt déjà fusionnés, livrés avec des tests, et qui ne viennent pas d'un bot. Utilisez une tâche de génération qui remplit un module comme l'arbre le fait déjà, un test en échec connu, et une régression dont vous ne nommez pas le fichier. Notez seulement la compilation et la suite d'origine. N'engagez pas un autre modèle comme juge. Qui mesure en interne devrait geler les trois échantillons avant le premier comparatif, sinon l'équipe compare une autre histoire la semaine suivante.
# Same failing test, three CLIs — do not paste keys into the prompt pi --model anthropic/claude-opus-4-8 \ "Fix the failing test in auth_test.py and keep the public API stable." claude "Fix the failing test in auth_test.py and keep the public API stable." codex "Fix the failing test in auth_test.py and keep the public API stable." # After the run, record: tokens in/out, wall time, test pass/fail, files touched
En génération de code, renommer une interface, remplir un module à partir d'un motif existant ou poser du boilerplate est généralement moins cher dans Pi. Vous avez déjà écrit la spec. Le manuel de repli de vingt mille tokens d'un harness épais est une seconde copie d'un document que vous maintenez. Le travail flou — « ce chemin a l'air lent, jette un œil » — reste plus stable dans Claude Code ou Codex, parce que le harness complète quels fichiers lire et quelles commandes lancer avant une édition. Une spec claire récompense le harness mince ; une phrase vague récompense la checklist intégrée.
Les correctifs se coupent selon que l'emplacement est connu. Si le nom du test et l'assertion pointent déjà vers une fonction, Pi suffit. Si le seul signal est un 500 intermittent ou un échec de paiement dans un pays, explorez avec un harness épais, verrouillez le fichier, puis passez le correctif mécanique à Pi. Lier chaque job à « le modèle le plus fort plus l'effort maximum » fait exploser la facture avant d'améliorer la suite. Laisser l'exploration et le remplissage dans la même session chère est le moyen le plus courant de brûler un budget trimestriel en une semaine.
Ne traitez pas le prix catalogue par million de tokens comme coût de développement. Les runs internes appariés répètent le même constat : sur le même modèle et la même tâche, Pi envoie environ un tiers du contenu par tour qu'un harness épais. Les tâches plus longues et les fichiers plus nombreux font composer l'écart. Des équipes ont vu Opus à effort élevé atterrir près de deux dollars par tâche dans un CLI fournisseur et environ la moitié dans Pi, avec un taux de réussite à quelques points près. Tournez l'effort au palier maximum et la stratégie de Pi « envoyer le moins possible » peut prendre du retard sur le long raisonnement du modèle. L'acceptation doit donc inclure le cadran d'effort. Un seul palier n'est pas une étude. Qui ne tourne que le cran marketing « max » ne mesure pas le harness, mais le comportement le plus cher du modèle.
Les sous-agents cachent une autre fuite. Quand un harness épais délègue, chaque enfant recharge souvent le prompt système complet et la liste d'outils depuis zéro. Une tâche mesurée a utilisé environ 121 000 tokens en direct et plus de 500 000 après une scission en deux enfants. Le parallélisme que vous voyez dans l'UI peut être une facture multipliée par quatre. Les abonnés qui passent à Pi commencent aussi à payer des compteurs API. Le titre « moitié prix » ne tient que si vous étiez déjà en facturation à l'usage. Un parallélisme sans comptabilité des tokens n'est qu'un second tableau de bord, pas une économie.
Comment choisir selon la scène
La scène décide avant la marque. Écrivez d'abord à quel point vos specs sont claires, quel compte est déjà payé, et quels droits l'agent peut avoir sans demander. Ensuite seulement, choisissez le harness. Le tableau ci-dessous est une règle de routage, pas un classement.
| Si vous êtes | Choisissez | Pourquoi |
|---|---|---|
| Capable de nommer le fichier, le comportement et les cas limites ; le dépôt a AGENTS.md | Pi d'abord | Vous avez déjà écrit le manuel qu'un harness épais injecterait |
| Encore en train d'envoyer « fix this » ; presque aucune doc pour un agent | Claude Code | Vous achetez des règles de repli, pas du chrome en plus |
| Déjà sur ChatGPT / Codex et vous classez d'abord les defaults sûrs | Codex | Le confinement et un compte battent la neutralité de modèle |
| Besoin de Claude, GPT, Gemini ou d'un modèle local dans un seul CLI | Pi | Les deux autres basculent par défaut sur leurs propres labos |
| Moitié travail d'interface mécanique, moitié chasses aux bugs flous | Les deux : Pi plus Claude Code ou Codex | Séparez par tâche ; ne les rendez pas exclusifs |
| Dépôt entreprise, secrets de production, règles d'audit écrites | Codex ou Claude Code plus un nœud distant ; Pi seulement dans un conteneur | Les mêmes droits utilisateur sont un risque, pas une commodité |
Stacks recommandés
A — Développeur solo sur API au compteur : Pi est le chemin principal. Placez une spec courte lisible par un agent à la racine du dépôt : arborescence, commande de test, chemins qui ne doivent pas changer. Commencez sur un palier d'effort élevé, pas le maximum. Gardez le portable en lecture seule pour les sondes. Les écritures et le bash vont dans un conteneur ou sur un Mac distant qui isole la session. Mettez la facture API et le loyer du nœud sur une seule feuille. Les tarifs des nœuds sont sur Tarifs Mac mini. Qui sépare loyer et tokens sous-estime presque toujours le vrai chiffre du mois.
B — Petite équipe produit avec un siège Claude : Claude Code possède l'exploration, les plans et les connexions MCP. Les renommages, les remplissages qui suivent un motif et les tests déjà rouges vont à Pi. Faites tourner les deux pendant une semaine sur les trois mêmes tâches échantillon. Comparez tokens et retravail, puis choisissez un chemin principal. N'éliminez pas le chemin moins cher seulement pour standardiser la barre d'outils. Une équipe qui mesure deux CLI pendant une semaine décide plus calmement qu'une équipe qui standardise par principe le lundi.
C — Entreprise ou haute sécurité : Le travail quotidien reste sur les modes de permission Codex ou Claude Code. Pi n'apparaît que dans une image auditée, avec réseau et secrets délivrés par tâche. Les sessions qui écrivent le disque, ouvrent un navigateur ou touchent une réplique de production appartiennent à un Mac distant jetable, pas au portable de bureau. Les limites de compte et de livraison sont dans le centre d'aide. L'audit veut des nœuds reproductibles, pas un agent qui sur le notebook d'un développeur a les mêmes droits que Slack et le navigateur.
Pièges courants
- Choisir le harness d'après le modèle : « Nous utilisons Opus, donc nous devons utiliser le CLI officiel. » Échangez seulement le harness et le taux de réussite comme le coût par tâche bougent. Le modèle reste le même ; la facture non.
- Traiter le prix catalogue par million de tokens comme coût de développement : Un modèle moins cher peut brûler plus de tours. Un prompt épais occupe encore l'attention après un hit de cache. Le prix par million est un prix d'achat, pas un résultat de projet.
- Lire les droits par défaut du même utilisateur de Pi comme une commodité : Pas de popup n'est pas la même chose que sûr. Mettez d'abord en bac à sable les dépôts inconnus et les secrets. L'absence de demande est une porte manquante, pas une fonctionnalité.
- Épingler chaque job à l'effort maximum : Un harness mince peut perdre au palier supérieur. L'acceptation doit inclure le cadran. Un seul palier maximal est du marketing, pas une mesure.
- Découper des sous-agents pour le parallélisme : Chaque enfant peut recharger tout le prompt système. La facture peut battre le gain de vitesse. Un parallélisme visible sans livre de tokens n'est souvent que de la chaleur plus chère.
Plan d'action : 7 étapes
- Choisissez trois échantillons dans ce dépôt : générez une tranche dans le style existant, corrigez un test déjà rouge, et localisez une régression sans nommer le fichier. Supprimez les demandes vides du type « rends-le meilleur ». Gelez les trois tâches avant que quiconque change de harness.
- Lancez ces trois sur le même modèle dans Pi et dans le harness fournisseur. Journalisez les tokens d'entrée et de sortie, le temps mur, si les tests sont devenus verts, et quels fichiers ont changé. Interdisez à l'agent de lire l'historique git qui fuit la réponse. Sans ce journal, la prochaine dispute n'est que de la mémoire.
- Séparez le travail en remplissages mécaniques et exploration floue. Par défaut, le premier va à Pi et le second à Claude Code ou Codex. Écrivez le ratio dans une note d'équipe pour que personne ne le renégocie chaque matin. Un ratio fixe coûte moins cher que des débats de goût quotidiens.
- Écrivez le chemin de facturation. Les titulaires de siège ne devraient pas changer pour un titre « tokens à moitié prix » s'ils ne paient pas déjà l'API. Les utilisateurs au compteur devraient tabuler les dollars par tâche testée, pas l'étiquette. L'euro par suite verte bat n'importe quel prix catalogue.
- Choisissez une isolation pour Pi : conteneur local, micro-VM ou nœud Mac distant. Vérifiez les modes de permission et les serveurs MCP autorisés sur le harness épais. Les clés restent hors des prompts et des captures d'écran. L'isolation fait partie de l'acceptation, pas d'une pensée après fuite.
- Choisissez un harness principal selon la scène et autorisez un stack. Le travail solo peut être Pi d'abord. Une petite équipe peut explorer dans Claude Code et remplir dans Pi. Les entreprises verrouillent les écritures derrière des portes auditées. Un stack est permis ; l'arbitraire ne l'est pas.
- Placez l'exécution sur un nœud Mac reproductible : même image, même commande de test, espace de travail effacé en fin de session. Un run vert qui n'existe que dans le cache d'un portable n'est pas une acceptation. La reproductibilité bat une démo verte une seule fois.
FAQ
Quel modèle est le plus fort : Pi, Claude Code ou Codex ?
Mauvaise question. En septembre 2026, les trois peuvent s'asseoir devant un modèle phare. Échangez le harness sur le même modèle et le taux de réussite comme la facture bougent. Comparez comment le contexte est nourri, comment les permissions sont filtrées, et si vous pouvez changer de fournisseur. La question « quel modèle » cache la question plus chère « quelle couche autour du modèle ».
Si je suis déjà abonné à Claude Code, dois-je quand même installer Pi ?
Oui, si vous payez déjà l'usage API ou si vous avez beaucoup d'éditions mécaniques. L'abonnement achète une assurance issue d'un harness épais. Les remplissages mécaniques, le changement de modèle et le contrôle des tokens restent adaptés à Pi. Faites tourner les deux pendant une semaine avant de choisir un chemin principal. Un siège ne remplace pas un tableau d'usage pour des renommages répétitifs.
Codex ne fonctionne-t-il qu'avec les modèles OpenAI ?
La ligne produit par défaut est GPT-5.6 Sol, Terra et Luna. Son avantage est le confinement plus un compte à travers ChatGPT et Codex Web. Si vous avez besoin de Claude, Gemini ou d'un modèle local dans le même CLI, choisissez Pi. Codex peut être le bon produit sans être neutre en modèles ; c'est une propriété de l'isolation, pas un défaut caché.
Un prix de token plus bas signifie-t-il un coût de développement plus bas ?
Non. Comparez les dollars par tâche terminée et testée — pas le prix catalogue par million de tokens. Un modèle moins cher peut brûler plus de tours. Un prompt système épais occupe encore l'attention même quand le cache touche. Le coût de développement est la somme des tours, du retravail et du temps de nœud, pas la cellule d'une grille tarifaire.
Pi n'a pas de popups de permission. Puis-je le lancer sur mon portable ?
Il tournera. Ne le faites pas sur un dépôt inconnu ou des secrets de production. La documentation de Pi dit qu'il hérite des droits de l'utilisateur qui le lance. Mettez-le dans un conteneur ou sur un nœud Mac distant avant d'activer les écritures et le bash. Un portable où le mail, Slack et l'agent partagent les mêmes droits n'est pas un laboratoire, c'est une surface d'attaque commune.
Conclusion
Choisir un agent de coding IA en 2026 n'est pas une course au classement des modèles. Choisissez l'entrée selon l'épaisseur du harness : Pi quand la spec est claire et que vous avez besoin de contrôler les tokens ou de changer de modèle ; Claude Code quand les prompts sont encore minces et que vous voulez des plans et des garde-fous ; Codex quand vous vivez déjà chez OpenAI et voulez un confinement par défaut. Séparez génération de code et correction de bugs selon que l'emplacement est connu. Facturez la tâche terminée, pas l'étiquette. Réglez les permissions d'après les defaults, pas d'après la réputation. Écrivez les trois échantillons, le cadran d'effort et le nœud reproductible dans l'acceptation. Les nœuds distants commencent sur la page de location et la page des tarifs. Les questions de compte vont au centre d'aide. Qui tient cet ordre achète moins de surprises et plus de suites vertes répétables.
Pour aller plus loin
- Coût mensuel Claude Code pour un développeur individuel →
- Qu’est-ce que le Function Calling : OpenAI, Gemini, Claude →
- Qu’est-ce que GPT-6 Astra : prix, contexte, agent de code →
Un agent qui modifie le dépôt et lance des tests a besoin d’un Mac isolé
Pi hérite des droits de l’utilisateur qui le lance. Claude Code et Codex écrivent aussi des fichiers et créent des processus. Cela ne doit pas partager le portable du quotidien. Un Mac distant isole dépôt et secrets par session, pour passer de « ça a tourné » à « on peut retester ».