~/coding-agent

Page générée le données du

Coding Agent

Quel abonnement, quel modèle et quel effort de raisonnement choisir pour votre agent de code — et combien de temps dure votre quota.

Données vérifiées le 28 septembre 2026 · 117 sources

Quoi utiliser, et quand

Choisissez ce que vous allez faire : vous obtenez le fournisseur, le modèle, l'effort de raisonnement et l'abonnement à utiliser, avec les preuves derrière ce choix.

Que voulez-vous faire ?

Classés du plus au moins fréquent dans l'usage des agents de code en 2026, d'après OpenRouter, Anthropic Economic Index, Claude Code, AIDev.

Code au quotidien et débogage

Fonctionnalités, débogage, corrections de bugs, revues, petits refactors — le travail de toute la journée.

  • Corriger un test qui échoue ou un bug signalé
  • Ajouter un endpoint, un formulaire, une option de CLI
  • Relire une pull request
  • Petit refactor sur quelques fichiers
✓ Choix retenu

Claude Opus 5.5(défaut)·effort medium(défaut)

Agent
Claude Code
Abonnement
Claude Pro (20 $) ou Max (100 $ / 200 $)
Fournisseur
Anthropic
Alternative

GPT-6 Sol·effort high

Codex · ChatGPT Plus (20 $) ou Pro (100 $ / 200 $)

Codex sur ChatGPT Plus : DeepSWE 65,3 % à 0,64 $ par tâche — +8,6 points par rapport à medium pour +0,26 $ ; Plus permet environ 15 à 150 messages Sol par 5 heures.

Alternative

GLM-5.3·effort max(défaut)

Claude Code or ZCode · GLM Coding Plan (18 $ / 80 $ / 168 $)

Petit budget : GLM Coding Plan Lite (18 $/mois, 2 000 crédits par 5 heures) dans Claude Code ; DeepSWE 69,0 % en max.

Comment travailler

  1. Pas besoin de plan si vous pouvez décrire la modification en une phrase ; sinon, tapez /plan <tâche> — plus fiable que Shift+Tab, qui part désormais du mode auto.
  2. Restez en medium (le défaut). Pour un bug tenace, montez avec /effort high, ou ajoutez ultrathink dans un seul prompt.
  3. Donnez à l'agent une vérification qu'il peut lancer (tests, build, lint) et demandez la commande et sa sortie, pas une affirmation. Après deux corrections ratées, /rewind ou /clear, puis reformulez avec ce que vous avez appris.
  4. Avant la pull request : /code-review cherche les bugs dans un sous-agent vierge ; /simplify nettoie le diff mais ne cherche pas les bugs.
  5. Dans Codex : /model → GPT-6 Sol, effort high ; structurez le prompt en Objectif, Contexte, Contraintes, Critère de fin.

Pourquoi

  • Meilleure qualité par unité de quota : 51,2 à l'indice AA pour 1,34 $ par tâche, devant GPT-6 Astra en high (50,9 pour 1,73 $).
  • Sous-ensemble SWE-bench Pro d'Anthropic : 92,8 % résolus à 0,22 $ par tâche résolue, contre 92,3 % à 1,19 $ pour Fable 5.1 à son réglage par défaut.
  • C'est le modèle et l'effort par défaut de Claude Code depuis le 2026-09-22. Passez en high pour un bug difficile : +4 points sur Terminal-Bench 4.0 (52,5 % → 56,6 %) pour environ 27 % de quota en plus.

Sources : Artificial Analysis model leaderboard · Optimizing for cost and intelligence · Model configuration · DeepSWE v1.1 leaderboard · Introducing GPT-6 Sol and Luna · Codex pricing · GLM Coding Plan · Claude Code best practices · Claude Code commands · Claude Code permission modes

Les habitudes qui paient, dans tous les agents

Quelle que soit la tâche : ce que documentent Claude Code, Codex, Antigravity et Grok Build, et ce que fait le créateur de Claude Code, vérifié dans la documentation actuelle (les astuces périmées sont écartées).

  1. 01

    La vérification d'abord

    Donnez à l'agent un test réussi/échoué (tests, build, capture) et demandez des preuves, pas des affirmations. Tous les éditeurs placent ce conseil en premier.

    Sources : Claude Code best practices · Codex best practices · Antigravity CLI best practices · How I use Claude Code (thread)

  2. 02

    Planifier seulement quand c'est utile

    Planifiez un travail ambigu, sur plusieurs fichiers ou dans un code inconnu ; pas une modification d'une phrase. Les modèles récents planifient dans la conversation, et /plan reste disponible.

    Sources : Claude Code best practices · Grok Build plan mode · Boris Cherny on plan mode (Hacker News)

  3. 03

    Une tâche par session

    /clear entre deux tâches sans rapport, /rewind plutôt que d'empiler les corrections, /btw pour une question annexe, /compact <quoi garder> en cours de tâche.

    Sources : Claude Code best practices · Claude Code commands

  4. 04

    Des fichiers d'instructions courts

    Gardez AGENTS.md / CLAUDE.md courts : ajoutez une règle quand une erreur se répète, retirez ce que le modèle fait déjà, et retestez après chaque nouveau modèle (/doctor).

    Sources : Claude Code best practices · Codex best practices

  5. 05

    Montez l'effort plutôt que de supplier

    Partez de l'effort par défaut de l'agent ; montez-le (ou ultrathink pour un tour) plutôt que d'écrire « réfléchis plus », et gardez xhigh et max pour les tâches où le gain est mesuré.

    Sources : Prompting Claude Opus 5.5 · Model configuration

  6. 06

    Revue en contexte vierge

    Faites relire le code par un agent qui ne l'a pas écrit (/code-review, /review), en lui demandant de ne signaler que les problèmes de correction.

    Sources : Claude Code best practices · Claude Code commands

  7. 07

    Le parallélisme coûte du quota

    Worktrees, sessions parallèles, sous-agents et workflows démultiplient le travail, mais tous puisent dans les mêmes limites d'abonnement : vérifiez le simulateur avant de passer à l'échelle.

    Sources : Claude Code costs · Claude Code worktrees

  8. 08

    Mode auto, pas skip-permissions

    Utilisez le mode auto (un classifieur filtre chaque action) ou un bac à sable ; jamais --dangerously-skip-permissions dans une session normale.

    Sources : Claude Code permission modes

Ce qu'il ne faut pas faire en ce moment

Les habitudes qui gaspillent du quota ou de la qualité avec les modèles et abonnements actuels — chacune avec ce qu'il faut faire à la place et les chiffres qui le justifient. Revérifié à chaque mise à jour des données.

Modèles

  • À éviter : Coder tout avec Claude Fable 5.1, surtout en max

    À la place : Claude Opus 5.5 en medium (défaut), xhigh pour les longues sessions.

    Opus 5.5 le bat partout pour une fraction du quota. Terminal-Bench 4.0 (AA) : Fable en max 52,0 % pour 19,22 $ par tâche, sous son propre xhigh (55,1 %) et sous Opus 5.5 en xhigh (59,6 % pour 8,78 $). CursorBench 4.0 : Fable en max 51,8 pour 17,28 $, Opus 5.5 en high 56,0 pour 3,97 $. Sur les plans Max, Fable est en plus plafonné à 50 % de la limite hebdomadaire.

    Sources : Artificial Analysis model leaderboard · CursorBench 4.0 · Claude Fable models on your plan

  • À éviter : Choisir Claude Sonnet 5 pour économiser du quota

    À la place : Claude Opus 5.5 en low pour le travail bon marché, ou en medium (défaut).

    Opus 5.5 en low bat Sonnet 5 en max à l'indice AA (42,3 contre 38,2) pour un neuvième du coût (0,55 $ contre 5,09 $), et Opus 5.5 est le modèle par défaut de Claude Code.

    Sources : Artificial Analysis model leaderboard · Model configuration

  • À éviter : Utiliser GPT-6 Sol, même en max, pour de longues sessions autonomes dans le terminal

    À la place : GPT-6 Astra en high : même coût, dix points de plus.

    Terminal-Bench 4.0 (AA) : Sol en max 43,9 % pour 4,00 $ par tâche, Astra en high 54,0 % pour 4,05 $. Sol reste un bon modèle pour le quotidien.

    Sources : Artificial Analysis model leaderboard

  • À éviter : Confier à Kimi K3 de longues tâches dans le terminal

    À la place : GLM-5.3 en max (41,9 %) pour un petit budget ; gardez Kimi K3 pour les interfaces web et la visualisation de données, où il est en tête.

    Terminal-Bench 4.0 (AA) : 12,6 % en max, autant qu'en low.

    Sources : Artificial Analysis model leaderboard · Design Arena: data visualization

Effort de raisonnement

  • À éviter : Laisser max pour le travail de tous les jours

    À la place : L'effort par défaut de l'agent ; xhigh pour les sessions de plusieurs heures ; max seulement là où vous avez mesuré un gain.

    Opus 5.5 : medium (défaut) 54,6 % sur FrontierCode pour 0,80 $, max 54,4 % pour 6,19 $ ; sur Terminal-Bench 4.0, max égale xhigh (59,6 %) pour 49 % de plus. GPT-6 Astra : xhigh égale ou bat max sur Terminal-Bench 4.0 et DeepSWE (59,6 % contre 59,1 % ; 74,1 % contre 73,2 %) pour 30 à 40 % de moins. Anthropic prévient que max peut trop réfléchir.

    Sources : FrontierCode leaderboard data · Artificial Analysis model leaderboard · DeepSWE v1.1 leaderboard · Model configuration

  • À éviter : Descendre Claude Opus 5.5 en low pour du vrai travail d'agent

    À la place : medium (défaut) ; gardez low pour les sous-agents et les modifications en masse.

    Terminal-Bench 4.0 (AA) : low 31,3 % contre medium 52,5 % — 21 points perdus pour économiser 1,97 $ par tâche.

    Sources : Artificial Analysis model leaderboard

  • À éviter : Pousser Grok 4.7 au-dessus de high (défaut)

    À la place : Restez en high (défaut).

    xhigh ajoute 1 point sur Terminal-Bench 4.0 (24,7 % → 25,8 %) pour 63 % de coût en plus, et fait moins bien sur FrontierCode (47,6 % → 45,6 %).

    Sources : Artificial Analysis model leaderboard · FrontierCode leaderboard data

Habitudes

  • À éviter : Lancer ultracode ou un workflow pour des tâches ordinaires

    À la place : Une seule session pour le travail courant ; gardez les workflows pour une grosse migration ou un audit, essayés d'abord sur un seul dossier.

    Un workflow orchestre des dizaines d'agents, et chaque agent puise dans les mêmes limites d'abonnement : Claude Code avertit au-delà de 25 agents ou 1,5 M de tokens. Combiné à Fable ou à max, une seule exécution peut consommer une semaine de quota.

    Sources : Claude Code workflows · Claude Code costs

  • À éviter : Lancer avec --dangerously-skip-permissions pour aller plus vite

    À la place : Le mode auto (le défaut) : un classifieur filtre chaque action ; ou un bac à sable, un conteneur.

    Il supprime toutes les protections sur la suppression de fichiers, les commandes shell et l'accès réseau, alors que le mode auto évite déjà la plupart des demandes.

    Sources : Claude Code permission modes · Claude Code best practices

  • À éviter : Forcer le mode plan pour chaque petite modification

    À la place : Planifiez seulement un travail ambigu ou sur plusieurs fichiers, avec /plan.

    La documentation dit de sauter le plan quand la modification tient en une phrase, et le créateur de Claude Code dit que le mode plan n'est plus utile avec Opus 5.5 — il coûte surtout un aller-retour.

    Sources : Claude Code best practices · Boris Cherny on plan mode (Hacker News)

Combien de temps vos abonnements vont-ils tenir ?

Indiquez vos abonnements et votre façon de travailler : vous obtenez les heures d'agent par fenêtre de 5 h et par semaine, et le moment où le quota sera épuisé.

Performance face à l'usure du quota

Chaque ligne représente un modèle à travers ses niveaux d'effort de raisonnement. Plus à gauche = la tâche consomme moins de quota ; plus haut = meilleur résultat. La fine ligne en escalier est la frontière efficace : aucune autre combinaison modèle × effort ne fait mieux pour moins cher.

Benchmark

IndépendantTâches agentiques en terminal exécutées par Artificial Analysis avec le même harnais pour tous les modèles, à chaque niveau d'effort.

Source mise à jour en continu · Récupéré le 28 sept. 2026

Mettre en avant des modèles (trait plus épais et étiquette ; utilisez la légende du graphique pour masquer des modèles)

Score selon le coût par tâche

Coût en équivalent API aux prix catalogue, échelle logarithmique — le même ratio que celui de l'usure des quotas d'abonnement.

Molette ou pincement pour zoomer (Maj + molette pour l'axe vertical), faites glisser le curseur, ou utilisez l'outil de zoom en haut à droite. Cliquez sur une entrée de la légende pour la masquer ou l'afficher.

17 résultats sans coût publié n'apparaissent que dans le graphique d'effort et le tableau.

Score selon l'effort de raisonnement

Là où la courbe s'aplatit, le niveau d'effort suivant coûte plus de quota pour un gain faible ou nul.

Afficher le tableau de données

Classements du code

Classements indépendants des agents de code et du développement web. Activez ou désactivez chaque classement ; faites défiler ou zoomez dans un graphique, et cliquez sur un fournisseur dans sa légende pour le masquer.

Classements à afficher

Artificial Analysis Coding Agent Index v1.5

Chaque agent de code avec le modèle de son éditeur (Claude Code, Codex, Grok Build, Kimi Code, Antigravity, OpenCode) sur DeepSWE, Terminal-Bench 4.0 et SWE-Atlas-QnA — l'indicateur le plus proche de ce qu'un abonnement vous donne.

Source mise à jour le 6 sept. 2026 · Récupéré le 28 sept. 2026 · 20 modèles

Couverture incomplète — ces données n'incluent pas Claude Sonnet 5. Des modèles importants actuels manquent : le classement présenté ici n'est donc pas entièrement pertinent.

Afficher le tableau de données

Arena Code: WebDev

Votes humains à l'aveugle, par paires, sur des tâches de développement web (795 514 votes, arrêtés au 2026-09-25).

Source mise à jour le 25 sept. 2026 · Récupéré le 28 sept. 2026 · 134 modèles

Afficher le tableau de données

Design Arena: agentic web app, full-stack

Deux agents construisent la même application full-stack (React, Supabase, déployée sur Vercel) dans un bac à sable avec 23 outils ; des personnes votent pour la meilleure.

Source mise à jour le 28 sept. 2026 · Récupéré le 28 sept. 2026 · 49 modèles

Couverture incomplète — ces données n'incluent pas Claude Opus 5.5, Grok 4.7, GLM-5.3. Des modèles importants actuels manquent : le classement présenté ici n'est donc pas entièrement pertinent.

Afficher le tableau de données

Chiffres officiels de lancement

Ce que chaque éditeur a publié pour son propre modèle à sa sortie, avec l'effort utilisé. Chaque éditeur choisit son agent, son harnais et ses réglages : ces chiffres sont en général plus élevés que les mesures indépendantes. Servez-vous-en pour connaître les annonces de chacun, et des graphiques ci-dessus pour comparer.

ModèleSWE-bench VerifiedSWE-bench ProTerminal-Bench 2.xTerminal-Bench 4.0DeepSWE v1.1FrontierCode 1.1
Claude Fable 5.1Anthropic—81,2%↗max—55,8%↗max—50,3%↗max
Claude Opus 5.5Anthropic—89,9%↗max—66,4%↗xhigh74,2%↗max54,4%↗max
Claude Sonnet 5Anthropic85,2%↗max63,2%↗max80,4%↗xhigh · 2.1———
Claude Haiku 4.5Anthropic73,3%↗—————
GPT-6 AstraOpenAI———57,88%↗high74,12%↗xhigh53,3%↗max
GPT-6 SolOpenAI————68,81%↗max49,27%↗max
GPT-6 LunaOpenAI————66,59%↗max42,42%↗max
Gemini 3.8 FlashGoogle——89,4%↗medium · 2.119,1%↗73,7%↗high (défaut)—
Gemini 3.7 FlashGoogle——85,8%↗medium (défaut) · 2.111,2%↗65,3%↗—
Gemini 3.1 Pro (preview)Google80,6%↗high (défaut)54,2%↗high (défaut)68,5%↗high (défaut) · 2.0———
Grok 4.7xAI———38%↗xhigh71%↗high (défaut)—
Grok 4.6xAI———20,3%↗high (défaut)65,9%↗high (défaut)—
Kimi K3Moonshot AI——88,3%↗max · 2.1—67,5%↗max—
GLM-5.3Z.ai——88,2%↗max (défaut) · 2.1—66,9%↗max (défaut)—
GLM-5.3-FlashZ.ai——84,3%↗2.1—63,4%↗—

Distant ou local ?

Au-delà des six fournisseurs ci-dessus : les autres abonnements qui valent le coup, et quand faire tourner un modèle sur sa propre machine a du sens.

Les autres abonnements à connaître

AbonnementPrix / moisQuotaVerdict
GitHub Copilot↗↗$10 / $39 / $100Crédits en dollars aux prix API : 15 $ sur Pro, 70 $ sur Pro+, 200 $ sur Max ; complétions gratuites.à considérerDeuxième agent de code le plus utilisé (21 %) ; GPT-6, Opus 5.5, Fable 5.1, Gemini 3.8 Flash, Grok 4.7 et Kimi K3 dans VS Code, JetBrains et la CLI.
Alibaba Qwen Coding Plan↗↗↗$506 000 requêtes par 5 heures, 45 000 par semaine, 90 000 par mois.à considérerQuotas publiés ; Qwen3.8 Max est 6e d'Arena WebDev et à 43,3 à l'AA Coding Agent Index ; fonctionne dans Claude Code, Codex et OpenCode.
OpenCode Go↗$10Par 5 heures : Kimi K3 110 requêtes, Qwen3.8 Max 160, GLM-5.3 220, DeepSeek V4.1 Flash 26 000.à considérerLe moyen le moins cher d'utiliser les meilleurs modèles à poids ouverts dans un bon agent (OpenCode est le harnais utilisé par AA pour GLM).
MiniMax Token Plan↗↗↗$22 / $55 / $132Fenêtres de 5 heures et hebdomadaire, en tokens.à surveillerPlan clair et 47,2 % sur SWE-rebench, mais seulement 2,0 % sur Terminal-Bench 4.0 selon AA : à surveiller au prochain modèle.
Meta Muse Code↗↗$5 / $15 / $5010 à 50 prompts par 5 heures sur Everyday ; 5× et 20× au-dessus.de niche54,3 à l'AA Coding Agent Index (au-dessus de Kimi K3) pour un petit prix.
Xiaomi MiMo Token Plan↗↗$6 – $100Crédits, −20 % en heures creuses.de nicheTrès bon marché ; MiMo-V2.6-Pro atteint 34,8 % sur Terminal-Bench 4.0 selon AA.
Cursor↗$20 / $60 / $200Deux pools (modèles Cursor, autres modèles), tailles non publiées.de nicheUne surface IDE pour de nombreux modèles, dont Grok 4.7 et Composer 2.5.
Devin↗↗$20 / $200Non publié.de nicheDevin Fusion (Fable 5.1 + SWE-2) obtient 61,7 à l'AA Coding Agent Index.
Factory Droid↗$20 / $100 / $200Multiplicateurs par modèle (Opus 5.5 1,6×, GPT-6 Astra 4×).de nicheAgent multi-modèles avec des multiplicateurs explicites.
Mistral Vibe↗↗$14.99 / $24.99Non publié.de nicheOption européenne ; Mistral Medium 3.5 obtient 0 % sur Terminal-Bench 4.0 selon AA.

Faire tourner des modèles en local

Les modèles locaux forment une catégorie à part : ils ne consomment aucun quota, mais les meilleurs atteignent 5 à 33 % sur Terminal-Bench 4.0, contre environ 60 % pour les modèles de pointe. Associez un modèle local pour le travail de routine à un modèle distant de pointe pour les tâches difficiles.

MatérielModèle conseilléMémoireVitesse de générationQualité (indice AA · Terminal-Bench 4.0)
GPU 24 Go (RTX 4090 / 3090)Qwen3.8-27B Q4_K_M16.5 GB38–46 tok/sAA 33.7 · TB4 5.6%↗↗↗
GPU 32 Go (RTX 5090)Qwen3.8-27B Q6 / NVFP422–25 GB23–75 tok/s · MTP 98–134AA 33.7 · TB4 5.6%↗↗
128 Go de mémoire unifiée (Strix Halo, DGX Spark, M5 Max)Qwen3.8-Flash-Next IQ4_XS93.7 GB11–37 tok/s · MTP 47–84AA 39.8 · TB4 25.3%↗↗
256 Go de mémoire unifiée (M5 Ultra, M3 Ultra)GLM-5.3-Flash MLX 4-bit204 GB26–41 tok/sAA 41.8 · TB4 32.8%↗↗

Intéressant pour

  • Du code privé ou réglementé qui ne doit pas quitter la machine
  • Travailler hors ligne
  • Du matériel que vous possédez déjà
  • Du travail de routine en volume : boilerplate, tests, sous-agents
  • Une machine de 256 Go partagée par une équipe

Pas intéressant pour

  • Économiser par rapport à un abonnement à 20 $ (matériel et électricité : 10 à 270 $ par mois)
  • Les tâches agentiques difficiles : l'écart de qualité avec les modèles de pointe est grand

Références

Chaque chiffre de cette page vient de ces pages. Pour chacune : ce que nous y avons pris, et quand.

  1. Model Studio Coding PlanAlibaba CloudOfficielle

    Qwen Coding Plan Pro price and request quotas per 5 hours, week and month.

    Publiée le 11 sept. 2026 · Consultée le 28 sept. 2026

  2. Anthropic Economic Index: impact on software developmentAnthropicOfficielle

    Languages (JS/TS 31%, HTML/CSS 28%) and task clusters (UI/UX components 12%, first) in 500,000 coding interactions.

    Publiée le 28 avr. 2025 · Consultée le 28 sept. 2026

  3. Claude Code /goalAnthropicOfficielle

    `/goal <condition>`: a separate evaluator re-checks the condition after each turn.

    Consultée le 28 sept. 2026

  4. Claude Code best practicesAnthropicOfficielle

    Verification first (prompt, `/goal`, Stop hook, subagent); skip the plan for one-sentence changes; prune CLAUDE.md; `/clear` after two failed corrections; `/batch` fan-out; adversarial review.

    Consultée le 28 sept. 2026

  5. Claude Code commandsAnthropicOfficielle

    `/code-review` (alias `/review`), `/simplify` (cleanup, not bug finding), `/batch`, `/goal`, `/effort`, `/doctor`, `/btw`, `/rewind`.

    Consultée le 28 sept. 2026

  6. Claude Code costsAnthropicOfficielle

    Subagents and agent teams draw on the same usage limits; agent teams use about 7× more tokens when teammates run in plan mode.

    Consultée le 28 sept. 2026

  7. Claude Code in ChromeAnthropicOfficielle

    `claude --chrome` lets the agent drive the browser; requires a subscription login (`/login`), unavailable with an API key.

    Consultée le 28 sept. 2026

  8. Claude Code permission modesAnthropicOfficielle

    Auto mode is the starting mode since v2.1.283; `Shift+Tab` cycles auto → default → acceptEdits → plan; `/plan`.

    Consultée le 28 sept. 2026

  9. Claude Code workflowsAnthropicOfficielle

    `ultracode` keyword or “use a workflow”; quota cost and the warning beyond 25 agents or 1.5M tokens.

    Consultée le 28 sept. 2026

  10. Claude Code worktreesAnthropicOfficielle

    `claude --worktree <name>` / `-w` for isolated parallel sessions.

    Consultée le 28 sept. 2026

  11. Claude Fable 5.1 and Mythos 5.1AnthropicOfficielle

    CursorBench 3.2.0 and Terminal-Bench 4.0 score and cost at each effort level for Fable 5.1, Fable 5 and Mythos 5.1.

    Publiée le 1 sept. 2026 · Consultée le 28 sept. 2026

  12. Claude Fable models on your planAnthropicOfficielle

    Fable models use limits faster and are capped at 50% of the weekly limit on Max and Team Premium; credits only on Pro and Team Standard.

    Consultée le 28 sept. 2026

  13. Claude Opus 5.5AnthropicOfficielle

    Score and cost per task at each effort level for Opus 5.5, Fable 5.1 and Opus 5 on Terminal-Bench 4.0, FrontierCode v1.1 and CursorBench 4.0; five-hour limit change of 2026-09-22.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  14. Claude Opus 5.5 System CardAnthropicOfficielle

    Headline coding scores (SWE-bench Pro, Terminal-Bench 4.0 at xhigh and max, DeepSWE v1.1, CursorBench 4.0) versus Opus 5, Fable 5.1 and GPT-6 Astra.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  15. Claude pricingAnthropicOfficielle

    Prices of Free, Pro, Max 5x, Max 20x, Team and Enterprise plans and what each includes.

    Consultée le 28 sept. 2026

  16. Claude Sonnet 5 System CardAnthropicOfficielle

    Headline coding scores of Sonnet 5 at max effort (SWE-bench Verified, SWE-bench Pro, Terminal-Bench 2.1).

    Publiée le 30 juin 2026 · Consultée le 28 sept. 2026

  17. EffortAnthropicOfficielle

    Effort levels available per model and when to use each (xhigh for agentic coding over 30 minutes, low for subagents).

    Consultée le 28 sept. 2026

  18. How AI is transforming work at AnthropicAnthropicOfficielle

    Claude Code transcripts by task: feature implementation 36.9%, design and planning 9.9%; daily use for debugging 55%.

    Publiée le 2 déc. 2025 · Consultée le 28 sept. 2026

  19. How do usage and length limits work?AnthropicOfficielle

    Five-hour session and weekly limits; no fixed message count; what drives consumption (model, effort, length, tools).

    Consultée le 28 sept. 2026

  20. Introducing Claude Haiku 4.5AnthropicOfficielle

    SWE-bench Verified score of Haiku 4.5.

    Publiée le 15 oct. 2025 · Consultée le 28 sept. 2026

  21. Introducing Claude Sonnet 5AnthropicOfficielle

    Release date, positioning and headline coding scores of Sonnet 5.

    Publiée le 30 juin 2026 · Consultée le 28 sept. 2026

  22. Model configurationAnthropicOfficielle

    Default model (Opus 5.5 on every plan since v2.1.280) and default effort per model in Claude Code.

    Consultée le 28 sept. 2026

  23. Models overviewAnthropicOfficielle

    Model IDs, release dates, context windows, max output and status of every current Claude model.

    Consultée le 28 sept. 2026

  24. Models, usage, and limits in Claude CodeAnthropicOfficielle

    Opus uses meaningfully more quota than Sonnet; higher effort reaches limits faster.

    Consultée le 28 sept. 2026

  25. Optimizing for cost and intelligenceAnthropicOfficielle

    Cost per solved task on a 478-problem SWE-bench Pro subset for Opus 5.5, Fable 5.1 and Sonnet 5 configurations; effort trade-offs for Opus 5.5.

    Consultée le 28 sept. 2026

  26. PricingAnthropicOfficielle

    Input, cache write, cache read and output prices per million tokens; batch and fast-mode prices.

    Consultée le 28 sept. 2026

  27. Prompting Claude Opus 5.5AnthropicOfficielle

    Start at medium; reserve xhigh and max for work with a measured gain; name the finish line; name the frontend styles to avoid.

    Consultée le 28 sept. 2026

  28. What is the Max plan?AnthropicOfficielle

    Max 5x and Max 20x usage relative to Pro per five-hour session; monthly billing only.

    Consultée le 28 sept. 2026

  29. 5-hour session limits increaseAnthropic (ClaudeDevs on X)Officielle

    Five-hour limits up 20% on 2026-09-22; Opus 5.5 goes 25% further within limits because it is priced lower.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  30. Arena Code: WebDev leaderboardArena (LMArena)Tierce

    Rating, 95% confidence interval, votes and rank of every model on blind pairwise web-development votes (entries[] in the server-rendered payload; vote cutoff 2026-09-25).

    Publiée le 25 sept. 2026 · Consultée le 28 sept. 2026

  31. Artificial Analysis Coding Agent IndexArtificial AnalysisTierce

    Coding Agent Index v1.5 per harness × model (Claude Code, Codex, Grok Build, Kimi Code, Antigravity, OpenCode): score, cost, tokens and time per task.

    Consultée le 28 sept. 2026

  32. Artificial Analysis evaluation detailsArtificial AnalysisTierce

    Per-model sub-scores embedded in the page payload: Humanity's Last Exam, CritPt, SciCode, GPQA and Terminal-Bench 4.0 for each model × effort.

    Consultée le 28 sept. 2026

  33. Artificial Analysis model leaderboardArtificial AnalysisTierce

    Intelligence Index v4.3 and AA's own Terminal-Bench 4.0 run for every model × effort, with cost per task and output tokens per task (JSON embedded in the page).

    Consultée le 28 sept. 2026

  34. Grok 4.7 usage on SuperGrok HeavyBigGo Finance (reporting a user post)Tierce

    About $40 of Grok 4.7 usage in Grok Build burned about 8% of the Heavy weekly limit.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  35. How I use Claude Code (thread)Boris Cherny (X)Tierce

    Personal workflow of Claude Code's creator: give Claude a way to verify its work (his estimate: 2–3× the quality), shared CLAUDE.md, subagents, hooks. Read through a mirror (x.com answers 402).

    Publiée le 2 janv. 2026 · Consultée le 28 sept. 2026

  36. Claude Max weekly limit measurementsClassmethodTierce

    Weekly budget of Max 5x and Max 20x in API-equivalent dollars (two accounts, /usage vs ccusage).

    Publiée le 20 août 2026 · Consultée le 28 sept. 2026

  37. Codex usage researchcodexusage.devTierce

    Codex Plus 5-hour and weekly budgets in credits and dollars, cost per busy hour by effort level.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  38. Coding plan trackercodingplan.orgTierce

    Current Kimi plan names and CNY prices (Go, Plus, Pro, Max) and the mapping from legacy names.

    Publiée le 24 sept. 2026 · Consultée le 28 sept. 2026

  39. Devin pricingCognitionOfficielle

    Devin Pro and Max prices.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  40. FrontierCode leaderboard dataCognitionTierce

    FrontierCode v1.1 score (new_score), cost, tokens and duration for every model × effort, main and extended subsets.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  41. Cursor pricingCursorOfficielle

    Cursor Pro, Pro+ and Ultra prices and their two usage pools.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  42. CursorBench 4.0CursorTierce

    Score, cost per task, tokens and steps for every model × effort (server-rendered results table).

    Publiée le 10 sept. 2026 · Consultée le 28 sept. 2026

  43. DeepSWE v1.1 leaderboardDatacurveTierce

    pass@1 and mean cost per task for every model × effort (mini-swe-agent harness, 4 runs).

    Consultée le 28 sept. 2026

  44. GLM-5.3 in Claude Code: real cost on the Coding PlanDécodeur IATierce

    Lite plan in Claude Code: a 3-hour session used 70% of a 2,000-credit window; one endpoint with tests took 18 minutes and 210 credits.

    Publiée le 29 août 2026 · Consultée le 28 sept. 2026

  45. Design Arena: agentic web devDesign ArenaTierce

    Elo, standard error, win rate and battles for the full-stack and frontend agentic web-app arenas (embedded boards and /api/leaderboard).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  46. Design Arena: data visualizationDesign ArenaTierce

    Elo, battles and win rate of 163 models on blind human votes for chart and dashboard code (POST /api/leaderboard, category dataviz, 79,202 votes; no standard error published).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  47. Design Arena: SVGDesign ArenaTierce

    Elo, standard error, battles and win rate of 123 models on blind human votes for SVG generation (POST /api/leaderboard, category svg, 190,054 votes).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  48. Factory pricingFactoryOfficielle

    Droid Pro, Plus and Max prices and per-model multipliers.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  49. Kimi plans in USDgeotoolbox.aiTierce

    International USD prices of Kimi plans and their Kimi Code usage multipliers (1×, 5×, 15×, 30×).

    Publiée le 5 sept. 2026 · Consultée le 28 sept. 2026

  50. GitHub Copilot plansGitHubOfficielle

    Copilot Pro, Pro+, Max, Business and Enterprise prices and the AI Credits included with each.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  51. Pro 20x weekly meter measurementGitHub user reportTierce

    Weekly meter moved from 64% to 95% for $609 of API-equivalent usage on Pro 20x.

    Publiée le 10 sept. 2026 · Consultée le 28 sept. 2026

  52. Three weekly meters on Pro 5xGitHub user reportTierce

    Three full weekly Pro 5x meters = $959.87 API-equivalent (about $320 per week) and 708 M tokens on GPT-5.6 Sol and Astra.

    Publiée le 7 sept. 2026 · Consultée le 28 sept. 2026

  53. Weekly allowance value on Pro 20x (GPT-5.6 Sol vs GPT-6 Astra)GitHub user reportTierce

    API-equivalent value of a full weekly Pro 20x allowance: about $1,925 on GPT-5.6 Sol, $1,191–1,234 on GPT-6 Astra.

    Publiée le 8 sept. 2026 · Consultée le 28 sept. 2026

  54. Claude Code usage meter measurementsGitHub user reportsTierce

    Controlled A/B measurements of API-equivalent dollars per 1% of the 5-hour and weekly meters (interactive vs headless), Pro and Max.

    Publiée le 27 sept. 2026 · Consultée le 28 sept. 2026

  55. Antigravity CLI best practicesGoogleOfficielle

    Verification loops first; explore, plan, then execute; `/rewind`, `/fork`, parallel subagents.

    Consultée le 28 sept. 2026

  56. Antigravity modelsGoogleOfficielle

    Models available per plan and thinking options (Low/Medium/High) in Antigravity; two usage pools with five-hour and weekly remaining percentages.

    Consultée le 28 sept. 2026

  57. Antigravity plansGoogleOfficielle

    Quota wording per plan: weekly refresh on Free, five-hour refresh until a weekly limit on Pro and Ultra.

    Consultée le 28 sept. 2026

  58. Changes to Antigravity plansGoogleOfficielle

    Ultra $100 = 5× and $200 = 20× the Pro token allowance; the Gemini pool is drawn down at API prices; Claude and GPT models use a separate fixed pool.

    Publiée le 19 mai 2026 · Consultée le 28 sept. 2026

  59. Gemini API pricingGoogleOfficielle

    Prices per million tokens for Gemini 3.8/3.7 Flash (introductory until 2026-12-31) and 3.1 Pro Preview.

    Publiée le 24 sept. 2026 · Consultée le 28 sept. 2026

  60. Gemini thinkingGoogleOfficielle

    Thinking levels and defaults per Gemini model; guidance per level.

    Publiée le 25 sept. 2026 · Consultée le 28 sept. 2026

  61. Google AI subscriptionsGoogleOfficielle

    Prices of Google AI Plus, Pro, Ultra 5x and Ultra 20x; Gemini app usage multipliers.

    Consultée le 28 sept. 2026

  62. Gemini 3.1 Pro model cardGoogle DeepMindOfficielle

    SWE-bench Verified, SWE-bench Pro and Terminal-Bench 2.0 scores of Gemini 3.1 Pro (high thinking).

    Publiée le 19 févr. 2026 · Consultée le 28 sept. 2026

  63. Gemini 3.8 Flash evaluationGoogle DeepMindOfficielle

    Coding benchmark table of Gemini 3.8 Flash versus Opus 5, Sonnet 5 and GPT-5.6, with the settings used.

    Publiée le 2 sept. 2026 · Consultée le 28 sept. 2026

  64. Boris Cherny on plan mode (Hacker News)Hacker NewsTierce

    “plan mode was useful, and is no longer useful” with Opus 5.5 and Fable; `/plan` stays available (HN Algolia API).

    Publiée le 25 sept. 2026 · Consultée le 28 sept. 2026

  65. SuperGrok Grok Build usage reportHacker NewsTierce

    Four terminals at full speed for one hour used 9% of the SuperGrok weekly pool during a 2× promotion.

    Publiée le 12 août 2026 · Consultée le 28 sept. 2026

  66. Qwen3.8-27B hardware testsHardware CornerTierce

    Local decode speeds of Qwen3.8-27B on RTX 4090, 3090, 5090 and M5 Max at several context lengths.

    Publiée le 17 août 2026 · Consultée le 28 sept. 2026

  67. AI coding agent adoption 2026JetBrains ResearchTierce

    Share of developers using each coding agent (Claude Code 39%, Copilot 21%, Codex 16%, Cursor 12%, OpenCode 7%, Antigravity 6%; 15,000+ respondents).

    Publiée le 15 août 2026 · Consultée le 28 sept. 2026

  68. KiloBenchKiloTierce

    Terminal-Bench 2.0 completion and cost per full attempt in the Kilo agent (embedded chart points).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  69. LiveBenchLiveBenchTierce

    Coding and agentic-coding category scores and cost per question (table_2026_06_25.csv and category files).

    Publiée le 10 sept. 2026 · Consultée le 28 sept. 2026

  70. Best AI for codingllm-stats (ZeroEval)Tierce

    TrueSkill coding rating (μ − 3σ) over 60 benchmark games for every model (initialIndexData in the payload). Needs a cache-busting query string: the plain URL served a stale 2026-09-22 copy.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  71. ZeroEval text-to-SVG arenallm-stats (ZeroEval)Tierce

    Conservative TrueSkill ratings (1,142 votes); last updated 2026-08-05, without Opus 5.5, Fable 5.1 or any GPT-6 model: kept only to show it is stale.

    Publiée le 5 août 2026 · Consultée le 28 sept. 2026

  72. Mac Studio M5 Ultra reviewMacStoriesTierce

    Local decode speed of GLM-5.3-Flash on the M5 Ultra.

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  73. Muse CodeMetaOfficielle

    Muse Code plans (Everyday, High, Power) and prompts per 5 hours.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  74. MiniMax Token PlanMiniMaxOfficielle

    Token Plan prices and 5-hour / weekly windows.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  75. Mistral pricingMistral AIOfficielle

    Vibe Pro and Team prices (no published quota).

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  76. Kimi API pricingMoonshot AIOfficielle

    Cache hit, cache miss and output prices per million tokens for Kimi K3 and K2.7 Code.

    Consultée le 28 sept. 2026

  77. Kimi Code membershipMoonshot AIOfficielle

    Five-hour rolling window, monthly cap shared across Kimi services, extra usage top-ups.

    Consultée le 28 sept. 2026

  78. Kimi Code modelsMoonshot AIOfficielle

    Models in Kimi Code (K3, K2.8 Preview, HighSpeed at 3× quota), effort levels and plan access.

    Consultée le 28 sept. 2026

  79. Kimi K3Moonshot AIOfficielle

    Coding benchmark table of Kimi K3 (max effort) versus Fable 5, GPT-5.6 Sol, Opus 4.8 and GLM-5.2, with harnesses used.

    Publiée le 16 juil. 2026 · Consultée le 28 sept. 2026

  80. Kimi membership pricingMoonshot AIOfficielle

    CNY monthly prices of the membership tiers (legacy names).

    Consultée le 28 sept. 2026

  81. AIDev-pop: pull requests opened by coding agentsMSR 2026 (arXiv)Tierce

    Types of 33,596 agent pull requests: features 43.0%, fixes 24.1%, docs 11.6%, tests 7.0%, refactors 6.8%.

    Publiée le 3 févr. 2026 · Consultée le 28 sept. 2026

  82. SWE-rebenchNebiusTierce

    Resolved rate, pass@5 and cost per task on the 2026-05-15 → 2026-07-01 window (embedded items).

    Publiée le 24 juil. 2026 · Consultée le 28 sept. 2026

  83. Cross-provider quota calibrationoh-my-pi (GitHub)Tierce

    Tokens and API-equivalent dollars per 1% of the Anthropic, OpenAI and Antigravity meters, measured on one machine.

    Publiée le 26 sept. 2026 · Consultée le 28 sept. 2026

  84. About ChatGPT Pro tiersOpenAIOfficielle

    Pro $100 (5× Plus) and Pro $200 (20× Plus); new Pro $200 sign-ups paused since 2026-09-10.

    Consultée le 28 sept. 2026

  85. API pricingOpenAIOfficielle

    Standard, batch, flex and fast-mode prices per million tokens for GPT-6 Astra, Sol and Luna.

    Consultée le 28 sept. 2026

  86. ChatGPT rate card (credit-based pricing)OpenAIOfficielle

    Credits per million tokens for each model (25× the API dollar price); fast mode 2.5×; Ultra billing.

    Consultée le 28 sept. 2026

  87. Codex best practicesOpenAIOfficielle

    Goal / Context / Constraints / Done when; starting efforts per model; `/plan`, interview and PLANS.md; update AGENTS.md after a repeated mistake; worktrees for parallel tasks.

    Consultée le 28 sept. 2026

  88. Codex modelsOpenAIOfficielle

    Effort controls per surface (Light to Ultra), recommended starting presets (Sol Medium, Luna High, Astra Light), surfaces per model.

    Consultée le 28 sept. 2026

  89. Codex pricingOpenAIOfficielle

    Plan prices and the estimated local messages per 5 hours for each model on Plus, Pro 5x, Pro 20x and Business.

    Consultée le 28 sept. 2026

  90. GPT-6 AstraOpenAIOfficielle

    Terminal-Bench 4.0 score, cost, output tokens and latency at each effort for GPT-6 Astra, GPT-5.6 Sol and Fable 5.1; FrontierCode 1.1 Extended; output tokens per DeepSWE task.

    Publiée le 3 sept. 2026 · Consultée le 28 sept. 2026

  91. GPT-6 Astra model page (and /gpt-6-sol, /gpt-6-luna)OpenAIOfficielle

    Release dates, context windows, knowledge cutoffs and supported effort values.

    Consultée le 28 sept. 2026

  92. Introducing GPT-6 Sol and LunaOpenAIOfficielle

    DeepSWE v1.1 and FrontierCode 1.1 Main score and cost per task at each effort for GPT-6 Astra, Sol, Luna, GPT-5.6, Opus 5 and Fable 5.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  93. Managing billing and seats in ChatGPT BusinessOpenAIOfficielle

    Business Standard and Premium seat prices, annual and monthly.

    Consultée le 28 sept. 2026

  94. Managing usage with GPT-6 Astra in Work and CodexOpenAIOfficielle

    Five-hour and weekly windows, shared allowance across Codex and Work, effort advice (Astra Low can beat Sol High).

    Consultée le 28 sept. 2026

  95. OpenCode GoOpenCodeOfficielle

    OpenCode Go price and requests per 5 hours for each open-weight model.

    Publiée le 28 sept. 2026 · Consultée le 28 sept. 2026

  96. OpenRouter rankings: top models by taskOpenRouterTierce

    Share of spend and tokens per task over 30 days (code: general implementation 10.1%, debugging 5.2%, file edits 4.3%, review 2.8%, front-end UI 2.0%; math 0.8%), from /api/frontend/v1/rankings/task-spend.

    Publiée le 27 sept. 2026 · Consultée le 28 sept. 2026

  97. FrontierSWE V2Proximal LabsTierce

    Mean, best and worst of 5 trials, cost per trial and duration on 34 long-horizon tasks.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  98. Qwen3.8-27B quantizations benchmarkedQuesmaTierce

    Quality of Qwen3.8-27B by quantization level on Terminal-Bench 2.1 (Q4_K_M matches BF16, Q2 loses about 10 points).

    Publiée le 26 août 2026 · Consultée le 28 sept. 2026

  99. Terminal-Bench 4.0 leaderboardTerminal-Bench (tbench.ai)Tierce

    Accuracy with confidence interval, total cost and tokens per agent × model × effort over 330 trials.

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  100. Vals AI benchmarksVals AITierce

    Accuracy, cost per test and latency for Terminal-Bench 4, Vibe Code Bench, Vals Index and other coding benchmarks (astro-island props).

    Publiée le 23 sept. 2026 · Consultée le 28 sept. 2026

  101. Vals IndexVals AITierce

    Vals Index score, cost per test and latency for Opus 5.5, Fable 5.1, GPT-6 Astra and others.

    Consultée le 28 sept. 2026

  102. Grok 4.6xAIOfficielle

    Coding scores of Grok 4.6 at high effort (DeepSWE v1.1, Terminal-Bench 3.0, CursorBench 3.2).

    Publiée le 12 août 2026 · Consultée le 28 sept. 2026

  103. Grok 4.7xAIOfficielle

    CursorBench 4.0 score, cost per task, output tokens and steps at each effort for Grok 4.7 and for Fable 5.1, Opus 5, Sonnet 5, GPT-5.6 Sol/Terra/Luna and Gemini 3.8 Flash (JS dataset behind the chart).

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  104. Grok 4.7 model cardxAIOfficielle

    Terminal-Bench 4.0, FrontierSWE V2 and SWE-Marathon scores of Grok 4.7 and 4.6; CursorBench 4.0 chart (vector geometry) for Grok 4.6.

    Publiée le 21 sept. 2026 · Consultée le 28 sept. 2026

  105. Grok Build plan modexAIOfficielle

    When to plan (architecture ambiguity) and when to skip it (obvious change).

    Consultée le 28 sept. 2026

  106. Grok FAQxAIOfficielle

    One shared weekly usage pool across Chat, Imagine, Voice and Build since June 2026; shown only as a percentage; extra usage credits.

    Publiée le 27 août 2026 · Consultée le 28 sept. 2026

  107. Grok plansxAIOfficielle

    Monthly and annual prices of SuperGrok Lite, SuperGrok, Plus and Heavy, from the product JSON the page loads (grok.com/rest/products).

    Consultée le 28 sept. 2026

  108. ReasoningxAIOfficielle

    Effort levels per Grok model (low to xhigh, default high) and guidance per level.

    Consultée le 28 sept. 2026

  109. xAI API pricingxAIOfficielle

    Input, cached input and output prices per million tokens for Grok 4.7, 4.6 and grok-build-0.1.

    Consultée le 28 sept. 2026

  110. MiMo Token PlanXiaomiOfficielle

    MiMo Token Plan prices and credits.

    Publiée le 22 sept. 2026 · Consultée le 28 sept. 2026

  111. GLM Coding PlanZ.aiOfficielle

    Prices of Lite, Pro and Max (monthly, quarterly, yearly) and their five-hour and weekly credit allowances.

    Consultée le 28 sept. 2026

  112. GLM Coding Plan overviewZ.aiOfficielle

    Credit formula and per-model token multipliers, peak and off-peak rates, and the official weekly token estimates per tier.

    Consultée le 28 sept. 2026

  113. GLM-5.3 launch postZ.aiOfficielle

    Z.ai Code Bench accuracy and output tokens per task at each effort for GLM-5.3, Fable 5 and Opus 4.8.

    Publiée le 14 août 2026 · Consultée le 28 sept. 2026

  114. GLM-5.3 model cardZ.aiOfficielle

    Coding benchmark table of GLM-5.3 at max effort in Claude Code (Terminal-Bench 2.1 and 3.0, DeepSWE v1.1, NL2Repo, FrontierSWE).

    Consultée le 28 sept. 2026

  115. GLM-5.3 model guideZ.aiOfficielle

    Effort levels (low, high, max; default max) and the recommendation to use max for coding.

    Consultée le 28 sept. 2026

  116. GLM-5.3-FlashZ.aiOfficielle

    Coding scores of GLM-5.3-Flash (Terminal-Bench 2.1, DeepSWE v1.1) from printed chart labels.

    Publiée le 26 août 2026 · Consultée le 28 sept. 2026

  117. Z.ai API pricingZ.aiOfficielle

    Input, cached input and output prices per million tokens for GLM-5.3 and GLM-5.3-Flash.

    Consultée le 28 sept. 2026