Ce qui a été annoncé

OpenAI a présenté GPT-5.6 comme une famille de trois modèles. Sol est décrit comme le modèle « de travail » le plus capable, le meilleur pour le code selon l’éditeur, qui le présente aussi comme son modèle le plus fort en cybersécurité ; Terra est l’option intermédiaire, compétitive avec GPT-5.5 pour moitié moins cher ; Luna est la plus rapide et la plus économique. Selon TechCrunch, les trois sont disponibles dans ChatGPT, Codex et l’API, aux tarifs de 5 $ / 30 $, 2,50 $ / 15 $ et 1 $ / 6 $ par million de tokens (entrée / sortie). OpenAI a lancé en parallèle ChatGPT Work, un outil destiné au travail en entreprise.

OpenAI annonce que Sol est 54 % plus économe en tokens sur les tâches de programmation, et TechCrunch rapporte qu’il atteint 80 points sur le Coding Agent Index d’Artificial Analysis, soit 2,8 points au-dessus de Claude Fable 5, avec moins de la moitié des tokens de sortie. Ce sont des chiffres d’éditeur et de classement : utiles pour se repérer, insuffisants pour décider à votre place.

Trois niveaux, trois usages

Une gamme à trois niveaux invite à répartir les tâches au lieu d’envoyer tout au modèle le plus puissant :

  • Niveau léger (type Luna) : tâches répétitives à fort volume — trier des courriels, extraire des champs d’une facture, classer des tickets, résumer des avis clients.
  • Niveau intermédiaire (type Terra) : rédaction courante, analyse de documents, réponses clients préparées pour relecture.
  • Niveau supérieur (type Sol) : code complexe, agents qui enchaînent de nombreuses étapes, tâches rares où une erreur coûte cher.

Le même raisonnement vaut pour les gammes des autres éditeurs : c’est la tâche qui choisit le modèle, pas l’inverse.

Calculer le coût d’une tâche accomplie

Le prix au million de tokens ne dit pas ce que coûte une tâche. La formule utile est : (tokens d’entrée × prix d’entrée + tokens de sortie × prix de sortie) × nombre moyen d’essais, rapportée aux tâches réellement réussies.

Exemple de calcul, aux tarifs publics de juillet 2026 hors taxes : classer 1 000 courriels de 1 500 tokens chacun, avec une réponse de 50 tokens, représente 1,5 million de tokens en entrée et 50 000 en sortie. Avec un modèle au tarif de Luna : 1,5 × 1 $ + 0,05 × 6 $ = 1,80 $. Avec un modèle au tarif de Sol : 1,5 × 5 $ + 0,05 × 30 $ = 9 $. Si le niveau léger classe correctement 98 % des courriels et que le niveau supérieur en classe 99 %, la différence de qualité vaut-elle cinq fois le prix ? Pour un tri de courriels, rarement ; pour une analyse de contrat, peut-être.

Ces montants sont des ordres de grandeur : vérifiez toujours les tarifs en vigueur au moment de votre usage, et n’oubliez pas les coûts cachés (essais ratés, relecture humaine, temps d’attente).

Les pièges du calcul de coût

Trois pièges reviennent souvent. Le premier est le contexte : envoyer à chaque requête un long document, un historique de conversation ou un catalogue entier multiplie les tokens d’entrée, parfois bien plus que la réponse elle-même. Le deuxième est la longueur des réponses : une consigne qui demande « une réponse détaillée » coûte plus cher qu’une consigne qui demande trois lignes. Le troisième est l’essai raté : une réponse inutilisable qu’il faut redemander coûte deux fois. Pour éviter les surprises, mesurez les tokens réellement consommés grâce aux journaux d’usage de votre fournisseur, sur une semaine de travail normale, plutôt que d’estimer à partir d’un seul exemple.

La méthode AXDIA en quatre étapes

  1. Constituer un jeu de 20 tâches réelles, avec le résultat attendu pour chacune.
  2. Tester les trois niveaux sur ces tâches, dans les mêmes conditions.
  3. Noter à l’aveugle la qualité, et relever le temps et le coût de chaque tâche.
  4. Choisir le plus petit niveau qui atteint votre seuil de qualité, et refaire le test à chaque nouvelle version : en été 2026, il en sortait presque chaque semaine.

Pour la suite — suivre les coûts dans la durée, utiliser le cache, router automatiquement les requêtes — voyez notre article de clôture de série sur les leviers de coût de l’IA. Et si vous voulez une mission prête à confier à Codex pour un projet, Prompt OS l’écrit avec les tests et les critères de fin.

Conclusion

GPT-5.6 a installé une idée simple dans le paysage : un même éditeur propose plusieurs niveaux, et le bon choix dépend de la tâche. Pour une TPE ou une PME, l’écart de coût entre le niveau léger et le niveau supérieur peut atteindre un facteur cinq. Une demi-journée de tests sur vos propres tâches suffit souvent à économiser l’essentiel, sans perte de qualité visible.