L'explosion des coûts d'inférence bloque le déploiement d'agents IA complexes. La gamme GPT-5.6 d'OpenAI résout ce problème en scindant son exécution en trois tiers spécialisés : Sol, Terra et Luna. Les entreprises bénéficient ainsi d'une baisse des coûts d'appel API allant jusqu'à 16 fois, sans sacrifier les capacités de raisonnement de leurs applications. GPT-5.6 est passé en disponibilité générale le 9 juillet 2026, après une préversion limitée annoncée le 26 juin. OpenAI avait alors indiqué avoir présenté ses plans et les capacités des modèles au gouvernement américain avant d’ouvrir temporairement l’accès à un petit groupe de partenaires. Il ne s’agissait pas d’une « validation politique » du modèle, mais d’un déploiement progressif lié notamment à l’évaluation des risques cyber. L’infrastructure d’inférence constitue aussi un axe stratégique. OpenAI a annoncé GPT-5.6 Sol sur Cerebras jusqu’à 750 tokens par seconde au cours du mois de juillet, avec un accès initialement limité à certains clients. Ce plafond ne doit donc pas être présenté comme la vitesse standard de l’API ni comme la preuve d’une réduction universelle de la latence de bout en bout. L’intérêt économique de la gamme vient de la possibilité d’affecter des tâches distinctes à des niveaux de capacité différents. Sol vise les travaux complexes et à forte valeur, Terra recherche un équilibre entre intelligence et coût, tandis que Luna cible les charges répétitives, bien définies et volumineuses. Pour les équipes R&D, l’enjeu consiste moins à choisir un vainqueur unique qu’à construire des évaluations, des règles d’escalade et des limites budgétaires capables d’orienter chaque requête vers le modèle réellement nécessaire. « GPT-5.6 marque moins la fin du modèle généraliste que l’arrivée d’une ingénierie explicite de la capacité. Sol, Terra et Luna donnent enfin un vocabulaire simple à une réalité que les équipes expérimentées connaissaient déjà : toutes les requêtes ne méritent ni le même budget, ni la même profondeur de raisonnement, ni le même nombre d’agents. Le progrès ne consiste donc pas à envoyer chaque problème vers le modèle le plus puissant, mais à construire une chaîne où chaque niveau intervient au bon moment, avec des preuves, des limites et une possibilité de reprise. L’intelligence devient ainsi une ressource orchestrée — ce qui est moins spectaculaire qu’un cerveau omniscient, mais beaucoup plus utile en production. »
Rédaction assistée par intelligence artificielle, sous la direction éditoriale de Charles Pestel.
Avec GPT-5.6, OpenAI introduit une architecture multi-tiers (Sol, Terra, Luna) qui réduit drastiquement les coûts d'inférence pour les systèmes d'agents autonomes.