L'explosion des coûts d'inférence freine le déploiement des flottes d'agents IA. Avec Gemini 3.6 Flash et 3.5 Flash-Lite, Google propose une fragmentation légère et ultra-rapide jusqu'à 350 tokens par seconde. Cette mise à jour stratégique permet de diviser par trois vos coûts d'API tout en maintenant un raisonnement asynchrone performant. À mesure que les entreprises augmentent le volume d'appels aux modèles et déploient des agents capables d'enchaîner plusieurs étapes, le coût par tâche dépend autant du prix au token que du nombre de tours, d'appels d'outils et de tokens générés. Google met précisément l'accent sur cette efficience avec Gemini 3.6 Flash et Gemini 3.5 Flash-Lite. L'arrivée simultanée de ces trois déclinaisons illustre la montée en puissance d'une logique de routage : réserver les modèles les plus coûteux aux tâches qui le justifient et confier les opérations répétitives à des modèles plus rapides et moins chers. Google AI Studio permet de tester Gemini 3.6 Flash et 3.5 Flash-Lite, tandis que leur intégration en production passe par la Gemini API et les offres enterprise de Google. Cette évolution renforce la compétitivité de l'écosystème Gemini pour les usages B2B à fort volume, des prototypes jusqu'aux déploiements de production, sous réserve des besoins de gouvernance, de sécurité et de capacité propres à chaque organisation. Le lancement de ce triptyque illustre une évolution nette du marché : l'efficience devient un critère de conception aussi important que la performance brute. Les architectures capables de router les tâches vers des modèles adaptés peuvent réduire les coûts et la latence, à condition de conserver des métriques de qualité et des garde-fous. Google ne prouve pas que l'intelligence agentique est désormais rentable dans tous les contextes, mais sa nouvelle gamme rend cette équation plus favorable pour de nombreux workloads à haut volume.
Chargement de KingLand…
Gemini 3.6 Flash : quel impact sur vos coûts d'agents ?