OpenAI lance le mode Ultrafast pour GPT-5.6 Sol à 750 jetons/seconde

OpenAI vient d'accélérer encore GPT-5.6 Sol en lançant un mode d'inférence « Ultrafast » capable de générer jusqu'à 750 jetons par seconde. Cette avancée repose sur le matériel Cerebras, fruit de leur partenariat de 10 milliards de dollars, et s'intègre dans une nouvelle structure tarifaire en trois niveaux, aux côtés des modes « Standard » et « Rapide ». Pour les développeurs et entreprises dont la performance dépend de la latence, ce bond technologique est impossible à ignorer.
La rapidité comme produit
Ultrafast n'est pas qu'une simple note technique : c'est une gamme de produits à part entière. OpenAI vend désormais la vitesse d'inférence comme les compagnies aériennes vendent les classes de sièges : Standard pour un débit quotidien, Rapide pour un léger gain, et Ultrafast quand chaque milliseconde compte. Les tarifs ne sont pas encore dévoilés, mais l'implication est claire : les modèles plus rapides coûtent plus cher, et les clients devront payer ce privilège. Les puces Cerebras, avec leur silicium à l'échelle de plaquette, rendent ce saut possible en traitant les jetons à une vitesse dix fois supérieure aux GPU classiques.
Qui en profite – et qui paie
Le mode Ultrafast cible directement les charges de travail sensibles à la latence : assistants conversationnels en temps réel, pipelines de traduction instantanée ou copilotes de codage à haute fréquence où des réponses sous la seconde sont indispensables. Les startups évoluant à grande échelle peuvent ainsi se démarquer en réduisant de précieuses millisecondes à chaque interaction. Pourtant, cette tarification à trois niveaux risque aussi d'accentuer le fossé entre les équipes bien financées, capables de s'offrir Ultrafast, et les autres, toujours cantonnées au Standard. En liant matériel et tarifs, OpenAI annonce un avenir où la vitesse brute devient une fonctionnalité premium plutôt qu'une attente de base.
L'enjeu
OpenAI transforme la vitesse d'inférence en une marchandise commercialisable, avec deux conséquences concrètes. D'abord, elle exerce une pression sur les concurrents pour qu'ils atteignent ou dépassent le seuil de 750 jetons/seconde s'ils veulent rester pertinents dans les scénarios à haut débit. Ensuite, elle consolide un modèle payant où les applications sensibles à la latence doivent arbitrer clairement entre performance et budget. Pour les développeurs, le calcul est désormais simplifié : si votre cas d'usage exige une vitesse fulgurante, Ultrafast offre l'élan nécessaire – à condition que votre portefeuille suive.
Source : The Decoder. Synthèse éditoriale assistée par IA — TechnoExpress.

