La directrice financière d'OpenAI, Sarah Friar, a déclaré le 8 septembre lors de la conférence Communacopia de Goldman Sachs que l'entreprise utilise désormais ses propres modèles de pointe pour la conception de puces, ce qui a permis à la puce d'inférence maison, Jalapeno, de passer de la conception à la version finale en seulement 9 mois. Elle a également cité la conception de puces, les sciences de la vie et les services financiers comme trois secteurs sur lesquels l'entreprise veut se concentrer en priorité, la demande d'IA conçue autour de flux de travail spécialisés étant en hausse dans ces domaines.
Jalapeno est une puce d'inférence développée conjointement par OpenAI et Broadcom, annoncée publiquement en juin de cette année, destinée à faire tourner les propres modèles de l'entreprise à moindre coût. Selon les informations rendues publiques, les premiers échantillons permettraient d'économiser environ la moitié du coût par rapport aux processeurs graphiques d'IA classiques. La date de livraison de la puce n'a pas été communiquée.
Un rythme de 9 mois est considéré comme court pour une puce sur mesure. Un nouvel ASIC d'inférence met généralement, selon les standards du secteur, entre un an et demi et deux ans entre la finalisation de l'architecture et le tape-out. Friar a attribué cette réduction à l'utilisation des modèles maison, sans préciser quelles étapes exactement ont été prises en charge par les modèles — le placement-routage, la vérification, ou même l'exploration architecturale en amont.
Comparer Luna à GLM-5.3
La partie sur les prix a été le passage le plus concret de son intervention. Friar a indiqué qu'après la baisse de 80 % du prix de Luna, le prix en entrée est tombé à 0,20 dollar par million de tokens, celui en sortie à 1,20 dollar, et que l'utilisation a ensuite été multipliée par environ 10. Elle a ensuite désigné directement un modèle open source chinois comme point de comparaison :
"If you're deploying Luna and compare that to (Z.ai's) GLM 5.3, for example, on a cloud layer, we are cheaper."
Si vous déployez Luna et que vous la comparez, par exemple, à GLM 5.3 de Zhipu AI, au niveau du cloud, nous sommes moins chers.
La méthode de comparaison mérite attention. Elle a comparé le déploiement de GLM-5.3 « dans le cloud », c'est-à-dire le prix effectif des poids ouverts hébergés par un fournisseur cloud tiers, alors que le tarif public de l'API propre de Zhipu AI relève d'une tout autre référence : au lancement, GLM-5.3 affichait un prix de sortie de 4,40 dollars par million de tokens. Un même modèle peut voir son prix varier de plusieurs fois selon qu'il passe par sa propre API ou par un cloud tiers, ce dernier devant répartir les coûts d'occupation GPU, de mémoire et d'utilisation simultanée. OpenAI n'a pas dévoilé la méthode complète de cette comparaison de prix, ni le niveau de débit supposé lors de la comparaison.
Une pression bien réelle sur l'open source chinois
Cet argument vise le scénario des entreprises qui hébergent elles-mêmes leur infrastructure. Ces deux dernières années, les entreprises chinoises comme étrangères ont surtout choisi les poids ouverts pour deux raisons : les données ne sortent pas de leur environnement contrôlé, et le calcul en interne revient moins cher. La première raison reste inchangée, mais la seconde est mise sous pression par les baisses de prix du côté des modèles propriétaires. Avec le prix de sortie de Luna ramené à 1,20 dollar, et une puce d'inférence maison qui continue de tirer les prix vers le bas, le calcul selon lequel « héberger soi-même coûte moins cher » doit être refait — en particulier pour les équipes à faible concurrence et dont l'utilisation des GPU ne parvient pas à monter.
Il faut préciser que les chiffres avancés par Friar reflètent le point de vue du vendeur ; aucun tiers n'a encore publié de calcul de prix unitaire comparant Luna et GLM-5.3 dans les mêmes conditions de débit, et Zhipu AI n'a pas non plus réagi à cette comparaison.
Sources : Reuters, Qz, CocoLoop ; plusieurs articles ont été recoupés pour vérifier les prix d'entrée et de sortie ainsi que le taux de baisse de prix de Luna, le rapport entre le cycle de conception et le coût des échantillons de Jalapeno, ainsi que les propos originaux de Friar en anglais.