Décryptage

La baisse spectaculaire du coût des performances en intelligence artificielle

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.

Intégrer ce passage sur votre site

Collez ce code dans votre article ou votre page : le lecteur prend la largeur disponible.

Thème

Transcription avec les sources de chaque passage

Théa

Epoch AI estime que le coût pour atteindre un score donné sur certains tests d’intelligence artificielle a diminué d’environ 47 % par trimestre, soit près de 13 fois sur un an, selon The Decoder. Cette estimation porte sur les prix du marché pour une performance fixée. Elle ne mesure ni les seuls progrès des algorithmes ni directement le coût de tâches réelles. De leur côté, des chercheurs du MIT évaluent la baisse annuelle entre 5 et 10 fois. Ces chiffres portent donc sur des mesures distinctes de la baisse des coûts.

Théa

Un exemple permet de mesurer l’ampleur de la baisse. Sur le test scientifique GPQA Diamond, o3 a atteint 75 % de bonnes réponses au début de 2025, pour un coût estimé à environ 30 cents par question. Dix-huit mois plus tard, un modèle de la famille GPT-5.6 aurait atteint le même score pour environ 0,04 cent par question, soit une baisse estimée d’un facteur 725 par Epoch AI. L’organisation indique aussi que GPT-6 Sol et Luna, présentés comme encore moins chers, pourraient avoir accentué cette baisse. Leur effet n’est toutefois pas chiffré.

Théa

Pourquoi les estimations du MIT sont-elles moins élevées ? Les chercheurs distinguent plusieurs causes. Le matériel moins cher et la concurrence contribuent à la baisse des prix. Une fois ces effets pris en compte, ils évaluent à environ 3 fois par an le gain lié à l’efficacité des algorithmes. Leur étude s’appuie notamment sur des données d’Artificial Analysis, couvrant d’avril 2024 à novembre 2025. Les scores peuvent aussi progresser parce qu’un modèle utilise davantage de calcul au moment de répondre. Ils mêlent ainsi l’architecture, les données et les ressources mobilisées pendant le test. Un meilleur score ne prouve donc pas, à lui seul, une meilleure efficacité algorithmique.

Théa

Il faut distinguer le coût pour reproduire une performance passée du coût d’utilisation du modèle le plus performant du moment. Les modèles de raisonnement peuvent mobiliser davantage de calcul pour une requête, ce qui peut renchérir son exécution. Une baisse du coût pour atteindre un ancien score ne signifie donc pas que les modèles les plus avancés sont moins chers à utiliser. Et le prix seul ne suffit pas à choisir un modèle : la qualité des réponses, leur rapidité et leur taux d’erreur comptent aussi.

Théa

Ces résultats restent circonscrits aux benchmarks. Epoch AI en compare 5, en mathématiques, en sciences et en énigmes logiques, qu’elle juge utiles mais non exhaustifs. Sur Mystery Game Puzzles, un test dont le contenu est tenu secret, la baisse des coûts est la plus lente parmi les tests cités. Cela pourrait être compatible avec une optimisation ciblée des benchmarks connus. Mais le format des tâches ou le bruit statistique peuvent aussi expliquer l’écart. Les chercheurs du MIT soulignent également qu’un score peut augmenter grâce à davantage de calcul pendant le test. Ces mesures ne disent donc pas, à elles seules, combien coûte l’ensemble des usages réels de l’intelligence artificielle.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.