Ember-1, raisonner avec moins de tokens
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Token FM
Token FM, la radio de l'IA, faite par l'IA. Place au dossier.
Victor
Bonjour Sacha, Fireworks AI lance Ember-1, un modèle dérivé de Kimi K3 qui vise à réduire la longueur du raisonnement sans dégrader les réponses. Qu’est-ce qui est nouveau dans cette annonce ?
Sacha
La nouveauté, c’est que Fireworks AI a post-entraîné Kimi K3, le modèle de Moonshot AI, pour créer Ember-1 et raccourcir ses traces de raisonnement, d’après MarkTechPost. L’objectif annoncé est de produire des raisonnements plus courts sans réduire l’effort de raisonnement ni la qualité des réponses. Dans un test A/B en production, Fireworks rapporte que les tokens de sortie par tâche sont passés de 49 300 à 29 900, soit une baisse d’environ 40 %, avec un score pratiquement inchangé. Ember-1 est donc présenté comme une façon de réduire le volume de raisonnement généré tout en conservant la qualité mesurée dans ce test.
Victor
Comment Ember-1 apprend-il à distinguer les étapes utiles des répétitions ?
Sacha
Fireworks dit avoir entraîné Ember-1 à partir de Kimi K3, un modèle à poids ouverts développé par Moonshot AI, en lui apprenant à produire des raisonnements plus efficaces ; l’entreprise affirme avoir utilisé ses propres données, sans données de clients. Le principe n’est pas de supprimer toute réflexion intérieure, car certaines étapes servent à revenir sur une hypothèse, à corriger une erreur ou à tenir compte d’un retour reçu pendant une tâche. Il s’agit plutôt de limiter les boucles peu productives et les explications redondantes, tout en gardant les étapes qui aident le modèle à réussir. L’entraînement a couvert des domaines variés, dont les mathématiques, le codage, le suivi d’instructions, les conversations, la recherche, l’utilisation d’outils et le génie logiciel, avec des problèmes simples comme des interactions en plusieurs étapes. Pour guider l’apprentissage, Fireworks s’est appuyée sur les retours des tâches et des environnements, afin que le modèle puisse ajuster ses choix au fil du travail plutôt que d’apprendre uniquement à répondre à une question isolée. Le développement a nécessité plus de 50 expériences d’entraînement et plus de 200 évaluations, selon Fireworks ; l’entreprise indique aussi avoir conçu de nouvelles méthodes d’entraînement, sans en publier les détails. Imaginez un assistant qui doit réparer un programme : il peut tester une piste, constater qu’elle échoue, puis réviser son diagnostic, et ces retours sont précieux. En revanche, répéter plusieurs fois la même piste sans nouvel indice ne l’est pas forcément ; le but affiché est de préserver la première catégorie de raisonnement et de réduire la seconde, sans que les éléments publics permettent de vérifier exactement comment cette sélection est apprise.
Victor
Pour quels usages cette réduction compte-t-elle, et quels gains Fireworks annonce-t-elle ?
Sacha
Les usages mis en avant concernent surtout les tâches où un modèle doit produire beaucoup d’étapes, en particulier le codage et les interactions avec des outils ; dans ces situations, chaque réponse peut entraîner de nouveaux échanges et faire grossir le volume total de texte traité. Fireworks affirme qu’Ember-1 réduit de 35 à 50 % le raisonnement de Kimi K3 sur sept benchmarks et sur le trafic de production de deux clients, sans perte de précision dans les résultats qu’elle publie. Sur SWE-bench Verified, un test de tâches de génie logiciel, l’entreprise dit que le modèle égale la précision maximale de raisonnement de Kimi K3 pour un coût inférieur, avec jusqu’à 68 dollars d’économie par tâche. Dans des tests A/B de clients consacrés au codage en production, Fireworks rapporte une baisse de 35 % des tokens par tâche, tandis que les taux d’achèvement et de réussite sont maintenus ou améliorés. Un autre exemple concerne le Bedside Bench de Doximity : Fireworks affirme qu’Ember-1 y obtient un meilleur compromis entre coût et performance, avec un coût par tâche inférieur à celui de GPT-5.6 Sol, GPT-6 Astra et Claude Opus 5. Ces noms et ces comparaisons décrivent les évaluations communiquées par l’entreprise, pas un classement établi par un organisme indépendant. Pour une équipe qui paie chaque appel à un modèle, l’enjeu pratique peut donc être de traiter davantage de tâches avec le même budget, ou de réduire le coût d’un volume de travail existant ; le bénéfice dépend du nombre de tokens réellement économisés, du prix appliqué et du fait que la tâche soit effectivement réussie. Les chiffres sont prometteurs, mais ils ne suffisent pas à démontrer que chaque utilisateur obtiendra le même gain sur ses propres demandes.
Victor
Quelles sont les limites de ces résultats, et peut-on déjà utiliser le modèle ?
Sacha
La première limite, c’est que les résultats détaillés disponibles sont des évaluations publiées par Fireworks elle-même ; ils n’ont donc pas été vérifiés indépendamment dans les éléments rapportés par MarkTechPost et Developpez. Les performances peuvent aussi varier selon le type de tâche, le niveau de difficulté et les critères retenus : une moyenne sur plusieurs tests ne garantit pas qu’Ember-1 fera mieux, ou coûtera moins cher, sur chaque demande particulière. La seconde limite concerne l’accès : le modèle est proposé en aperçu de recherche uniquement par l’interface de programmation, ou API, serverless de Fireworks, au tarif de Kimi K3. Les poids du modèle, le code d’entraînement et les algorithmes précis ne sont pas publiés ; les utilisateurs ne peuvent donc pas télécharger Ember-1 pour l’héberger eux-mêmes ni examiner toutes les étapes qui ont conduit aux résultats annoncés. Fireworks indique qu’un client l’a déployé en production et prévoit de remplacer ses modèles de base, mais l’entreprise ne donne pas, dans les éléments rapportés, le nom de ce client ni le détail de son déploiement. Ce témoignage peut signaler un intérêt réel en entreprise, mais il reste rapporté par Fireworks et ne constitue pas à lui seul une évaluation complète de la fiabilité à grande échelle. Enfin, même si la baisse des tokens est importante, elle ne dit pas tout du coût total : l’API est facturée au tarif de Kimi K3, et la qualité du résultat reste essentielle. Une réponse plus courte n’est utile que si elle accomplit bien le travail demandé ; les comparaisons publiées suggèrent que c’est possible sur plusieurs tests, sans établir que ce sera le cas pour tous les usages.
Victor
Au fond, que faut-il retenir de cette annonce ?
Sacha
Il faut retenir qu’Ember-1 est une version post-entraînée de Kimi K3, lancée par Fireworks AI pour réduire les traces de raisonnement, et non un nouveau modèle de base dont les paramètres seraient rendus publics. La promesse centrale est de conserver les capacités du modèle tout en générant moins de tokens : Fireworks rapporte environ 40 % de baisse dans un test en production, et de 35 à 50 % sur plusieurs évaluations et trafics clients. Sur des tests de codage, l’entreprise annonce aussi une précision comparable à celle de Kimi K3 au niveau maximal, avec jusqu’à 68 dollars d’économie par tâche sur SWE-bench Verified. Si ces chiffres se confirment dans d’autres conditions, cela pourrait compter pour les entreprises qui utilisent des assistants capables de travailler en plusieurs étapes, car des échanges répétés peuvent accumuler les coûts de génération. Mais il faut garder les deux réserves en tête : les résultats ont été publiés par Fireworks sans vérification indépendante rapportée, et l’accès reste limité à son API, sans publication des poids ni des méthodes d’entraînement. Ember-1 est donc à la fois une démonstration d’efficacité potentiellement intéressante et un produit encore difficile à examiner de l’extérieur. La question à suivre sera de savoir si les économies annoncées se retrouvent sur des usages variés, sans dégradation des résultats, et si Fireworks choisit de rendre davantage d’éléments accessibles. Pour l’instant, l’annonce met surtout l’accent sur une idée concrète : un modèle peut parfois conserver la qualité de son travail tout en produisant moins de texte de raisonnement. C’est une piste importante pour réduire les coûts, mais les chiffres disponibles doivent rester attribués à l’entreprise qui les a mesurés.
Victor
Merci Sacha pour ces explications.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.