Mesurer les agents d’intelligence artificielle sur son propre matériel
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Token FM
Token FM, la radio de l'IA, faite par l'IA. Place au dossier.
Victor
Bonjour Elias, on vous accueille pour parler d’AA-AgentPerf-Local, le nouveau benchmark publié par Artificial Analysis pour comparer la vitesse d’exécution des agents d’intelligence artificielle sur du matériel local. Qu’est-ce qui change avec cet outil ?
Elias
Alors, la nouveauté, c’est qu’Artificial Analysis propose un test conçu pour des agents, pas seulement pour une question isolée posée à un modèle. D’après AlphaSignal, AA-AgentPerf-Local est publié en open source sous licence Apache 2.0, ce qui autorise son utilisation et sa modification selon les conditions de cette licence. Le benchmark rejoue des conversations d’agents enregistrées et fournit des mesures de performances d’inférence, notamment de débit et de latence. Le premier classement compare plusieurs configurations, dont la GeForce RTX 5090, le DGX Spark de NVIDIA, le Ryzen AI Halo d’AMD et le MacBook Pro M5 Pro. L’intérêt, en fait, est de regarder un enchaînement de demandes qui ressemble davantage au travail continu d’un agent qu’à une démonstration ponctuelle. Un agent peut recevoir des consignes, accumuler du contexte et solliciter plusieurs fois le modèle ; le benchmark essaie donc de reproduire cette dynamique. Ces mesures donnent des repères sur les configurations testées dans le cadre de ce benchmark.
Victor
Comment le test reproduit-il le fonctionnement d’un agent ?
Elias
Le benchmark rejoue 8 tâches enregistrées, qui totalisent 168 tours de conversation. À chaque nouvelle demande, il renvoie l’historique complet de l’échange au serveur du modèle, comme le font les interfaces courantes pour les agents. Le contexte grossit au fil de la session et peut atteindre environ 56 000 tokens, autrement dit des unités de texte traitées par le modèle. Cela permet de mesurer plusieurs effets à la fois : le traitement de nouvelles informations, la réutilisation éventuelle de préfixes déjà vus et le délai avant que le modèle commence à répondre. Imaginez un carnet de notes que l’on doit relire à chaque étape, tout en ajoutant de nouvelles pages : plus la conversation avance, plus le volume à traiter peut devenir important. L’outil peut se connecter à un serveur de modèle déjà installé ou lancer lui-même un modèle et le serveur configuré pour le test. Il prend en charge llama.cpp, vLLM, SGLang et LM Studio. Un mode Docker facultatif permet aussi d’exécuter de véritables appels d’outils, ce qui rapproche encore davantage le test d’un agent capable d’agir au-delà de la simple génération de texte.
Victor
À qui ces résultats peuvent-ils servir, et que montrent-ils sur les performances ?
Elias
Le chiffre le plus frappant concerne Qwen3.8-27B : la GeForce RTX 5090 termine la tâche en 4,9 minutes, contre 24,2 minutes pour le DGX Spark. Artificial Analysis relie notamment cet écart à la bande passante mémoire de la carte, qui atteint 1 792 gigaoctets par seconde. Le DGX Spark devance, lui, le Ryzen AI Halo d’un facteur de 1,4 à 1,7, malgré des caractéristiques similaires. L’article met en avant la maturité de CUDA, l’environnement logiciel de NVIDIA, ainsi que les performances de préremplissage, c’est-à-dire le traitement initial du contexte avant la génération. En clair, les résultats montrent des écarts importants entre les configurations testées, mais ils portent sur des scénarios précis. La comparaison ne suffit pas, à elle seule, à établir quelle machine conviendra le mieux à chaque usage.
Victor
Quelles sont les limites de ce classement ?
Elias
La limite essentielle est que AA-AgentPerf-Local mesure les performances, pas la qualité des réponses. Une machine peut terminer le scénario plus vite sans que cela démontre que ses réponses sont plus justes, plus utiles ou mieux adaptées à la demande. Il faut donc lire le classement comme une mesure de vitesse et de latence, pas comme une évaluation générale des agents. Le résultat dépend aussi du modèle, du matériel et du logiciel utilisés. Le premier classement ne couvre que plusieurs configurations précises, et le chiffre de 4,9 minutes face à 24,2 minutes concerne une tâche particulière avec Qwen3.8-27B. Il ne faut pas le transformer en promesse valable pour toutes les applications. Le benchmark reproduit des conversations enregistrées : c’est utile pour comparer les mêmes séquences, mais cela ne représente pas nécessairement toutes les façons dont un agent sera sollicité en pratique. La comparaison entre le DGX Spark et le Ryzen AI Halo met en évidence un écart de vitesse que l’article associe notamment à la maturité de CUDA et aux performances de préremplissage. Ces chiffres apportent donc un repère, pas un verdict universel sur la meilleure machine.
Victor
Alors, qu’est-ce qu’il faut retenir pour quelqu’un qui choisit une machine ?
Elias
Il faut retenir qu’Artificial Analysis met à disposition un moyen ouvert de comparer l’inférence locale dans des scénarios d’agents plus longs qu’une simple requête. Les 8 tâches, les 168 tours et les contextes qui approchent 56 000 tokens cherchent à rendre visible le coût d’une conversation qui s’accumule. Pour un développeur, l’intérêt est de pouvoir tester plusieurs systèmes avec les mêmes séquences, et avec des outils logiciels déjà utilisés dans différents environnements. Les résultats publiés montrent qu’une carte graphique dotée d’une forte bande passante mémoire peut être très rapide dans certaines conditions, tandis que le DGX Spark dépasse le Ryzen AI Halo malgré des caractéristiques comparables. Mais le bon choix dépendra de la tâche réelle, du modèle, du logiciel et du niveau de qualité attendu : ce benchmark ne tranche pas ces questions à lui seul. Il remplace surtout les comparaisons abstraites par des mesures observables sur une charge de travail définie. Et comme il est open source, d’autres utilisateurs peuvent s’en servir pour examiner les performances de leurs propres configurations, en gardant à l’esprit que vitesse et qualité sont deux choses différentes.
Victor
Merci Elias pour ces explications.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.