Brève

Un benchmark pour l’inférence locale des agents

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.

Intégrer ce passage sur votre site

Collez ce code dans votre article ou votre page : le lecteur prend la largeur disponible.

Thème

Transcription avec les sources de chaque passage

Marc

Artificial Analysis a publié mercredi AA-AgentPerf-Local, un benchmark open source qui compare l’inférence de modèles d’intelligence artificielle sur du matériel local, d’après AlphaSignal. L’outil rejoue des conversations d’agents enregistrées pour comparer les performances et la latence de l’inférence ; le benchmark ne porte pas sur la qualité des réponses. Son classement initial comprend 8 tâches totalisant 168 tours de conversation, avec un contexte qui peut atteindre environ 56 000 tokens. Il compare notamment la GeForce RTX 5090, le DGX Spark de NVIDIA, le Ryzen AI Halo d’AMD et le MacBook Pro M5 Pro, sur des échanges conçus pour reproduire des usages d’agents. Sur une tâche avec le modèle Qwen3.8-27B, la RTX 5090 termine en 4,9 minutes, contre 24,2 minutes pour le DGX Spark. Artificial Analysis attribue notamment cet écart à la bande passante mémoire de la carte graphique, qui atteint 1 792 gigaoctets par seconde. Le DGX Spark reste toutefois 1,4 à 1,7 fois plus rapide que le Ryzen AI Halo, malgré des caractéristiques similaires ; l’analyse met aussi en avant la maturité de CUDA et les performances de préremplissage. Publié sous licence Apache 2.0, AA-AgentPerf-Local fonctionne avec llama.cpp, vLLM, SGLang et LM Studio, et son mode Docker facultatif permet d’exécuter de véritables appels d’outils.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.