L'outil du jour

vLLM renforce son outil de serving

IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.

Transcription avec les sources de chaque passage

Léna

vLLM publie une mise à jour de son logiciel d’inférence, qui ajoute la prise en charge de nouveaux modèles. Cette version réunit 762 commits de 315 contributeurs, dont 104 nouveaux venus dans le projet, selon GitHub. Elle ajoute la prise en charge de DeepSeek-V4.1-Flash et de GLM-5.3-Flash, parmi d’autres modèles. Certains bénéficient aussi de nouveaux chemins d’exécution. Ces ajouts sont utiles aux équipes qui déploient les modèles concernés avec vLLM : elles disposent d’une prise en charge élargie et de fonctions adaptées à leur exécution. Un cache persistant conserve les poids des modèles dans la mémoire du processeur graphique. Au redémarrage des moteurs d’inférence, ils peuvent être réutilisés au lieu d’être rechargés depuis le disque. Cette fonction vise à accélérer la relance. Autre outil, HiSparse déplace des pages KV vers la mémoire de l’ordinateur lorsque la mémoire graphique est sous pression. Il s’agit d’une option pour gérer cette contrainte, notamment pendant le décodage sparse MLA. La version ajoute aussi la génération et la détection de textes filigranés avec la méthode Gumbel-max. Les contrôles peuvent être définis pour chaque requête, et la fonction est compatible avec le décodage spéculatif. Enfin, des optimisations de performances et de passage à l’échelle concernent Model Runner V2, Qwen3.8-Flash-Next et Kimi K3. Le cache suppose de disposer de mémoire graphique pour conserver les poids ; HiSparse intervient, lui, lorsque cette mémoire est sous pression.

Une erreur ?

Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.

Signaler une erreur

Un mot pour la rédaction ?

Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.