EAServe organise le traitement des modèles multimodaux
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Marc
Le travail de recherche EAServe étudie comment mieux servir les grands modèles de langage multimodaux, qui traitent des images, des vidéos ou de l’audio, dans un parcours en 3 étapes. La publication, déposée sur arXiv, décrit d’abord Encode : cette étape transforme ces contenus en représentations que le modèle peut exploiter. Viennent ensuite Prefill et Decode, les phases de traitement du modèle. [12769]
Marc
Pour se représenter ce parcours, imaginons un atelier où chaque commande passe d’abord par un poste de préparation. Encode joue ce rôle : chaque requête y entre avant que les étapes suivantes puissent commencer. Les systèmes qui répartissent Prefill et Decode entre des groupes distincts de processeurs graphiques ont été conçus pour le texte et ne prennent pas en charge Encode. D’autres systèmes multimodaux proposent un service séparé pour l’encodage, mais ne régulent pas l’arrivée des requêtes aux étapes suivantes. [12770,12771]
Marc
EAServe place donc Encode au centre du contrôle du parcours. Son système adapte la taille des petits lots de requêtes à la charge, régule leur passage vers les étapes suivantes et peut transférer une partie du travail de préparation vers un processeur graphique qui partage ses ressources avec Prefill. Il ajuste aussi le partage des ressources de calcul sur le processeur graphique. Une couche de configuration choisit conjointement la répartition des processeurs graphiques, la taille des lots et la part du travail transférée. Elle écarte les répartitions déséquilibrées en évaluant la capacité de chaque étape, puis affine les choix restants par optimisation bayésienne, une méthode de recherche qui s’appuie sur les résultats déjà obtenus. [12769,12771]
Marc
Dans les évaluations rapportées, EAServe est testé sur 3 architectures multimodales couvrant l’image, la vidéo et l’audio. Sous les mêmes contraintes de qualité de service, c’est-à-dire les conditions fixées pour le service rendu, il atteint jusqu’à 4,3 fois le débit utile de NVIDIA Dynamo et jusqu’à 1,7 fois celui de vLLM. La publication indique aussi une utilisation plus équilibrée et plus élevée des processeurs graphiques dans les 3 étapes. [12769]
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.