Multimodal
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Capucine
Multimodal, c’est la capacité d’un système d’intelligence artificielle à traiter plusieurs formes d’information, comme du texte, des images, du son ou de la vidéo, et parfois à en produire. Imaginez que vous photographiez le contenu de votre réfrigérateur, puis que vous demandiez à l’assistant vocal une idée de repas : il peut croiser ce qu’il voit avec votre question écrite ou parlée. Cette combinaison permet d’interagir plus naturellement, sans devoir tout décrire avec des mots, et peut rendre certaines tâches plus accessibles. Elle aide aussi le système à relier des indices différents, par exemple une parole entendue et un objet visible dans une scène. Mais multimodal ne veut pas dire infaillible : l’outil peut mal reconnaître une image, un son ou leur relation, et sa réponse reste à vérifier.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.