Tokens d’intelligence artificielle : contexte et facturation
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Léna
Clubic explique qu’un token est une unité de découpage des données utilisées par les modèles de langage. Pour le texte, il peut correspondre à un mot entier, à une partie de mot, à un signe de ponctuation ou à quelques caractères ; le tokenizer associé au modèle détermine ce découpage, si bien qu’une même phrase peut être segmentée différemment selon l’intelligence artificielle. Le nombre de tokens ne correspond donc pas directement à la longueur des mots : il dépend notamment du vocabulaire du tokenizer et de la fréquence des suites de caractères. À titre indicatif, les tokenizers d’OpenAI, de Google et d’Anthropic produisent en moyenne environ 4 caractères par token, mais la langue influe sur le résultat. La fenêtre de contexte désigne l’ensemble des éléments qu’un modèle peut prendre en compte simultanément ; l’article évoque des fenêtres pouvant atteindre 200 000 tokens, sans préciser les modèles concernés. Quand cette fenêtre est saturée, certains services peuvent écarter, condenser ou tronquer les messages les plus anciens, avec un risque de perte d’informations et de rupture du fil de l’échange, précise Brief IA. Dans une requête adressée à une interface de programmation, les tokens d’entrée incluent notamment la demande, l’historique, les instructions et les documents ; la réponse est produite progressivement en tokens de sortie, et la facturation dépend du nombre et du type de tokens, ceux de sortie coûtant souvent davantage que ceux d’entrée.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.