Token, fenêtre de contexte, température, embedding, hallucination… Le vocabulaire des LLM peut décourager les meilleures volontés. Pourtant, une quinzaine de termes suffit à comprendre l’essentiel des discussions sur l’IA générative, et à faire de meilleurs choix d’outils. Ce glossaire illustré définit chaque concept simplement, avec des exemples concrets, pour ne plus jamais subir une conversation technique. Gardez-le en favori : il est conçu comme une référence permanente de notre rubrique LLM.
Les termes fondamentaux
Token
L’unité de texte manipulée par le modèle : un fragment de mot, un mot entier ou un signe de ponctuation. En français, comptez en moyenne 1 token pour 0,7 mot : un article de 1 000 mots représente environ 1 400 tokens. C’est aussi l’unité de facturation des API : quelques euros le million de tokens pour les modèles courants.
Fenêtre de contexte
La quantité maximale de texte que le modèle peut prendre en compte en une fois : votre conversation, vos documents et sa réponse compris. Elle va de quelques milliers de tokens (anciens modèles) à plus d’un million pour Gemini, soit plusieurs livres entiers. Au-delà, le modèle « oublie » le début : découpez vos documents ou utilisez un RAG.
Paramètres
Les valeurs internes apprises pendant l’entraînement : de 7 milliards pour un petit modèle local à plusieurs centaines de milliards pour les géants. Plus il y en a, plus le modèle capte de nuances… et plus il coûte cher à faire tourner. Ce n’est pas le seul facteur de qualité : un modèle récent de 30 milliards de paramètres peut battre un ancien de 175 milliards.
Température
Le réglage de créativité du modèle, de 0 à 1 (ou 2). À 0, il choisit toujours la réponse la plus probable (idéal pour l’extraction de données ou le code. À 0,8 et plus, il explore des formulations plus originales) parfait pour le brainstorming. Dans les interfaces grand public, ce réglage est caché ; il apparaît dans les API et les outils avancés.
Les termes d’entraînement
Pré-entraînement
La première phase, où le modèle « lit » des téraoctets de textes en apprenant à prédire le mot suivant. Des mois de calcul sur des milliers de GPU, pour des coûts estimés en dizaines de millions de dollars pour les modèles frontières : d’où la course aux investissements que nous décryptons dans nos actualités.
RLHF et alignement
L’étape qui transforme le prédicteur brut en assistant agréable : des humains notent ses réponses, et le modèle est ajusté pour privilégier celles jugées utiles, honnêtes et sûres (Reinforcement Learning from Human Feedback). C’est aussi là que se règlent ses « refus » et son style prudent.
Hallucination
Le défaut le plus célèbre : le modèle invente un fait, une date, une source avec un aplomb total. Mécaniquement, il génère du texte plausible : pas du texte vrai. Parade : demandez des sources, vérifiez les faits sensibles, et privilégiez les assistants connectés au web pour l’actualité.
Les termes des applications
Prompt et prompt engineering
Le prompt est votre message d’instruction. Le prompt engineering est l’art de le formuler (rôle, contexte, format attendu, exemples) pour obtenir des réponses précises et homogènes. Notre rubrique guides lui consacre un tutoriel complet, tant la qualité du résultat dépend de la qualité de la consigne.
Embedding et base vectorielle
Un embedding est la traduction d’un texte en liste de nombres capturant son sens : deux phrases proches en signification ont des embeddings proches. Stockés dans une base vectorielle, ils permettent la recherche sémantique : retrouver un document par son sens, pas par ses mots exacts. C’est le moteur du RAG.
Multimodal
Un modèle multimodal traite plusieurs types de contenus : texte, images, audio, vidéo, parfois en entrée comme en sortie. Gemini et GPT en sont les exemples les plus connus : montrez une photo de votre frigo, le modèle vous propose une recette.
Agent
Un LLM capable d’enchaîner des actions (rechercher, cliquer, exécuter du code, remplir un formulaire) pour atteindre un objectif en plusieurs étapes. C’est la frontière actuelle de l’industrie : passer de l’assistant qui répond à l’assistant qui fait.
Mini-quiz : avez-vous retenu ?
- Votre document fait 300 000 tokens et votre modèle en accepte 128 000 : que risque-t-il de se passer ? (Il ignorera le début : découpez le document.)
- Vous voulez des réponses très factuelles et reproductibles : quelle température choisir ? (Proche de 0.)
- Le modèle cite une étude qui n’existe pas : comment appelle-t-on ce phénomène ? (Une hallucination.)
Les termes des modèles eux-mêmes
Open weight vs propriétaire
Un modèle open weight publie ses poids : chacun peut le télécharger et l’exécuter librement (Llama, Mistral, DeepSeek). Un modèle propriétaire n’est accessible que via le service de son éditeur (GPT, Claude, Gemini). L’enjeu : contrôle, confidentialité et coûts : un arbitrage que nous détaillons dans notre article dédié de la rubrique LLM.
Distillation
Technique consistant à entraîner un petit modèle à imiter un grand : le « professeur » génère des exemples, l’« élève » apprend à les reproduire. Résultat : des modèles compacts, rapides et économiques qui conservent une fraction impressionnante des capacités du géant, c’est ainsi que naissent la plupart des versions « mini ».
Quantification
Compression des poids du modèle (de nombres très précis vers des formats plus grossiers) pour le faire tourner sur du matériel modeste, au prix d’une perte de qualité souvent imperceptible. C’est elle qui permet l’IA locale sur ordinateur personnel.
Questions fréquentes
Faut-il connaître ces termes pour utiliser ChatGPT ?
Non pour un usage basique, oui pour en tirer le maximum : comprendre la fenêtre de contexte ou la température explique la plupart des « comportements étranges » des assistants.
Ces définitions resteront-elles valables ?
Les concepts de base (tokens, contexte, paramètres) sont stables depuis des années et le resteront. Les chiffres, eux, évoluent vite : cet article est mis à jour régulièrement, comme l’ensemble de nos contenus : voir notre page à propos.
Astuce de la rédaction : quand un commercial vous noie sous le jargon, ramenez la discussion à trois questions : quelle fenêtre de contexte, quel coût par million de tokens, où sont hébergées les données. Tout le reste est secondaire.
L’essentiel à retenir
Token, contexte, paramètres, température, hallucination, embedding, agent : sept mots pour comprendre 90 % des conversations sur les LLM. Vous voilà armé pour lire les tests, comparer les offres et poser les bonnes questions. Prochaine étape : mettre ces notions en pratique avec nos comparatifs de modèles et notre sélection des meilleurs outils IA.