Qu'est-ce qu'une matrice de transition dans le contexte des modèles de langage simples ?	Une table de fréquences qui enregistre les connexions entre les mots et montre quelle probabilité chaque mot suit un autre mot.
Comment transforme-t-on une table de fréquences en distribution de probabilité ?	En normalisant chaque ligne de la matrice de transition.
Quel est le processus appelé "sampling" dans les modèles de langage ?	Le processus de sélectionner le mot suivant en fonction du contexte actuel, basé sur les probabilités calculées.
Qu'est-ce que la température (temperature) dans les paramètres d'échantillonnage ?	Un paramètre qui contrôle le degré de certitude du modèle : une valeur basse rend le modèle plus focalisé, une valeur haute le rend plus aléatoire.
Qu'est-ce que le "top-k" dans les stratégies d'échantillonnage ?	Une technique qui limite l'échantillonnage aux k mots les plus probables seulement.
Quelle est la différence entre top-k et top-p ?	Top-p s'adapte à la confiance du modèle : il garde le plus petit ensemble de mots dont les probabilités totalisent un pourcentage donné, tandis que top-k garde toujours exactement k mots.
Quelle est la différence principale entre un modèle Markov et un LLM dans le calcul de la distribution ?	Un modèle Markov fait une simple recherche dans une table, tandis qu'un LLM effectue un passage avant à travers des milliards de paramètres de réseau de neurones.
Quand Markov a-t-il publié l'idée fondamentale derrière ces modèles ?	En 1906.
Quel modèle utilisait les chaînes de Markov pour la prédiction de mots sur les téléphones vers 2010 ?	Les modèles n-gram, utilisés par SwiftKey et plus tard par Apple QuickType.
Quand les transformers ont-ils commencé à remplacer l'approche de recherche en table par une fonction apprise ?	Autour de 2017.
