Capacités et Limitations de l'IA
← Toutes les leçons
Leçon 05Capacités et Limitations de l'IA

Essayez

Audio récapitulatif

Récapitulatif parlé — appuyez sur lecture pour suivre : la ligne lue reste en haut.

Notes de cours

Le générateur de prochain token 100% interprétable

Envoyez un Texte

Il y a longtemps, mes amis et moi jouions à ce jeu où vous preniez votre téléphone et rédigiez un message à un ami en utilisant uniquement les mots recommandés suivants. Peut-être que vous l'aviez fait aussi.

Voici un simulateur qui a été « entraîné » sur un peu de contenu. Amusez-vous !

hey does anyone know how to fix the build

i think |

the we i

↻ recommencer

Nous en parlions comme s'il s'agissait d'un « Bot-Moi ». Nous savions qu'il recommandait des mots en fonction de nos modèles d'utilisation individuels, et nous pouvions voir nos voix dans nos recommandations personnalisées.

À l'époque, nous étions heureux de le rejeter comme de la magie technologique. Je ne pense pas que nous ayons réalisé à quel point l'algorithme pourrait être simple.

Continuez la lecture si vous voulez en construire un avec moi :)

« Entraîner » Votre Modèle

Entraînons-nous sur une poignée de messages. Tout ce que nous devons faire est de compter les connexions entre les mots. Faisons cela un message à la fois.

\+ Ajouter le message 1

La Matrice de Transition

Ajoutez des messages ci-dessus pour commencer à construire la matrice.

Cette carte terminée des connexions entre les mots s'appelle une table de fréquences. Normalisez chaque ligne et vous obtenez une distribution de probabilité de ce qui vient ensuite.

L'acte de choisir un mot suivant en fonction de ce que vous avez jusqu'à présent s'appelle sampling. Nous utilisons ce même terme pour ce processus avec les modèles de langage modernes comme Claude.

Faites du Sampling

En utilisant la même matrice basée sur 5 textes, allez-y et jouez de manière plus informée à notre jeu. Nous vous montrerons les probabilités.

↻ recommencer

La ligne en surbrillance est votre contexte actuel. Choisissez un mot parmi les options disponibles pour continuer.

Augmentez l'échelle

Cinq messages nous ont donné une petite matrice et une poignée de prédictions. Que se passe-t-il avec plus de données ?

\+ 1 message \+ 10 \+ 50 Tous 222

5 messages

17 mots uniques

13 contextes

24 transitions

2 options max

Après :

Les boutons

Lorsque vous faisiez du sampling, vous pouviez voir les probabilités, mais vous utilisiez aussi vos instincts sur les mots qui « semblaient justes ».

Si vous deviez écrire du code pour faire ces choix au lieu d'utiliser votre intuition, quelle règle codée pensez-vous créerait le meilleur résultat ?

Toujours choisir le mot avec la plus haute probabilité Choisir semi-aléatoirement, selon les probabilités Choisir selon les probabilités, mais aussi augmenter les choix les plus probables Ignorer tout ce qui est en dessous d'un certain seuil de probabilité Considérer uniquement les N meilleures options Mode Gobelin — ignorer les probabilités et choisir quelque chose au hasard

Montrez-moi les boutons

Génial. Jouez avec les boutons ci-dessous pour voir comment les paramètres de sampling impactent les choix d'un modèle de langage. Ensuite, vérifiez comment vos intuitions se sont alignées.

Les développeurs utilisent des paramètres comme la température et le tail trimming pour améliorer le sampling après la génération des probabilités.

Après « think » :

Température 1. 0

focaliséaléatoire

Sampling fidèle à la distribution.

Tail trimming

Supprimer entièrement les mots improbables avant le sampling.

Aucun Top-k Top-p

Top mots 3

Seuls les 3 mots les plus probables survivent.

Masse de probabilité 0. 9

Conservez le plus petit ensemble de mots dont les probabilités totalisent 90%.

Contrairement à top-k, cela s'adapte à la confiance — quand le modèle est sûr, moins de mots survivent. Quand il est incertain, plus le font.

Générer réinitialiser

Si vous aviez fait un choix plus tôt, vous aviez intuitivement sélectionné l'une de ces approches.

Comment mon intuition s'est-elle alignée sur ces paramètres ?

Le pont

Les stratégies de sampling que vous venez d'utiliser sont plus ou moins les mêmes contraintes de sampling que les développeurs transmettent à Claude. Pour les LLMs, quelques choses diffèrent.

Chaîne de Markov

LLM

1 Lire le contexte

dernier mot : « think »

1 Lire le contexte

toute la conversation jusqu'à présent

2 Calculer la distribution

chercher une ligne dans un tableau

2 Calculer la distribution

passage avant à travers des milliards de paramètres — attention, embeddings, couches feedforward, connexions résiduelles, layer norms...

3 Échantillonner le prochain token

we 32% the 16% i 11%

3 Échantillonner le prochain token même processus

we 32% the 16% i 11%

La recherche de table Markov est une opération vraiment simple et explicable. Un passage avant à travers un réseau de neurones est un peu plus complexe. Mais dans les deux cas, le résultat est le même : une distribution de probabilité des mots ou tokens suivants probables.

Bien que le sampling soit le même, l'entraînement est radicalement différent. Le mur exponentiel d'avant (vocabulaire N lignes) ne s'applique pas. Les LLMs échangent l'explicabilité du simple comptage des mots pour beaucoup plus de contexte et des capacités bien plus grandes.

Tech Centenaire

« Est-ce une vraie tech ? » Bonne question, lecteur.

Markov a publié cette idée en 1906. Un siècle plus tard en 2010, les modèles n-gram comme celui-ci alimentaient la prédiction du prochain mot sur votre téléphone (SwiftKey, puis QuickType d'Apple). Autour de 2015, les réseaux de neurones — d'abord les RNNs, puis les transformers en 2017 — ont commencé à remplacer l'approche de recherche de table par une fonction apprise, et le reste est... eh bien, c'est sur quoi nous travaillons maintenant.

Cartes mémo 10 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 6 questions