Gesprochene Zusammenfassung — drücke auf Play zum Mitlesen: die gesprochene Zeile bleibt oben.
Der 100% interpretierbare Next-Token-Generator
Schreib eine Nachricht
Vor langer Zeit spielten meine Freunde und ich ein Spiel, bei dem man sein Telefon schnappte und eine Nachricht an einen Freund nur mit den empfohlenen nächsten Wörtern verfasste. Vielleicht hast du das auch gemacht.
Hier ist ein Simulator, der auf etwas Inhalt „trainiert" wurde. Probier es aus!
hey does anyone know how to fix the build
i think |
the we i
↻ start over
Wir sprachen darüber, als wäre es ein „Mich-Bot". Wir wussten, dass es Wörter basierend auf unseren individuellen Nutzungsmustern empfahl, und wir konnten unsere Stimmen in unseren personalisierten Empfehlungen sehen.
Damals waren wir glücklich, es als Tech-Magie abzutun. Ich glaube nicht, dass wir realisierten, wie einfach der Algorithmus sein könnte.
Lies weiter, wenn du einen mit mir bauen möchtest :)
Dein Modell „trainieren"
Lass uns mit einer Handvoll Nachrichten trainieren. Alles, was wir tun müssen, ist die Verbindungen zwischen Wörtern zu zählen. Lass uns das eine Nachricht nach der anderen machen.
\+ Add message 1
Die Übergängsmatrix
Füge oben Nachrichten hinzu, um die Matrix zu erstellen.
Diese fertige Karte der Verbindungen zwischen Wörtern wird Häufigkeitstabelle genannt. Normalisiere jede Zeile und du erhältst eine Wahrscheinlichkeitsverteilung dessen, was als nächstes kommt.
Der Akt, ein nächstes Wort basierend auf dem auszuwählen, was du bisher hast, wird Sampling genannt. Wir verwenden denselben Begriff für diesen Prozess mit modernen Language Models wie Claude.
Mach etwas Sampling
Verwende dieselbe Matrix basierend auf 5 Texten und spiel unser Spiel mit mehr Informationen. Wir zeigen dir die Wahrscheinlichkeiten.
↻ start over
Die hervorgehobene Zeile ist dein aktueller context window. Wähle ein Wort aus den verfügbaren Optionen, um fortzufahren.
100 Jahre alte Technologie
„Ist das echte Technologie? " Gute Frage, Leser.
Markov veröffentlichte diese Idee 1906. Ein Jahrhundert später, 2010, trieben n-gram-Modelle wie dieses die Next-Token-Prediction auf deinem Telefon an (SwiftKey, dann Apples QuickType). Um 2015 begannen neuronale Netze – zuerst RNNs, dann Transformer 2017 – den Table-Lookup-Ansatz durch eine gelernte Funktion zu ersetzen, und der Rest ist... nun ja, das ist das, woran wir jetzt arbeiten.