Gesprochene Zusammenfassung — drücke auf Play zum Mitlesen: die gesprochene Zeile bleibt oben.
Jede Anfrage, die Sie an Claude senden, hat ein Context Window. Eine Million Token klingt nach viel, aber es ist schneller aufgebraucht, als man denkt, wenn man einen echten Agent in Produktion nimmt. Hier kommt Context Management ins Spiel: Es geht darum, im Window zu bleiben, ohne das Wichtige zu verlieren.
Was zählt als Context
Context ist alles, was Claude in einer bestimmten Runde sieht:
- Der System Prompt
- Die Nachrichtenhistorie
- Tool-Definitionen und Tool-Ergebnisse
- Angehängte Dateien und Skills
- Thinking Blocks
Diagramm der fünf Komponenten von Context: System Prompt, Nachrichtenhistorie, Tools, Dateien und Skills sowie Thinking Blocks
Es ist die Eingabe für jeden einzelnen API-Aufruf. Sie zahlen dafür beim Eingang, und Sie zahlen dafür beim Ausgang. Und sobald das Window voll ist, schlägt die Anfrage fehl.
Das Ziel ist also nicht, alles hineinzupassen. Das Ziel ist, die richtigen Dinge hineinzupassen.
Anthropic veröffentlicht vier Muster für die Verwaltung von Context in langfristigen Agents. Drei sind First-Class-API-Features, und eines ist ein Design Pattern.
Diagramm der vier Muster zur Context-Verwaltung: Just-in-Time-Context, Komprimierung, Caching und Memory
Muster 1: Just-in-Time-Context
Laden Sie nicht alles im Voraus. Laden Sie, was der Agent jetzt braucht, und lassen Sie ihn über Tools mehr abrufen, wenn er danach fragt.
Denken Sie an einen Compliance-Review-Agent. Er bekommt nicht das gesamte Baugesetzbuch in seinen System Prompt gestopft — er ruft ein lookup_building_code Tool auf, wenn er einen bestimmten Abschnitt braucht. Dies ist das Design Pattern der vier: nichts Besonderes in der API, nur eine bewusste Entscheidung darüber, was Sie laden und wann.
Muster 2: Server-seitige Komprimierung
Wenn ein Gespräch lange läuft, fasst die Server-seitige Komprimierung von Anthropic alte Runden in einem einzelnen Block zusammen. Sie aktivieren dies, indem Sie einen context_management Schlüssel zu Ihrer Anfrage hinzufügen, der ein Edit mit einem Typ enthält:
response = client. messages. create( model="claude-sonnet-4-5", max_tokens=1024, context_management={ "edits": [ {"type": "compact"} ] }, messages=messages, )
Die API fasst automatisch zusammen, wenn die Eingabe den Trigger-Schwellenwert überschreitet. Sie müssen die Gesprächslänge nicht selbst verfolgen.
Muster 3: Prompt Caching
Prompt Caching ermöglicht es Ihnen, die stabilen Teile einer Anfrage — den System Prompt, die Tool-Definitionen, ein langes Dokument — zu markieren und sie über mehrere Aufrufe hinweg zu einem Bruchteil der Kosten wiederzuverwenden.
Die Mathematik ist wichtiger, als sie aussieht. Wenn Ihr System Prompt 4. 000 Token umfasst und Sie ihn 100 Mal pro Stunde aufrufen, ist Caching der Unterschied zwischen einer nutzbaren Rechnung und einem Anruf von der Finanzabteilung.
Muster 4: Das Memory Tool
Einige Kontexte müssen über Sessions hinweg bestehen bleiben: Benutzereinstellungen, die laufenden Notizen des Agents, was letzte Woche entschieden wurde. Das empfohlene Primitive dafür ist das Memory Tool.
So funktioniert es:
- Claude liest und schreibt über Tool-Aufrufe in ein Memory-Verzeichnis.
- Sie implementieren den Storage-Backend Client-seitig — ein Dateisystem, eine Datenbank, ein verschlüsselter Speicher, was immer Sie möchten.
- Anthropic injiziert automatisch eine System-Anweisung, die Claude anweist, das Memory-Verzeichnis zu überprüfen, bevor er mit der Arbeit beginnt.
Ein Memory-Verzeichnis im Browser angezeigt, mit Ordnern für Incidents und SAAS-Pricing sowie einer gespeicherten Incident-Notiz aus einer vorherigen Session
Schichtung der Muster
In einer Production App werden Sie normalerweise alle vier Muster gleichzeitig schichten. Der Compliance-Review-Agent cached seinen System Prompt und seine Tool-Definitionen und ruft Baugesetzbuch-Abschnitte Just-in-Time über lookup_building_code ab.
Jedes Muster behandelt einen anderen Fehlermodus: Kosten, Window-Größe, Zustandslosigkeit. Wählen Sie die aus, die zu dem passen, was bei Ihnen kaputt geht.
Zusammenfassung
- Context ist alles, was Claude in einer Runde sieht — und es ist nicht kostenlos oder unbegrenzt. Sobald das Window voll ist, schlägt die Anfrage fehl.
- Just-in-Time-Context: Laden Sie, was jetzt nötig ist, lassen Sie Tools den Rest abrufen. Dies ist das Design Pattern der vier.
- Server-seitige Komprimierung: Fügen Sie einen context_management Schlüssel hinzu, und die API fasst alte Runden automatisch zusammen, wenn die Eingabe den Trigger-Schwellenwert überschreitet.
- Prompt Caching: Markieren Sie stabile Teile der Anfrage und verwenden Sie sie über mehrere Aufrufe hinweg zu einem Bruchteil der Kosten wieder.
- Das Memory Tool: Claude liest und schreibt ein Memory-Verzeichnis über Tool-Aufrufe; Sie besitzen den Storage-Backend, sodass Context über Sessions hinweg bestehen bleibt.
- Vier Muster, ein Ziel. Verdrahten Sie sie manuell, oder verwenden Sie Claude Managed Agents, die standardmäßig mit Caching und Komprimierung ausgeliefert werden.