Claude Platform 101
← Toutes les leçons
Leçon 10Claude Platform 101

Ce qui compte comme contexte

Audio récapitulatif

Récapitulatif parlé — appuyez sur lecture pour suivre : la ligne lue reste en haut.

Notes de cours

Chaque requête que vous envoyez à Claude a une context window. Un million de tokens, ça semble beaucoup, mais ça s'épuise plus vite qu'on ne le pense une fois qu'on déploie un vrai agent. C'est là que la context management intervient : c'est comment rester dans la fenêtre sans perdre ce qui compte.

Ce qui compte comme contexte

Le contexte est tout ce que Claude voit sur un tour donné :

  • Le system prompt
  • L'historique des messages
  • Les définitions d'outils et les résultats des outils
  • Les fichiers attachés et les compétences
  • Les blocs de réflexion

Diagramme des cinq composants du contexte : system prompt, historique des messages, outils, fichiers et compétences, et blocs de réflexion

C'est l'entrée de chaque appel API. Vous payez pour ça à l'entrée, et vous payez pour ça à la sortie. Et une fois que la fenêtre est pleine, la requête échoue.

Donc l'objectif n'est pas de tout faire rentrer. L'objectif est de faire rentrer les bonnes choses.

Anthropic publie quatre modèles pour gérer le contexte dans les agents de longue durée. Trois sont des fonctionnalités API de première classe, et un est un modèle de conception.

Diagramme des quatre modèles pour gérer le contexte : contexte juste-à-temps, compaction, caching, et mémoire

Modèle 1 : Contexte juste-à-temps

Ne chargez pas tout d'avance. Chargez ce dont l'agent a besoin maintenant, et laissez-le en récupérer plus via des outils quand il le demande.

Pensez à un agent d'examen de conformité. Il ne reçoit pas tout le code du bâtiment fourré dans son system prompt — il appelle un outil lookup_building_code quand il a besoin d'une section spécifique. C'est le modèle de conception des quatre : rien de spécial dans l'API, juste un choix délibéré sur ce que vous chargez et quand.

Modèle 2 : Compaction côté serveur

Quand une conversation s'étire, la compaction côté serveur d'Anthropic résume les anciens tours en un seul bloc. Vous l'activez en ajoutant une clé context_management à votre requête, contenant une édition avec un type :

response = client. messages. create( model="claude-sonnet-4-5", max_tokens=1024, context_management={ "edits": [ {"type": "compact"} ] }, messages=messages, )

L'API résume automatiquement quand l'entrée dépasse le seuil de déclenchement. Vous n'avez pas à suivre la longueur de la conversation vous-même.

Modèle 3 : Prompt caching

Le prompt caching vous permet de marquer les parties stables d'une requête — le system prompt, les définitions d'outils, un long document — et de les réutiliser entre les appels à une fraction du coût.

Les mathématiques comptent plus qu'il n'y paraît. Si votre system prompt fait 4 000 tokens et que vous l'appelez 100 fois par heure, le caching est la différence entre une facture utilisable et un appel de la finance.

Modèle 4 : L'outil de mémoire

Certains contextes doivent survivre entre les sessions : les préférences de l'utilisateur, les notes de l'agent, ce qui a été décidé la semaine dernière. La primitive recommandée pour cela est l'outil de mémoire.

Voici comment ça fonctionne :

  • Claude lit et écrit dans un répertoire de mémoire via des appels d'outils.
  • Vous implémentez le client du backend de stockage côté client — un système de fichiers, une base de données, un magasin chiffré, ce que vous voulez.
  • Anthropic injecte automatiquement une instruction système indiquant à Claude de vérifier le répertoire de mémoire avant de commencer le travail.

Un répertoire de mémoire vu dans le navigateur, avec des dossiers pour les incidents et saas-pricing et une note d'incident sauvegardée d'une session précédente

Superposition des modèles

Dans une app de production, vous superposerez généralement les quatre à la fois. L'agent d'examen de conformité met en cache son system prompt et ses définitions d'outils, et récupère les sections du code du bâtiment juste-à-temps via lookup_building_code.

Chaque modèle gère un mode de défaillance différent : coût, taille de la fenêtre, absence d'état. Choisissez ceux qui correspondent à ce qui vous pose problème.

Récapitulatif

  • Le contexte est tout ce que Claude voit sur un tour — et ce n'est pas gratuit ou infini. Une fois que la fenêtre se remplit, la requête échoue.
  • Contexte juste-à-temps : chargez ce qui est nécessaire maintenant, laissez les outils récupérer le reste. C'est le modèle de conception des quatre.
  • Compaction côté serveur : ajoutez une clé context_management, et l'API résume automatiquement les anciens tours quand l'entrée dépasse le seuil de déclenchement.
  • Prompt caching : marquez les parties stables de la requête et réutilisez-les entre les appels à une fraction du coût.
  • L'outil de mémoire : Claude lit et écrit un répertoire de mémoire via des appels d'outils ; vous possédez le backend de stockage, donc le contexte survit entre les sessions.
  • Quatre modèles, un objectif. Câblez-les à la main, ou utilisez les agents gérés par Claude, qui livrent le caching et la compaction activés par défaut.
Cartes mémo 8 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 6 questions