Claude Platform 101
← Toutes les leçons
Leçon 03Claude Platform 101

Les niveaux de modèles

Audio récapitulatif

Récapitulatif parlé — appuyez sur lecture pour suivre : la ligne lue reste en haut.

Notes de cours

Vous déployez une application avec Claude. Quel modèle choisissez-vous ? Si vous optez par défaut pour le plus intelligent, votre facture API vous surprendra. Choisissez le moins cher, et la sortie pourrait ne pas être à la hauteur. Chaque modèle a des compromis différents, et le choix du bon affecte à la fois la qualité et le coût.

Les niveaux de modèles

Anthropic propose actuellement quatre niveaux de modèles, et vous choisissez entre eux avec le paramètre model dans votre appel API.

Notez qu'au moment de ce cours, Claude Fable n'était pas généralement disponible et n'est pas reflété dans la vidéo ci-dessus. En savoir plus sur Claude Fable et Claude Mythosici.

  • Claude Fable est notre modèle le plus capable à ce jour — un nouveau niveau qui se situe au-dessus d'Opus, conçu pour vos défis les plus difficiles. Il coûte significativement plus cher qu'Opus, alors réservez-le pour les travaux où cette capacité supplémentaire vaut la peine de payer.
  • Claude Opus est le plus capable des trois familles de modèles principaux, mais aussi le plus lent et le plus coûteux des trois. Utilisez-le pour le raisonnement profond, l'analyse complexe, le codage multi-étapes et l'écriture nuancée.
  • Claude Haiku est le plus rapide et le moins coûteux, optimisé pour la vitesse et l'efficacité des coûts plutôt que pour l'intelligence maximale. Utilisez-le pour les travaux à haut volume et faible complexité comme la classification, l'extraction et le routage.
  • Claude Sonnet se situe dans la zone idéale : une combinaison équilibrée d'intelligence, de vitesse et de coût qui fonctionne bien pour la plupart des travaux en production.

Trois cartes comparant les niveaux de modèles Claude : Haiku \(le plus rapide, le moins coûteux, pour la classification et le routage\), Sonnet \(capable et rapide, pour la plupart des travaux en production\), et Opus \(le plus intelligent, le plus coûteux, pour le raisonnement profond et l'analyse complexe\)

Commencez par une évaluation simple

Avant d'écrire du code en production, mettez en place une simple évaluation : un ensemble d'exemples d'entrée que vous exécutez à travers chaque modèle et que vous évaluez par rapport à ce qu'une bonne sortie signifie pour votre cas d'usage. Vous n'avez pas besoin de quelque chose de sophistiqué — 20 ou 30 exemples représentatifs de votre charge de travail réelle suffisent pour commencer.

Ensuite, travaillez votre chemin à travers les niveaux :

  • Exécutez d'abord vos exemples à travers Haiku. Si la qualité tient, vous avez terminé — et vous venez d'économiser beaucoup d'argent.
  • Si ce n'est pas le cas, passez à Sonnet.
  • Ne recourez à Opus que lorsque la tâche l'exige.

Comparaison des niveaux côte à côte

Voyons la différence entre les niveaux, pas seulement en parlons. Nous enverrons le même prompt à travers les trois modèles et observerons la latence et les comptages de tokens :

models = ["claude-haiku-4-5", "claude-sonnet-4-6", "claude-opus-4-7"]

for model in models: response = client. messages. create( model=model, max_tokens=300, messages=[{"role": "user", "content": prompt}], ) print(model, response. usage)

Deux choses se passent ici :

  • La boucle échange le champ model à chaque requête. Même prompt, mêmes tokens max — seul le modèle change.
  • response. usage vous donne les tokens d'entrée et de sortie directement depuis l'API, c'est sur quoi votre facture est calculée.

Sortie du terminal en exécutant le même prompt à travers Opus, Sonnet et Haiku, montrant la latence et les comptages de tokens d'entrée/sortie de chaque modèle

Exécutez-le et vous verrez trois modèles et trois ensembles de nombres. Opus prend le plus de temps et produit la sortie la plus soignée — mais pour une définition de deux phrases, ce soin est gaspillé. Sonnet resserre un peu l'écriture. Et Haiku revient, souvent en moins d'une seconde, avec une réponse de deux phrases très compétente. C'est honnêtement parfait pour ce genre de scénario.

Et c'est tout l'intérêt : **le bon modèle est le moins cher dont vous expédieriez réellement la sortie. ** Pour une définition, Haiku suffit. Pour rédiger une réponse réglementaire, vous exécuteriez la même comparaison et finiriez probablement sur Opus. L'éval a la même forme à chaque fois.

Routage de différents travaux vers différents modèles

Dans une vraie application, vous routeriez différents types de travaux vers différents modèles à l'intérieur du même endpoint. Prenez un tableau de bord des opérations avec une route de traitement de documents :

  • Chaque fichier entrant est classifié avec Haiku.
  • Les mises à jour des clients sont rédigées avec Sonnet.
  • Seules les réponses RFP recourent à Opus.

Une file d'attente, trois modèles, choisis par tâche.

Récapitulatif

  • Anthropic propose trois niveaux de modèles : Opus pour les problèmes difficiles, Sonnet pour le travail quotidien, et Haiku pour le volume.
  • Mettez en place une évaluation simple — 20 ou 30 exemples représentatifs de votre charge de travail réelle — avant d'écrire du code en production.
  • Exécutez l'éval à partir de Haiku vers le haut et arrêtez-vous au modèle le moins cher dont vous expédieriez réellement la sortie.
  • response. usage rapporte les tokens d'entrée et de sortie, c'est sur quoi votre facture est basée.
  • En production, routez différentes tâches vers différents modèles à l'intérieur du même endpoint au lieu de choisir un modèle pour tout.
Cartes mémo 7 cartes
Question
cliquez pour révéler · ←/→
Réponse
cliquez pour retourner
Exporter vers Anki (.tsv) ↓
Vérification des connaissances 6 questions