बोला गया सारांश — साथ पढ़ने के लिए प्ले दबाएँ: बोली जा रही पंक्ति ऊपर रहती है।
आप Claude के साथ एक ऐप शिप कर रहे हैं। आप कौन सा मॉडल चुनते हैं? यदि आप सबसे स्मार्ट वाले को डिफ़ॉल्ट करते हैं, तो आपका API बिल आपको आश्चर्यचकित करेगा। सबसे सस्ता चुनें, और आउटपुट टिक नहीं सकता। प्रत्येक मॉडल के अलग-अलग ट्रेड-ऑफ हैं, और सही मॉडल चुनना गुणवत्ता और लागत दोनों को प्रभावित करता है।
मॉडल टियर्स
Anthropic वर्तमान में चार मॉडल टियर्स प्रदान करता है, और आप अपनी API कॉल में model पैरामीटर के साथ उनके बीच चुनाव करते हैं।
ध्यान दें कि इस कोर्स के समय, Claude Fable आम तौर पर उपलब्ध नहीं था, और ऊपर दिए गए वीडियो में प्रतिबिंबित नहीं हैं। Claude Fable और Claude Mythos के बारे में अधिक जानेंयहाँ।
- Claude Fable हमारा अब तक का सबसे सक्षम मॉडल है — एक नया टियर जो Opus के ऊपर बैठता है, आपकी सबसे कठिन चुनौतियों के लिए बनाया गया है। यह Opus की तुलना में काफी अधिक लागत पर आता है, इसलिए इसे उस काम के लिए आरक्षित करें जहां वह अतिरिक्त क्षमता भुगतान के लायक हो।
- Claude Opus तीन मुख्य मॉडल परिवारों में सबसे सक्षम है, लेकिन तीनों में सबसे धीमा और सबसे अधिक लागत वाला भी है। इसे गहन तर्क, जटिल विश्लेषण, बहु-चरणीय कोडिंग, और सूक्ष्म लेखन के लिए उपयोग करें।
- Claude Haiku सबसे तेज़ और सबसे कम लागत वाला है, अधिकतम बुद्धिमत्ता के बजाय गति और लागत दक्षता के लिए अनुकूलित। इसे उच्च-मात्रा, कम-जटिलता वाले काम जैसे वर्गीकरण, निष्कर्षण, और रूटिंग के लिए उपयोग करें।
- Claude Sonnet甜蜜स्थान में बैठता है: बुद्धिमत्ता, गति, और लागत का एक संतुलित संयोजन जो अधिकांश उत्पादन कार्य के लिए अच्छी तरह से काम करता है।
तीन कार्ड Claude मॉडल टियर्स की तुलना करते हैं: Haiku \(सबसे तेज़, सबसे कम लागत, वर्गीकरण और रूटिंग के लिए\), Sonnet \(सक्षम और तेज़, अधिकांश उत्पादन कार्य के लिए\), और Opus \(सबसे बुद्धिमान, सबसे अधिक लागत, गहन तर्क और जटिल विश्लेषण के लिए\)
एक सरल मूल्यांकन के साथ शुरू करें
इससे पहले कि आप उत्पादन कोड लिखें, एक सरल मूल्यांकन सेट करें: उदाहरण इनपुट का एक सेट जो आप प्रत्येक मॉडल के माध्यम से चलाते हैं और अपने उपयोग के मामले के लिए अच्छे आउटपुट का मतलब क्या है इसके विरुद्ध स्कोर करते हैं। आपको कुछ भी फैंसी की आवश्यकता नहीं है — आपके वास्तविक वर्कलोड से 20 या 30 प्रतिनिधि उदाहरण शुरू करने के लिए पर्याप्त हैं।
फिर टियर्स के माध्यम से अपना रास्ता काम करें:
- पहले अपने उदाहरणों को Haiku के माध्यम से चलाएं। यदि गुणवत्ता बनी रहती है, तो आप कर चुके हैं — और आपने बहुत सारा पैसा बचाया है।
- यदि नहीं, तो Sonnet तक कदम बढ़ाएं।
- केवल तभी Opus के लिए पहुंचें जब कार्य को इसकी आवश्यकता हो।
टियर्स की तुलना करना साथ-साथ
आइए टियर्स के बीच अंतर देखें, बस इसके बारे में बात न करें। हम सभी तीन मॉडलों के माध्यम से एक ही प्रॉम्प्ट भेजेंगे और लेटेंसी और token गणना देखेंगे:
models = ["claude-haiku-4-5", "claude-sonnet-4-6", "claude-opus-4-7"]
for model in models: response = client. messages. create( model=model, max_tokens=300, messages=[{"role": "user", "content": prompt}], ) print(model, response. usage)
यहां दो चीजें चल रही हैं:
- लूप प्रत्येक अनुरोध पर model फील्ड को स्वैप करता है। एक ही प्रॉम्प्ट, एक ही अधिकतम tokens — केवल मॉडल बदलता है।
- response. usage आपको API से सीधे इनपुट और आउटपुट tokens देता है, जो आपके बिल की गणना किस पर की जाती है।
Opus, Sonnet, और Haiku के माध्यम से एक ही प्रॉम्प्ट चलाने से टर्मिनल आउटपुट, प्रत्येक मॉडल की लेटेंसी और इनपुट/आउटपुट token गणना दिखा रहा है
इसे चलाएं और आप तीन मॉडल और तीन संख्याओं के सेट देखेंगे। Opus सबसे लंबा समय लेता है और सबसे पॉलिश पढ़ता है — लेकिन दो-वाक्य परिभाषा के लिए, वह पॉलिश बर्बाद है। Sonnet लेखन को थोड़ा कसता है। और Haiku वापस आता है, अक्सर एक सेकंड से कम में, एक बहुत ही सक्षम दो-वाक्य उत्तर के साथ। यह ईमानदारी से इस तरह के परिदृश्य के लिए परिपूर्ण है।
और यह पूरा बिंदु है: सही मॉडल सबसे सस्ता है जिसका आउटपुट आप वास्तव में शिप करेंगे। एक परिभाषा के लिए, Haiku पर्याप्त है। एक नियामक प्रतिक्रिया का मसौदा तैयार करने के लिए, आप एक ही तुलना चलाएंगे और संभवतः Opus पर समाप्त होंगे। eval हर बार एक ही आकार है।
विभिन्न कार्यों को विभिन्न मॉडलों में रूट करना
एक वास्तविक ऐप में, आप एक ही एंडपॉइंट के अंदर विभिन्न प्रकार के कार्यों को विभिन्न मॉडलों में रूट करेंगे। एक दस्तावेज़ प्रसंस्करण मार्ग के साथ एक संचालन डैशबोर्ड लें:
- प्रत्येक आने वाली फ़ाइल को Haiku के साथ वर्गीकृत किया जाता है।
- क्लाइंट अपडेट को Sonnet के साथ तैयार किया जाता है।
- केवल RFP प्रतिक्रियाएं Opus के लिए पहुंचती हैं।
एक कतार, तीन मॉडल, प्रति कार्य चुने गए।
सारांश
- Anthropic तीन मॉडल टियर्स प्रदान करता है: कठिन समस्याओं के लिए Opus, दैनिक कार्य के लिए Sonnet, और मात्रा के लिए Haiku।
- उत्पादन कोड लिखने से पहले एक सरल मूल्यांकन सेट करें — आपके वास्तविक वर्कलोड से 20 या 30 प्रतिनिधि उदाहरण।
- eval को Haiku से ऊपर की ओर चलाएं और सबसे सस्ते मॉडल पर रुकें जिसका आउटपुट आप वास्तव में शिप करेंगे।
- response. usage इनपुट और आउटपुट tokens की रिपोर्ट करता है, जो आपके बिल पर आधारित है।
- उत्पादन में, सभी के लिए एक मॉडल चुनने के बजाय एक ही एंडपॉइंट के अंदर विभिन्न कार्यों को विभिन्न मॉडलों में रूट करें।