Anthropic के Fable 5.1 ने कैश लागत 75% घटाई और एजेंटिक स्कोर दोगुने से भी ज़्यादा

Anthropic के Fable 5.1 ने कैश लागत 75% घटाई और एजेंटिक स्कोर दोगुने से भी ज़्यादा
View on original source
Category: SciTech
Share
Archive
Like
Anthropic ने 1 सितंबर को Claude को Fable 5.1 के साथ अपडेट किया, जिससे कैश्ड इनपुट टोकन की लागत $1.00 प्रति मिलियन से घटाकर $0.25 प्रति मिलियन कर दी गई — यह 75% की कमी ऐसे समय में आई है जब अधिकांश प्रोडक्शन AI डेवलपर्स को यह एहसास हो चुका है कि उनका इंफ्रास्ट्रक्चर बजट कच्ची कंप्यूटेशन पर नहीं, बल्कि संदर्भ संचय (कॉन्टेक्स्ट एक्युमुलेशन) पर केंद्रित होता है। एक लाइव एजेंटिक सेशन में, एक ही Claude वार्तालाप में सैकड़ों-हजारों टोकन कैश में जमा हो सकते हैं क्योंकि टर्न दर टर्न संदर्भ बढ़ता जाता है। $0.25 प्रति मिलियन पर, यह संचय एक डेवलपर के लिए लागत सीमा के बजाय एक जानबूझकर डिज़ाइन विकल्प बन जाता है जिसके चारों ओर उसे काम करना पड़ता था। मूल्य परिवर्तन के साथ आए बेंचमार्क परिणाम ऐसे प्रदर्शन लाभ दिखाते हैं जो आर्थिक तर्क को और मजबूत करते हैं। Terminal-Bench-Science 0.1 पर, जो प्रयोगात्मक डिज़ाइन और पुनरावृत्त विश्लेषण की आवश्यकता वाले बहु-चरणीय वैज्ञानिक तर्क को मापता है, Fable 5.1 ने 52.6% स्कोर किया जबकि Fable 5 का स्कोर 24.7% था — पिछले परिणाम को दोगुने से अधिक कर दिया। AutomationBench में 17.1% से 31.4% तक सुधार हुआ, और Terminal-Bench 4.0, जो एक व्यापक एजेंटिक क्षमता मूल्यांकन है, 42.0% से बढ़कर 55.8% हो गया। CursorBench 3.2.0 पर स्कोर 73.4% रहा। सभी चार मूल्यांकनों में पैटर्न एकसमान है: Fable 5.1 मामूली रूप से बेहतर नहीं है, बल्कि उन कार्यों की श्रेणियों में काफी अधिक विश्वसनीय है जो एजेंटिक मूल्य को परिभाषित करते हैं। संयुक्त प्रभाव Claude के साथ निर्माण की लागत अंकगणित को फिर से लिखता है। एक एजेंटिक एप्लिकेशन जो कम टर्न में कार्य पूरा करता है — क्योंकि मॉडल अधिक विश्वसनीय है — सफल परिणाम तक पहुँचने के रास्ते में कुल टोकन चक्रों की कम खपत करता है। इस पर 75% कैश कटौती लागू करें, और उच्च-पुन:उपयोग वाले एजेंटिक वर्कफ़्लो में प्रभावी प्रति-कार्य लागत में कमी 45% या उससे अधिक तक पहुँच जाती है। Anthropic ने संयुक्त बचत के लिए एक एकल शीर्षक संख्या प्रकाशित नहीं की है, लेकिन जो डेवलपर अपने स्वयं के टोकन अर्थशास्त्र का मॉडल बनाते हैं, वे संदर्भ-भारी वर्कलोड के लिए इस सीमा के आसपास के आंकड़ों पर पहुँचेंगे। Fable 5.1 तुरंत Anthropic के डायरेक्ट API के माध्यम से मॉडल पहचानकर्ता claude-fable-5-1 के तहत, और Amazon Web Services Bedrock, Google Cloud Platform तथा Microsoft Azure के माध्यम से उपलब्ध है। Anthropic ने Enterprise Frontier Safeguards को एक समवर्ती क्षमता के रूप में घोषित किया: ग्राहक-नियंत्रित डेटा प्रतिधारण, ग्राहक-प्रबंधित एन्क्रिप्शन कुंजियाँ, और प्रत्येक ग्राहक के मौजूदा क्लाउड इंफ्रास्ट्रक्चर टेनेंट के भीतर तैनाती, जो अंतर्निहित क्लाउड लागतों के अतिरिक्त बिना किसी शुल्क के शामिल है। सामान्य रिलीज़ के साथ-साथ, Anthropic ने Mythos 5.1 पेश किया, जो उसी अंतर्निहित मॉडल का एक प्रकार है जो कंपनी के अनुसार सत्यापित संगठनों के लिए अधिक उदार सुरक्षा उपायों के साथ संचालित होता है। इसकी पहुँच केवल सत्यापित साइबर सुरक्षा अनुसंधान संस्थानों और जीवन-विज्ञान कंपनियों तक सीमित है। कंपनी ने प्रदर्शित अनुप्रयोगों का हवाला दिया जिनमें प्रोटीन बाइंडर डिज़ाइन और जैविक मॉडल ऑप्टिमाइज़ेशन शामिल है, जो मानक रिलीज़ की तुलना में 2.5 गुना तक अधिक इन्फ़रेंस थ्रूपुट पर काम करता है। Mythos 5.1 तक पहुँच स्व-सेवा नहीं है: Anthropic आवेदनों की व्यक्तिगत रूप से समीक्षा करता है और उसने नामांकित समूह के आकार को प्रकाशित नहीं किया है। Fable 5.1 के एजेंटिक आंकड़े, विशेष रूप से Terminal-Bench-Science पर, Anthropic के प्रकाशित परिणामों को तुलनीय मूल्यांकनों पर OpenAI के सबसे हालिया खुलासा किए गए आंकड़ों से आगे रखते हैं। क्रॉस-कंपनी बेंचमार्क तुलनाओं में पद्धतिगत सावधानी आवश्यक है — विक्रेता ऐसे मूल्यांकन चुनते हैं जो उनके मॉडलों के पक्ष में हों, और Anthropic द्वारा हाइलाइट किए गए विशिष्ट परीक्षण संभवतः उनके अनुकूल परिणामों के लिए चुने गए थे। जिस चीज़ को आसानी से नकारा नहीं जा सकता वह आंतरिक दोहरीकरण पैटर्न है: Fable 5.1 वही मॉडल नहीं है जिसमें मूल्य कटौती जोड़ी गई हो। प्रदर्शन परिवर्तन इतना बड़ा है कि मूल्य निर्धारण की कहानी और प्रदर्शन की कहानी को अलग नहीं किया जा सकता। जो डेवलपर वर्तमान में Claude का उपयोग नहीं करते, उनके लिए कैश मूल्य निर्धारण का यह कदम वह संख्या है जिसे अपने स्वयं के टोकन अर्थशास्त्र में अनुवाद करना उचित है। कोई भी AI प्रदाता जो $0.25 प्रति मिलियन कैश्ड टोकन के करीब नहीं पहुँचता, उसे अब एंटरप्राइज सेल्स वार्तालापों में सीधे लागत तुलना के सवालों का सामना करना पड़ेगा। इस कटौती से पहले भी Anthropic का कैश मूल्य कई प्रतिस्पर्धियों से कम था; अब यह अंतर और बढ़ गया है। प्रदर्शन सुधारों को उपयोग के मामलों में सामान्यीकृत करना कठिन है, लेकिन एजेंटिक और वैज्ञानिक-तर्क खंड में, Fable 5.1 एक बेंचमार्क स्तर निर्धारित करता है जिसके विरुद्ध किसी भी प्रदाता की अगली बड़ी रिलीज़ को मापा जाएगा।

(0)Comments

 

A note on cookies

Newshunt uses essential cookies to keep you signed in and to remember your language and country, so the site works the way you expect. With your permission, we'd also like to use analytics cookies to understand how people use Newshunt and improve it over time.

Accepting only affects analytics. To learn more, view our Privacy Policy or Terms & Conditions.