Fable 5.1 Anthropic obniża koszty pamięci podręcznej o 75% i ponad dwukrotnie zwiększa wyniki agentyczne

Fable 5.1 Anthropic obniża koszty pamięci podręcznej o 75% i ponad dwukrotnie zwiększa wyniki agentyczne
View on original source
Category: SciTech
Share
Archive
Like
Anthropic zaktualizował Claude'a za pomocą Fable 5.1, obniżając koszt przetwarzania tokenów w cache z 1,00 USD do 0,25 USD za milion – redukcja o 75%, która pojawia się w momencie, gdy większość producentów AI odkryła, że to kumulacja kontekstu, a nie surowe obliczenia, jest w rzeczywistości tam, gdzie skupiają się budżety infrastrukturalne. W ramach żywej sesji agentycznej jedna rozmowa z Claudem może przechowywać w cache setki tysięcy tokenów w miarę narastania kontekstu między odpowiedziami. Przy stawce 0,25 USD za milion taka kumulacja staje się świadomym wyborem projektowym, a nie ograniczeniem kosztów, które programista musi obchodzić. Wyniki benchmarków towarzyszące zmianie cen pokazują wzrost wydajności, który pogłębia argument ekonomiczny. W teście Terminal-Bench-Science 0.1, który mierzy wieloetapowe rozumowanie naukowe wymagające projektowania eksperymentów i iteracyjnej analizy, Fable 5.1 uzyskał 52,6% wobec 24,7% dla Fable 5 – więcej niż podwajając poprzedni wynik. AutomationBench poprawił się z 17,1% do 31,4%, a Terminal-Bench 4.0, szersza ocena zdolności agentycznych, wzrósł z 42,0% do 55,8%. CursorBench 3.2.0 osiągnął 73,4%. Wzór we wszystkich czterech ocenach jest spójny: Fable 5.1 nie jest marginalnie lepszy na krawędzi, jest znacznie bardziej niezawodny w kategoriach zadań definiujących wartość agentyczną. Połączony efekt przepisuje arytmetykę kosztów budowania z Claudem. Aplikacja agentyczna, która realizuje zadanie w mniejszej liczbie kroków – ponieważ model jest bardziej niezawodny – zużywa mniej cykli tokenowych w drodze do pomyślnego wyniku. Zastosuj 75% cięcie kosztów cache do tokenów, które faktycznie wykorzystuje, a efektywna redukcja kosztu na zadanie w przepływach pracy o wysokim stopniu ponownego użycia sięga 45% lub więcej. Anthropic nie opublikował jednej nadrzędnej liczby dla łącznych oszczędności, ale programiści modelujący własną ekonomię tokenów dojdą do wartości w tym zakresie dla obciążeń wymagających dużego kontekstu. Fable 5.1 jest dostępny natychmiast przez bezpośrednie API Anthropic pod identyfikatorem modelu claude-fable-5-1, a także przez Amazon Web Services Bedrock, Google Cloud Platform i Microsoft Azure. Anthropic ogłosił Enterprise Frontier Safeguards jako równoczesną funkcjonalność: kontrola retencji danych przez klienta, klucze szyfrowania zarządzane przez klienta oraz wdrożenie w istniejącej dzierżawie infrastruktury chmurowej klienta – wszystko wliczone w cenę bez dodatkowych opłat poza podstawowymi kosztami chmury. Równolegle z ogólnym udostępnieniem Anthropic wprowadził Mythos 5.1, wariant tego samego modelu działający – jak opisuje firma – z bardziej permisywnymi zabezpieczeniami dla zweryfikowanych organizacji. Dostęp jest ograniczony do zweryfikowanych instytucji badawczych z zakresu cyberbezpieczeństwa i firm z sektora nauk przyrodniczych. Firma wymieniła demonstrowane zastosowania, w tym projektowanie wiązań białkowych i optymalizację modeli biologicznych przy przepustowości wnioskowania do 2,5 razy większej niż w standardowym wydaniu. Dostęp do Mythos 5.1 nie jest samoobsługowy: Anthropic rozpatruje zgłoszenia indywidualnie i nie opublikował wielkości zarejestrowanej grupy. Wyniki agentyczne Fable 5.1, szczególnie w Terminal-Bench-Science, stawiają opublikowane rezultaty Anthropic przed ostatnimi ujawnionymi danymi OpenAI w porównywalnych ocenach. Międzysystemowe porównania benchmarków niosą ze sobą metodologiczne zastrzeżenia – dostawcy wybierają oceny, które faworyzują ich modele, a konkretne testy wybrane przez Anthropic były prawdopodobnie wybrane ze względu na korzystne wyniki. Trudniej jednak wytłumaczyć wewnętrzny wzór podwajania: Fable 5.1 to nie ten sam model z obniżoną ceną. Zmiana wydajności jest na tyle duża, że historia cen i historia wydajności nie mogą być rozdzielone. Dla programistów, którzy obecnie nie używają Claude'a, ruch cenowy w cache jest liczbą wartą przełożenia na własną ekonomię tokenów. Każdy dostawca AI, który nie zbliży się do 0,25 USD za milion tokenów w cache, będzie teraz musiał stawić czoła bezpośrednim porównaniom kosztów w rozmowach sprzedażowych z przedsiębiorstwami. Cena cache u Anthropic była już niższa niż u kilku konkurentów przed tą obniżką; luka się powiększyła. Usprawnienia wydajności są trudniejsze do uogólnienia na różne przypadki użycia, ale w segmencie agentycznym i naukowego rozumowania Fable 5.1 ustanawia poziom benchmarku, z którym będzie mierzona następna duża wersja dowolnego dostawcy.

(0)Comments

 

A note on cookies

Newshunt uses essential cookies to keep you signed in and to remember your language and country, so the site works the way you expect. With your permission, we'd also like to use analytics cookies to understand how people use Newshunt and improve it over time.

Accepting only affects analytics. To learn more, view our Privacy Policy or Terms & Conditions.