Fable 5.1 da Anthropic reduz custos de cache em 75% e mais do que duplica pontuações agênticas

Fable 5.1 da Anthropic reduz custos de cache em 75% e mais do que duplica pontuações agênticas
View on original source
Category: SciTech
Share
Archive
Like
Anthropic atualizou o Claude a 1 de setembro com o Fable 5.1, reduzindo o custo dos tokens de entrada em cache de $1,00 para $0,25 por milhão — uma redução de 75% que chega no momento em que a maioria dos programadores de IA em produção descobriu que a acumulação de contexto, e não a computação bruta, é onde os seus orçamentos de infraestrutura realmente se concentram. Numa sessão agentiva em tempo real, uma única conversa do Claude pode conter centenas de milhares de tokens em cache à medida que o contexto se acumula ao longo das interações. A $0,25 por milhão, essa acumulação torna-se uma escolha de design deliberada, em vez de um teto de custo que o programador contorna. Os resultados de benchmark que acompanham a alteração de preço mostram ganhos de desempenho que reforçam o caso económico. No Terminal-Bench-Science 0.1, que mede o raciocínio científico em múltiplos passos exigindo conceção experimental e análise iterativa, o Fable 5.1 obteve 52,6% contra os 24,7% do Fable 5 — mais do que duplicando o resultado anterior. O AutomationBench melhorou de 17,1% para 31,4%, e o Terminal-Bench 4.0, uma avaliação mais ampla de capacidades agentivas, subiu de 42,0% para 55,8%. O CursorBench 3.2.0 registou 73,4%. O padrão em todas as quatro avaliações é consistente: o Fable 5.1 não é incrementalmente melhor na margem — é substancialmente mais fiável nas categorias de tarefas que definem o valor agentivo. O efeito combinado reescreve a aritmética de custos de construir com Claude. Uma aplicação agentiva que completa uma tarefa em menos interações — porque o modelo é mais fiável — consome menos ciclos totais de tokens no caminho para um resultado bem-sucedido. Aplique o corte de 75% na cache aos tokens que efetivamente utiliza, e a redução efetiva de custo por tarefa em fluxos de trabalho agentivos com elevada reutilização atinge os 45% ou mais. A Anthropic não publicou um único número de destaque para as poupanças compostas, mas os programadores que modelam a sua própria economia de tokens chegarão a valores nessa ordem para cargas de trabalho com uso intensivo de contexto. O Fable 5.1 está disponível imediatamente através da API direta da Anthropic sob o identificador de modelo claude-fable-5-1, e através do Amazon Web Services Bedrock, Google Cloud Platform e Microsoft Azure. A Anthropic anunciou o Enterprise Frontier Safeguards como uma capacidade concorrente: retenção de dados controlada pelo cliente, chaves de encriptação geridas pelo cliente e implantação dentro do inquilino de infraestrutura cloud existente de cada cliente, incluído sem custos adicionais para além dos custos de cloud subjacentes. Juntamente com o lançamento geral, a Anthropic introduziu o Mythos 5.1, uma variante do mesmo modelo subjacente que opera com o que a empresa descreve como salvaguardas mais permissivas para organizações verificadas. O acesso é restrito a instituições de investigação em cibersegurança e empresas de ciências da vida verificadas. A empresa citou aplicações demonstradas, incluindo a conceção de ligantes proteicos e a otimização de modelos biológicos com um rendimento de inferência até 2,5 vezes superior ao da versão standard. O acesso ao Mythos 5.1 não é self-service: a Anthropic analisa as candidaturas individualmente e não divulgou a dimensão do grupo inscrito. Os números agentivos do Fable 5.1, particularmente no Terminal-Bench-Science, colocam os resultados publicados da Anthropic à frente dos valores mais recentemente divulgados pela OpenAI em avaliações comparáveis. As comparações de benchmark entre empresas acarretam cautela metodológica — os fornecedores selecionam avaliações que favorecem os seus modelos, e os testes específicos que a Anthropic destacou foram presumivelmente escolhidos pelos seus resultados favoráveis. O que é mais difícil de explicar é o padrão interno de duplicação: o Fable 5.1 não é o mesmo modelo com uma redução de preço associada. A alteração de desempenho é suficientemente grande para que a história do preço e a história do desempenho não possam ser separadas. Para os programadores que não utilizam atualmente o Claude, a alteração no preço da cache é o número que vale a pena traduzir para a sua própria economia de tokens. Qualquer fornecedor de IA que não se aproxime dos $0,25 por milhão de tokens em cache enfrentará agora questões diretas de comparação de custos nas conversas de vendas empresariais. O preço de cache da Anthropic já era inferior ao de vários concorrentes antes desta redução; o fosso aumentou. As melhorias de desempenho são mais difíceis de generalizar entre casos de uso, mas no segmento agentivo e de raciocínio científico, o Fable 5.1 estabelece um nível de referência contra o qual será medida a próxima grande versão de qualquer fornecedor.

(0)Comments

 

A note on cookies

Newshunt uses essential cookies to keep you signed in and to remember your language and country, so the site works the way you expect. With your permission, we'd also like to use analytics cookies to understand how people use Newshunt and improve it over time.

Accepting only affects analytics. To learn more, view our Privacy Policy or Terms & Conditions.