Fable 5.1 da Anthropic corta custos de cache em 75% e mais que dobra pontuações agênticas

Fable 5.1 da Anthropic corta custos de cache em 75% e mais que dobra pontuações agênticas
View on original source
Category: SciTech
Share
Archive
Like
Anthropic atualizou o Claude em 1° de setembro com o Fable 5.1, reduzindo o custo de tokens de entrada em cache de US$ 1,00 para US$ 0,25 por milhão — uma redução de 75% que chega no momento em que a maioria dos desenvolvedores de IA em produção descobriu que o acúmulo de contexto, e não o poder computacional bruto, é onde seus orçamentos de infraestrutura realmente se concentram. Em uma sessão agentiva ao vivo, uma única conversa do Claude pode conter centenas de milhares de tokens em cache à medida que o contexto se acumula ao longo das interações. A US$ 0,25 por milhão, esse acúmulo se torna uma escolha deliberada de design, em vez de um teto de custo que o desenvolvedor precisa contornar. Os resultados de benchmark que acompanham a mudança de preço mostram ganhos de desempenho que reforçam o caso econômico. No Terminal-Bench-Science 0.1, que mede raciocínio científico em múltiplas etapas exigindo design experimental e análise iterativa, o Fable 5.1 obteve 52,6% contra 24,7% do Fable 5 — mais que dobrando o resultado anterior. O AutomationBench melhorou de 17,1% para 31,4%, e o Terminal-Bench 4.0, uma avaliação mais ampla de capacidade agentiva, subiu de 42,0% para 55,8%. O CursorBench 3.2.0 ficou em 73,4%. O padrão em todas as quatro avaliações é consistente: o Fable 5.1 não é incrementalmente melhor na margem — é substancialmente mais confiável nas categorias de tarefas que definem o valor agentivo. O efeito combinado reescreve a aritmética de custos de construir com o Claude. Uma aplicação agentiva que conclui uma tarefa em menos interações — porque o modelo é mais confiável — consome menos ciclos totais de tokens no caminho para um resultado bem-sucedido. Aplique o corte de 75% no cache aos tokens que ela usa, e a redução efetiva de custo por tarefa em fluxos de trabalho agentivos com alta reutilização chega a 45% ou mais. A Anthropic não publicou um único número principal para a economia composta, mas desenvolvedores que modelarem sua própria economia de tokens chegarão a valores nessa faixa para cargas de trabalho pesadas em contexto. O Fable 5.1 está disponível imediatamente através da API direta da Anthropic sob o identificador de modelo claude-fable-5-1, e através do Amazon Web Services Bedrock, Google Cloud Platform e Microsoft Azure. A Anthropic anunciou o Enterprise Frontier Safeguards como uma capacidade simultânea: retenção de dados controlada pelo cliente, chaves de criptografia gerenciadas pelo cliente e implantação dentro do tenant de infraestrutura em nuvem existente de cada cliente, incluídas sem custo adicional além dos custos de nuvem subjacentes. Junto com o lançamento geral, a Anthropic introduziu o Mythos 5.1, uma variante do mesmo modelo subjacente operando com o que a empresa descreve como salvaguardas mais permissivas para organizações verificadas. O acesso é restrito a instituições de pesquisa em cibersegurança e empresas de ciências da vida verificadas. A empresa citou aplicações demonstradas incluindo design de ligantes de proteínas e otimização de modelos biológicos com até 2,5 vezes a taxa de inferência da versão padrão. O acesso ao Mythos 5.1 não é autoatendido: a Anthropic analisa as inscrições individualmente e não publicou o tamanho do grupo inscrito. Os números agentivos do Fable 5.1, particularmente no Terminal-Bench-Science, colocam os resultados publicados da Anthropic à frente dos números mais recentemente divulgados pela OpenAI em avaliações comparáveis. Comparações de benchmark entre empresas trazem ressalvas metodológicas — fornecedores selecionam avaliações que favorecem seus modelos, e os testes específicos que a Anthropic destacou foram presumivelmente escolhidos por seus resultados favoráveis. O que é mais difícil de explicar é o padrão de duplicação interna: o Fable 5.1 não é o mesmo modelo com um desconto de preço anexado. A mudança de desempenho é grande o suficiente para que a história do preço e a história do desempenho não possam ser separadas. Para desenvolvedores que atualmente não usam o Claude, a mudança no preço do cache é o número que vale a pena traduzir para sua própria economia de tokens. Qualquer provedor de IA que não se aproxime de US$ 0,25 por milhão de tokens em cache agora enfrentará perguntas diretas de comparação de custos em conversas de vendas empresariais. O preço de cache da Anthropic já era mais baixo que o de vários concorrentes antes dessa redução; a diferença aumentou. Melhorias de desempenho são mais difíceis de generalizar entre casos de uso, mas no segmento agentivo e de raciocínio científico, o Fable 5.1 estabelece um nível de referência contra o qual o próximo grande lançamento de qualquer provedor será medido.

(0)Comments

 

A note on cookies

Newshunt uses essential cookies to keep you signed in and to remember your language and country, so the site works the way you expect. With your permission, we'd also like to use analytics cookies to understand how people use Newshunt and improve it over time.

Accepting only affects analytics. To learn more, view our Privacy Policy or Terms & Conditions.