Tecnologia

Fable 5.1 da Anthropic reduz custos de cache em 75% e mais do que duplica pontuações agênticas

Susan Hill

Anthropic atualizou o Claude a 1 de setembro com o Fable 5.1, reduzindo o custo dos tokens de entrada em cache de $1,00 para $0,25 por milhão — uma redução de 75% que chega no momento em que a maioria dos programadores de IA em produção descobriu que a acumulação de contexto, e não a computação bruta, é onde os seus orçamentos de infraestrutura realmente se concentram. Numa sessão agentiva em tempo real, uma única conversa do Claude pode conter centenas de milhares de tokens em cache à medida que o contexto se acumula ao longo das interações. A $0,25 por milhão, essa acumulação torna-se uma escolha de design deliberada, em vez de um teto de custo que o programador contorna.

Os resultados de benchmark que acompanham a alteração de preço mostram ganhos de desempenho que reforçam o caso económico. No Terminal-Bench-Science 0.1, que mede o raciocínio científico em múltiplos passos exigindo conceção experimental e análise iterativa, o Fable 5.1 obteve 52,6% contra os 24,7% do Fable 5 — mais do que duplicando o resultado anterior. O AutomationBench melhorou de 17,1% para 31,4%, e o Terminal-Bench 4.0, uma avaliação mais ampla de capacidades agentivas, subiu de 42,0% para 55,8%. O CursorBench 3.2.0 registou 73,4%. O padrão em todas as quatro avaliações é consistente: o Fable 5.1 não é incrementalmente melhor na margem — é substancialmente mais fiável nas categorias de tarefas que definem o valor agentivo.

O efeito combinado reescreve a aritmética de custos de construir com Claude. Uma aplicação agentiva que completa uma tarefa em menos interações — porque o modelo é mais fiável — consome menos ciclos totais de tokens no caminho para um resultado bem-sucedido. Aplique o corte de 75% na cache aos tokens que efetivamente utiliza, e a redução efetiva de custo por tarefa em fluxos de trabalho agentivos com elevada reutilização atinge os 45% ou mais. A Anthropic não publicou um único número de destaque para as poupanças compostas, mas os programadores que modelam a sua própria economia de tokens chegarão a valores nessa ordem para cargas de trabalho com uso intensivo de contexto.

O Fable 5.1 está disponível imediatamente através da API direta da Anthropic sob o identificador de modelo claude-fable-5-1, e através do Amazon Web Services Bedrock, Google Cloud Platform e Microsoft Azure. A Anthropic anunciou o Enterprise Frontier Safeguards como uma capacidade concorrente: retenção de dados controlada pelo cliente, chaves de encriptação geridas pelo cliente e implantação dentro do inquilino de infraestrutura cloud existente de cada cliente, incluído sem custos adicionais para além dos custos de cloud subjacentes.

Juntamente com o lançamento geral, a Anthropic introduziu o Mythos 5.1, uma variante do mesmo modelo subjacente que opera com o que a empresa descreve como salvaguardas mais permissivas para organizações verificadas. O acesso é restrito a instituições de investigação em cibersegurança e empresas de ciências da vida verificadas. A empresa citou aplicações demonstradas, incluindo a conceção de ligantes proteicos e a otimização de modelos biológicos com um rendimento de inferência até 2,5 vezes superior ao da versão standard. O acesso ao Mythos 5.1 não é self-service: a Anthropic analisa as candidaturas individualmente e não divulgou a dimensão do grupo inscrito.

Os números agentivos do Fable 5.1, particularmente no Terminal-Bench-Science, colocam os resultados publicados da Anthropic à frente dos valores mais recentemente divulgados pela OpenAI em avaliações comparáveis. As comparações de benchmark entre empresas acarretam cautela metodológica — os fornecedores selecionam avaliações que favorecem os seus modelos, e os testes específicos que a Anthropic destacou foram presumivelmente escolhidos pelos seus resultados favoráveis. O que é mais difícil de explicar é o padrão interno de duplicação: o Fable 5.1 não é o mesmo modelo com uma redução de preço associada. A alteração de desempenho é suficientemente grande para que a história do preço e a história do desempenho não possam ser separadas.

Para os programadores que não utilizam atualmente o Claude, a alteração no preço da cache é o número que vale a pena traduzir para a sua própria economia de tokens. Qualquer fornecedor de IA que não se aproxime dos $0,25 por milhão de tokens em cache enfrentará agora questões diretas de comparação de custos nas conversas de vendas empresariais. O preço de cache da Anthropic já era inferior ao de vários concorrentes antes desta redução; o fosso aumentou. As melhorias de desempenho são mais difíceis de generalizar entre casos de uso, mas no segmento agentivo e de raciocínio científico, o Fable 5.1 estabelece um nível de referência contra o qual será medida a próxima grande versão de qualquer fornecedor.

Etiquetas: , , , ,

Discussão

Existem 0 comentários.