Tecnologia

O chip Jalapeño da OpenAI realiza inferencia com eficiencia 1,9 vezes superior a Nvidia Blackwell por watt

Adrian Kessler

A OpenAI criou o seu próprio chip. A empresa apresentou o Jalapeño na conferência Hot Chips a 25 de agosto, um design de silício desenvolvido em parceria com a Broadcom que processa pedidos de inferência a 85 448 tokens por segundo por quilowatt. A arquitetura Blackwell da Nvidia, o atual padrão de mercado, atinge 44 960 na mesma métrica. A proporção é de 1,9 vezes.

Esta métrica é importante porque a inferência é como os sistemas de IA funcionam em produção. O treino acontece uma vez; a inferência acontece sempre que alguém envia uma consulta ao ChatGPT, usa uma API ou interage com qualquer aplicação que execute um modelo de linguagem. O custo da inferência à escala é o principal motor da economia dos serviços de IA. Um chip que reduza o consumo de energia da inferência para cerca de metade, se for amplamente implementado, altera o custo por consulta da execução de modelos.

Em cargas de trabalho interativas, onde a latência de resposta é o factor limitante, a vantagem do Jalapeño estende-se ainda mais. O relatório da SemiAnalysis sobre a apresentação na Hot Chips situou o intervalo entre 2,1 a 4,1 vezes melhor que a Blackwell nesses benchmarks. A disperção reflete a variação entre tipos específicos de tarefas; o limite inferior é a comparação mais conservadora.

O chip lida apenas com inferência. Não executa as cargas de treino que produziram os modelos que o Jalapeño foi concebido para executar. Essas ainda requerem hardware da Nvidia. A Broadcom fabricou o chip ao abrigo de um acordo de design personalizado com a OpenAI, em vez de o vender como produto comercial. O acordo dá à OpenAI uma camada de inferência construída de propósito, sem exigir que concorra no mercado de chips comercias.

O cronograma de implementação da OpenAI é limitado. A implementação em pequena escala está prevista para antes do final de 2026; a implementação mais alargada é um objetivo para 2027. O chip ainda se encontra na fase de amostra de engenharia, o que significa que a versão de produção ainda não foi enviada à escala. Os benchmarks na Hot Chips representam o alvo de design, não uma execução de produção verificada. O intervalo entre o anúncio na conferência e a implementação opracional de silício personalizado é tipicamente medido em anos.

O anúncio insere-se numa mudança mais ampla entre as granes empresas de IA em direção ao silício personalizado. A Googe opera as suas prórias Unidades de Procesamento Tenor (TPU) em produção há uma dácada. A Amzon executa Trainium e Inerenti na AWS. A Mta opera os seus prórios chips de inferência internamente. A entada da OpenAI confirma que, à escala de centenas de milões de uziladores ativos, a économia de depender inteiramente de fornecedores externos de GPU se torna suficientemente difícil para justificar o custo de um programa de design personalizado.

Etiquetas: , , , , ,

Discussão

Existem 0 comentários.