Tecnologia

A IA de voz da OpenAI já não espera pela sua vez — custa $0,05 por minuto

Susan Hill

Todas as IAs de voz no mercado atualmente dizem-lhe para esperar antes de falar. A GPT-Live-1 da OpenAI não. O modelo, disponível através da API da OpenAI, ouve e fala simultaneamente — lidando com interrupções, pausas e sobreposição de fala como uma pessoa faria numa chamada.

O preço é de 0,05 dólares por minuto para a camada de voz — 1,50 dólares por uma conversa de 30 minutos, ou 50 dólares por cada 1.000 minutos de conversação. Os programadores pagam separadamente por um backend de raciocínio: a própria GPT-6 Astra da OpenAI ou qualquer modelo compatível que trate de chamadas a ferramentas e lógica de negócio. A camada de voz gere a mecânica da conversa; a camada de raciocínio decide o que a IA realmente diz e faz.

O que essa separação significa na prática: um bot de apoio ao cliente pode ouvir «espere, afinal quero a outra opção» a meio da frase e responder a isso, em vez de continuar com uma resposta preparada. Um tutor de línguas pode detetar um aluno a tropeçar numa palavra sem esperar que ele termine. Um sistema de reservas pode lidar com o tipo de chamada real onde as pessoas se repetem, mudam de ideias e falam umas por cima das outras.

No Full Duplex Bench — a avaliação concebida especificamente para testar o manuseamento de voz em direções simultâneas — a GPT-Live-1 obtém uma pontuação 30 pontos percentuais acima da sua antecessora, a GPT-Realtime-2.1. Quando emparelhada com a GPT-6 Astra como backend de raciocínio, supera o Tau3, o benchmark de apoio ao cliente que testa consultas complexas e de múltiplos passos sem pausas na conversa.

A arquitetura de duas camadas reflete uma escolha de design deliberada. O timing da fala e o raciocínio são faturados separadamente porque escalam de forma diferente: uma startup a construir uma aplicação de tutoria ligeira paga menos em ambas as camadas do que uma empresa a gerir milhares de chamadas de apoio ao cliente simultâneas na GPT-6 Astra. O preço mínimo é de 0,05 dólares por minuto para a voz, independentemente do que funciona por trás.

O que a GPT-Live-1 não altera é a qualidade das respostas. A camada de voz trata de quando e como a IA fala — não do que ela sabe. Uma resposta errada mas bem sincronizada continua a ser uma resposta errada. Os programadores que constroem aplicações de apoio ao cliente precisarão de avaliar ambas as camadas separadamente, e o backend de raciocínio pode acrescentar mais à fatura do que a própria camada de voz. A OpenAI também não publicou dados sobre como a arquitetura full-duplex se comporta em ambientes de baixa largura de banda ou em linhas telefónicas ruidosas, onde a entrada de áudio contínua é mais difícil de sustentar.

A GPT-Live-1 já está disponível na API da OpenAI. A empresa não anunciou um produto direto ao consumidor construído sobre o modelo, embora tenha indicado que futuras versões do modo de voz do ChatGPT poderão basear-se na mesma arquitetura subjacente. A taxa de 0,05 dólares por minuto aplica-se no lançamento; a OpenAI não publicou um calendário para alterações de preços nem uma lista de modelos de raciocínio de terceiros aprovados para uso com a camada de voz.

Etiquetas: , , , , ,

Discussão

Existem 0 comentários.