Tecnologia

Gemini 3.8 Live substitui o rosto em branco no atendimento de IA

Adrian Kessler
Adicione-nos no Google

O sistema é o Gemini 3.8 Live com Live Avatar. Combina o modelo de conversão de voz em voz da Google com uma camada de vídeo em tempo real, que gera movimentos labiais e expressões faciais, enquanto executa chamadas a ferramentas em segundo plano sem interromper a conversa. A deteção do idioma é automática — o avatar muda de idioma falado a meio da chamada sem transferência, recarregamento do sistema ou pausa percetível.

O que distingue esta solução das técnicas de sobreposição de vídeo é o facto de a geração de áudio e vídeo decorrer no mesmo processo de inferência em tempo real, em vez de ser feita em etapas sequenciais. Esta integração mantém a latência suficientemente baixa para permitir um ritmo de conversa natural. A Google incorpora discretamente a marca de água SynthID tanto na saída de áudio como na de vídeo — cada segundo inclui uma etiqueta legível por máquina que identifica o conteúdo como gerado por IA, mesmo que a transmissão seja gravada e reproduzida mais tarde. A marca de água resiste à recodificação, pelo que continua a ser possível verificar a proveniência dos excertos exportados.

A Equal AI, que gere implementações empresariais em toda a Índia, dá a indicação mais clara daquilo que esta tecnologia permite à escala operacional: nove línguas indianas ativas em simultâneo, mais de um milhão de chamadas em direto por dia e um total de 97 idiomas suportados. Alcançar esse volume seria economicamente impraticável com agentes humanos com disponibilidade e cobertura de horários equivalentes. A premissa por detrás da implementação não é uma prova de conceito — é a capacidade de processamento.

O que o lançamento não revela é o preço. A Google não publicou os custos e encaminha os pedidos de informação para a sua equipa de vendas empresariais. A criação de avatares personalizados — em que as organizações constroem um rosto a partir das suas próprias imagens de referência — exige aprovação prévia para utilização empresarial através de um processo de verificação separado, não estando disponível em regime de autoatendimento. As capacidades Extended Thinking do modelo Live continuam em pré-visualização privada, limitando a profundidade de raciocínio em comparação com outras ofertas Gemini da Google. Os limites de sessões simultâneas não foram divulgados. O perfil restrito do lançamento está de acordo com a prática da Google de disponibilizar gradualmente produtos empresariais, negociando os preços e a capacidade em vez de os publicar.

O Gemini 3.8 Live com Live Avatar está disponível desde já na consola Gemini Enterprise e através da Live API, com pontos de acesso nos Estados Unidos e na União Europeia. Não foi divulgado qualquer calendário para um acesso mais alargado às funcionalidades Extended Thinking do modelo Live, para além do atual grupo com acesso à pré-visualização privada.

Serão as empresas que o implementarem a responder a uma pergunta que a tecnologia não esclarece: eliminar o sinal visual que identifica uma interação automatizada melhora a experiência dos utilizadores ou retira o último indicador honesto de que está a acontecer?

Etiquetas: , , , , ,

Adicione-nos no Google

Discussão

Existem 0 comentários.