Tecnologia

ElevenLabs v4 clona a sua voz com 10 segundos de áudio e põe-na a falar 90 línguas

Susan Hill
Adicione-nos no Google

A ElevenLabs lançou o Eleven v4, um modelo de conversão de texto em fala que lê textos em voz alta com uma gargalhada, um suspiro ou um sotaque francês zangado, sempre que o autor o pedir. A clonagem instantânea de voz precisa de uma gravação mais curta do que uma mensagem de voz, e a voz clonada pode depois falar dezenas de idiomas sem perder o seu timbre. Qualquer pessoa com uma conta gratuita na ElevenLabs pode utilizá-lo.

Para quem cria conteúdos sonoros, isto elimina dias inteiros de trabalho. Um podcaster pode dobrar um episódio para japonês com a própria voz, um programador de jogos independentes pode dar uma forma de falar distinta a cada personagem secundária sem ter de reservar um estúdio, e um narrador de audiolivros pode inserir uma pausa ou uma risada diretamente no guião. O reverso da medalha é igualmente concreto: uma mensagem de voz, um excerto de uma videochamada ou alguns segundos de uma publicação pública são agora matéria-prima suficiente para criar uma cópia convincente de alguém.

A principal novidade é o controlo, e a clonagem em si demora apenas 10 segundos de áudio. Os modelos anteriores da ElevenLabs liam o texto com clareza, mas tinham de adivinhar o tom. A versão 4 aceita indicações cénicas inseridas no texto entre parênteses retos, como [laughs] ou [said angrily in French accent], e até indicações de ambiente, como [light rain] ou [phone buzzing]. A empresa afirma que o modelo também capta o tom e o ritmo a partir do contexto envolvente, pelo que uma fala numa cena tensa soa tensa mesmo sem qualquer indicação. Em cenas com vários interlocutores, cada voz mantém-se consistente ao longo de passagens extensas — um ponto fraco da narração sintética, em que as vozes tendiam a alterar-se ao longo de um capítulo.

A cobertura linguística passa de 70 idiomas na versão anterior para mais de 90, e a ElevenLabs destacou o japonês, o português do Brasil, o mandarim e o cantonês como os idiomas em que a qualidade mais melhorou, segundo a TechCrunch. Uma voz clonada mantém a sua identidade quando muda de idioma, pelo que a cópia da voz de um falante de espanhol continua a soar a essa pessoa quando lê em alemão, mas com um sotaque alemão nativo. Um segundo modelo, o v4 Turbo, foi concebido para assistentes de voz e agentes de centros de atendimento. Começa a falar em cerca de 150 milissegundos — aproximadamente o intervalo entre duas pessoas que conversam à vez — e pode começar a falar antes de o chatbot que lhe está subjacente ter terminado de escrever a resposta.

A ElevenLabs não está sozinha neste mercado. Google, OpenAI, Cartesia, Deepgram e Fish Audio vendem vozes sintéticas aos mesmos programadores. Poucas horas depois do lançamento, a empresa independente de avaliação comparativa Artificial Analysis colocou o v4 no primeiro lugar do seu ranking de vozes, no qual os ouvintes classificam amostras anónimas lado a lado. A ElevenLabs afirma também que cerca de três em cada quatro ouvintes preferiram o v4 em comparações cegas com os concorrentes, um valor baseado nos seus próprios testes.

As ressalvas começam logo nos 10 segundos. A ElevenLabs afirma que a clonagem exige o consentimento da pessoa cuja voz é carregada, que utiliza um classificador público capaz de assinalar áudio criado com as suas ferramentas e que bloqueia, sem exceção, a clonagem de algumas figuras políticas. Estas verificações travam utilizações indevidas casuais, mas dependem de o utilizador dizer a verdade; para montar uma falsa chamada de emergência, um burlão só precisa de uma amostra curta da voz de um familiar. O plano gratuito também é limitado: cerca de 10 minutos de áudio gerado por mês, segundo a análise dos planos feita pela Unite.AI, com os planos pagos a começar nos 6 dólares mensais.

O Eleven v4 e o v4 Turbo ficaram disponíveis a 28 de setembro na aplicação para criadores da ElevenLabs, na sua plataforma de agentes e na API para programadores. A empresa, com sede em Londres, angariou 500 milhões de dólares da Sequoia em fevereiro, com uma avaliação de 11 mil milhões de dólares, e a TechCrunch noticia que as suas receitas anualizadas ultrapassaram os 600 milhões de dólares. O diretor executivo, Mati Staniszewski, disse à TechCrunch que a empresa pretende entrar em bolsa nos próximos anos, sem se comprometer com uma data.

Para os criadores, uma voz que se ri quando lhe pedem, em 90 idiomas, é um estúdio de gravação numa janela do navegador. Para todos os outros, é mais uma razão para desligar e voltar a ligar quando uma voz familiar ao telefone pede dinheiro.

Etiquetas: , , , , ,

Adicione-nos no Google

Discussão

Existem 0 comentários.