Tecnologia

Uma equipa de 10 pessoas na Microsoft construiu um modelo de voz mais barato e rápido do que OpenAI e Google

Adrian Kessler

O modelo chama-se MAI-Transcribe-2. A Microsoft AI, a divisão liderada por Mustafa Suleyman, lançou-o a 3 de setembro a $0,10 por hora de áudio — limitado até ao final de 2026. A versão anterior, MAI-Transcribe-1.5, custava $0,36 por hora. Essa redução de 72% no preço não é um arredondamento de marketing. Um centro de contactos que processa 100.000 horas de áudio por ano pagava $36.000 pelo modelo anterior; a mesma carga de trabalho custa agora $10.000.

O desempenho nos benchmarks é o que torna o preço invulgar. Na avaliação multilingue FLEURS, o MAI-Transcribe-2 ocupa o primeiro lugar em 60 línguas com uma taxa média de erro de palavras de 5,2% — melhor do que o GPT-Transcribe da OpenAI, o Gemini 3.5 Transcribe da Google, o ElevenLabs Scribe v2 e o Whisper V3-Large da Meta. No ranking Artificial Analysis, que monitoriza simultaneamente precisão e latência, fica em segundo lugar global e define o que os investigadores chamam de fronteira de Pareto — o limite além do qual não se pode melhorar uma métrica sem degradar a outra. O modelo foi treinado para se situar na borda eficiente dessa fronteira, e não para perseguir o topo de qualquer tabela de métrica única.

A velocidade é a segunda alegação que vale a pena examinar. A Microsoft afirma que o MAI-Transcribe-2 processa áudio 10 vezes mais rápido que o GPT-Transcribe, 7 vezes mais rápido que o ElevenLabs Scribe v2 e 5 vezes mais rápido que o Gemini 3.5 Transcribe. Para áudio de formato longo — transcrição de podcasts, depoimentos legais, notas clínicas — essa diferença determina se um fluxo de trabalho decorre em segundos ou minutos. O modelo também faz diarização de oradores (identificar quem falou quando), carimbos temporais ao nível da palavra, enviesamento de palavras-chave para terminologia de domínio e suporte para code-switching em línguas que misturam a meio da frase, citando especificamente Hinglish e Spanglish como exemplos testados.

A equipa que o construiu é notável na proporção do que construiu. A Microsoft descreve o grupo central como 10 pessoas, a operar com burocracia interna mínima e apoiado por equipas maiores que tratam da aquisição de dados e gestão de fornecedores. A alegação de eficiência de GPU resultante é específica: o MAI-Transcribe-2 funciona com metade do custo de GPU dos modelos concorrentes de última geração. Se isso se mantém sob carga empresarial à escala não é verificável a partir do anúncio, mas a alegação de arquitetura é suficientemente precisa para ser testada.

O modelo está disponível agora no Microsoft Foundry, no MAI Playground e no Open Router — o que significa que o acesso não requer um contrato Azure ou uma relação empresarial com a Microsoft. Essa amplitude de distribuição é deliberada. O impulso da Microsoft AI para APIs diretas ao programador faz parte de um reposicionamento mais amplo após a reestruturação da parceria com a OpenAI. Alterações em outubro de 2025 e abril de 2026 eliminaram os acordos de exclusividade e partilha de receitas que definiam a relação desde 2019. A Microsoft tem agora um incentivo direto para competir ao nível do modelo, em vez de apenas distribuir o resultado da OpenAI.

O preço de $0,10 está marcado como limitado até ao final de 2026. O preço padrão após essa data não foi divulgado. Os compradores que avaliam o MAI-Transcribe-2 para cargas de trabalho de produção estão a precificar um produto cujo custo desconhecem para o ano civil de 2027. Esse é um risco que vale a pena nomear claramente, mesmo que a taxa atual torne o modelo atraente face a todas as alternativas visíveis.

Etiquetas: , , , , ,

Discussão

Existem 0 comentários.