OpenAI lança API de voz que escuta, raciocina e traduz 70 idiomas em tempo real
Novos modelos GPT-Realtime-2, Translate e Whisper levam raciocínio em tempo real, tradução simultânea e transcrição contínua para aplicativos de voz. Empresas como Zillow, Priceline e Vimeo já testam a tecnologia.

A OpenAI colocou no ar três novos modelos de áudio em sua API Realtime, e o que eles entregam vai muito além do que assistentes como Siri e Alexa conseguem fazer hoje. O GPT-Realtime-2, o GPT-Realtime-Translate e o GPT-Realtime-Whisper formam um trio que cobre raciocínio falado, tradução ao vivo entre mais de 70 idiomas e transcrição em fluxo contínuo. A diferença para o que existia antes é que esses modelos não apenas respondem: eles ouvem, processam, agem e mantêm o fio da conversa.
O GPT-Realtime-2 é o carro-chefe. Ele traz capacidade de raciocínio equivalente ao GPT-5 para interações de voz ao vivo. Isso significa que o modelo consegue lidar com perguntas complexas sem perder o contexto do que estava sendo dito antes. Ele chama múltiplas ferramentas ao mesmo tempo e narra o que está fazendo, com frases como “verificando sua agenda” ou “deixe-me pesquisar isso”. O modelo tem janela de contexto de 128 mil tokens, o que permite sessões longas e coerentes, e o desenvolvedor pode ajustar o esforço de raciocínio conforme a complexidade da tarefa.
GPT-Realtime-Translate: um tradutor universal em tempo real
O GPT-Realtime-Translate é o que mais se aproxima do tradutor universal da ficção científica. Ele traduz fala ao vivo de mais de 70 idiomas de entrada para 13 idiomas de saída, mantendo a conversa fluindo mesmo quando dois interlocutores falam línguas diferentes. Em demonstração, o modelo acompanhou sem problemas a entrada de uma terceira pessoa falando um idioma distinto e verteu ambas as vozes para o inglês simultaneamente.
O GPT-Realtime-Whisper resolve um gargalo antigo dos modelos de fala para texto. Em vez de esperar o interlocutor terminar de falar para entregar a transcrição completa, ele converte a fala em texto conforme as palavras são pronunciadas. O recurso é útil para legendas ao vivo, anotações de reuniões e qualquer fluxo de trabalho por voz em que esperar pela transcrição não seja uma opção.
Quanto vai custar o novo serviço da OpenIA?
Os modelos estão disponíveis para desenvolvedores, e os aplicativos que eles criarem chegarão aos usuários finais em seguida. Empresas já estão testando a API Realtime em cenários práticos. A Zillow está construindo um assistente de voz que pesquisa imóveis e agenda visitas com um único comando falado. A Priceline permite consultar voos e hotéis, cancelar e reservar novos. O Vimeo usa o Whisper para transcrição em tempo real.
Os preços partem de US$ 0,017 por minuto para o Whisper, US$ 0,017 por minuto para o Whisper, US$ 0,034 por minuto para o Translate e US$ 32 por 1 milhão de tokens de áudio de entrada para o GPT-Realtime-2. O trio de modelos coloca a OpenAI em posição de competir diretamente com as assistentes de voz da Apple e da Amazon, mas com uma diferença fundamental: em vez de comandos isolados, a nova API Realtime entrega conversas contínuas, com raciocínio, ferramentas e compreensão do que está sendo dito ao longo do tempo.




