IA

OpenAI lança API de voz que escuta, raciocina e traduz 70 idiomas em tempo real

Novos modelos GPT-Realtime-2, Translate e Whisper levam raciocínio em tempo real, tradução simultânea e transcrição contínua para aplicativos de voz. Empresas como Zillow, Priceline e Vimeo já testam a tecnologia.

A OpenAI colocou no ar três novos modelos de áudio em sua API Realtime, e o que eles entregam vai muito além do que assistentes como Siri e Alexa conseguem fazer hoje. O GPT-Realtime-2, o GPT-Realtime-Translate e o GPT-Realtime-Whisper formam um trio que cobre raciocínio falado, tradução ao vivo entre mais de 70 idiomas e transcrição em fluxo contínuo. A diferença para o que existia antes é que esses modelos não apenas respondem: eles ouvem, processam, agem e mantêm o fio da conversa.

O GPT-Realtime-2 é o carro-chefe. Ele traz capacidade de raciocínio equivalente ao GPT-5 para interações de voz ao vivo. Isso significa que o modelo consegue lidar com perguntas complexas sem perder o contexto do que estava sendo dito antes. Ele chama múltiplas ferramentas ao mesmo tempo e narra o que está fazendo, com frases como “verificando sua agenda” ou “deixe-me pesquisar isso”. O modelo tem janela de contexto de 128 mil tokens, o que permite sessões longas e coerentes, e o desenvolvedor pode ajustar o esforço de raciocínio conforme a complexidade da tarefa.

GPT-Realtime-Translate: um tradutor universal em tempo real

O GPT-Realtime-Translate é o que mais se aproxima do tradutor universal da ficção científica. Ele traduz fala ao vivo de mais de 70 idiomas de entrada para 13 idiomas de saída, mantendo a conversa fluindo mesmo quando dois interlocutores falam línguas diferentes. Em demonstração, o modelo acompanhou sem problemas a entrada de uma terceira pessoa falando um idioma distinto e verteu ambas as vozes para o inglês simultaneamente.

O GPT-Realtime-Whisper resolve um gargalo antigo dos modelos de fala para texto. Em vez de esperar o interlocutor terminar de falar para entregar a transcrição completa, ele converte a fala em texto conforme as palavras são pronunciadas. O recurso é útil para legendas ao vivo, anotações de reuniões e qualquer fluxo de trabalho por voz em que esperar pela transcrição não seja uma opção.

Quanto vai custar o novo serviço da OpenIA?

Os modelos estão disponíveis para desenvolvedores, e os aplicativos que eles criarem chegarão aos usuários finais em seguida. Empresas já estão testando a API Realtime em cenários práticos. A Zillow está construindo um assistente de voz que pesquisa imóveis e agenda visitas com um único comando falado. A Priceline permite consultar voos e hotéis, cancelar e reservar novos. O Vimeo usa o Whisper para transcrição em tempo real.

Os preços partem de US$ 0,017 por minuto para o Whisper, US$ 0,017 por minuto para o Whisper, US$ 0,034 por minuto para o Translate e US$ 32 por 1 milhão de tokens de áudio de entrada para o GPT-Realtime-2. O trio de modelos coloca a OpenAI em posição de competir diretamente com as assistentes de voz da Apple e da Amazon, mas com uma diferença fundamental: em vez de comandos isolados, a nova API Realtime entrega conversas contínuas, com raciocínio, ferramentas e compreensão do que está sendo dito ao longo do tempo.

Fonte
Digital Trends

Artigos Relacionados

Deixe uma resposta

Botão Voltar ao topo

Descubra mais sobre Reset

Assine agora mesmo para continuar lendo e ter acesso ao arquivo completo.

Continuar lendo