O Google anunciou dois novos modelos de inteligência artificial voltados para interações por voz em tempo real: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. As tecnologias permitem que a IA continue conversando enquanto executa tarefas em segundo plano e serão integradas a serviços como Gmail, Docs, Keep e Search Live.
Apresentados nesta terça-feira (15), os modelos foram desenvolvidos para ampliar a capacidade do Gemini em conversas por voz e na execução de tarefas que exigem diferentes etapas de processamento.
A principal diferença está no nível de raciocínio. O Gemini 3.8 Live é direcionado a interações em tempo real com maior escala e eficiência, enquanto o Gemini 3.8 Live Extended Thinking acrescenta recursos para tarefas mais complexas.
Um dos principais avanços é a possibilidade de executar ferramentas e chamadas de API em segundo plano sem interromper a interação com o usuário.
Leia mais:
- Receita Federal abre prazo para cooperativas aderirem a regime específico de IBS e CBS
- ChatGPT fatura US$ 1 bilhão com publicidade em 200 dias, mas fica abaixo da meta da OpenAI
- Google lança Gemini 3.8 Live com IA capaz de raciocinar enquanto conversa por voz
- Google mantém proibição de anúncios políticos no Brasil para as eleições de 2026
- TSE abre consulta pública para definir novo modelo de urnas eletrônicas para 2028
Gemini pode executar tarefas enquanto mantém a conversa
Com o Gemini 3.8 Live, um usuário pode solicitar determinada ação e continuar conversando enquanto o sistema trabalha para concluir o pedido.
Isso significa que a interação não precisa necessariamente ser interrompida durante a utilização de ferramentas externas ou o processamento de informações.
O modelo também consegue interpretar informações visuais provenientes de câmeras e outras fontes praticamente em tempo real, incorporando esses elementos ao contexto da conversa.
Outro recurso anunciado é a identificação e alternância automática entre 97 idiomas durante uma mesma interação.
Segundo o Google, o Gemini 3.8 Live alcançou a segunda colocação nas avaliações realizadas por usuários no Speech Agent Arena, benchmark voltado à comparação de sistemas de interação por voz.
A empresa posiciona essa versão principalmente para desenvolvedores e organizações que precisam combinar capacidade de processamento, conversação em tempo real e eficiência de custos.

Extended Thinking combina fala e raciocínio avançado
O Gemini 3.8 Live Extended Thinking acrescenta uma camada de raciocínio destinada a tarefas que exigem processamento em várias etapas.
Uma das características apresentadas pelo Google é a capacidade de raciocinar e falar simultaneamente.
Em vez de permanecer em silêncio enquanto processa uma solicitação mais complexa, o modelo pode manter a interação, informar que está trabalhando na tarefa e apresentar atualizações durante a execução.
A proposta busca tornar mais natural a utilização de assistentes de voz em atividades que não podem ser resolvidas imediatamente.
O recurso também permite que o sistema explique o andamento de determinadas tarefas enquanto diferentes etapas são processadas.
Novos recursos chegam ao Gmail, Docs e Keep
As capacidades dos novos modelos também serão incorporadas aos produtos do Google.
No Workspace, o Gemini 3.8 Live Extended Thinking será utilizado em experiências de voz no Google Docs, Gmail e Keep.
No Docs, o Docs Live permitirá executar tarefas relacionadas ao documento utilizando comandos de voz. A mesma proposta será aplicada ao Gmail Live e ao Keep Live.
O modelo também será integrado ao Search Live, recurso que combina interação por voz com orientações e instruções em tempo real.
A expansão aproxima os modelos de voz das atividades cotidianas realizadas dentro do ecossistema do Google, permitindo que o usuário converse com a IA enquanto ela consulta informações ou executa determinadas ações.
Google divulga resultados de testes dos novos modelos
O Google também apresentou resultados de benchmarks utilizados para avaliar a capacidade do Gemini 3.8 Live Extended Thinking.
No Speech to Speech Quality Index, da Artificial Analysis, o modelo alcançou 82,6 pontos, ficando na primeira posição geral da avaliação citada pela empresa.
Já no τ-Voice, benchmark destinado a medir a capacidade de agentes de voz executarem tarefas, o resultado informado foi de 68,6%.
No τ-Voice-banking, voltado especificamente para tarefas relacionadas ao setor financeiro, o Gemini registrou 35,1%.
Os benchmarks medem aspectos específicos do desempenho dos modelos e não representam, isoladamente, o comportamento da tecnologia em todas as situações de uso.
Modelos começam a chegar a desenvolvedores e usuários
O Gemini 3.8 Live começou a ser disponibilizado para desenvolvedores por meio da Gemini API e do Google AI Studio. Empresas também poderão acessar o modelo em uma prévia privada do Gemini Enterprise.
Para usuários finais, parte das novas capacidades será disponibilizada por meio do Search Live.
O Gemini 3.8 Live Extended Thinking também começou a chegar à Gemini API e ao Google AI Studio, além de estar disponível em prévia privada para clientes do Gemini Enterprise.
No Workspace, a disponibilidade dependerá do serviço e do plano contratado. O Docs Live está previsto para assinantes Google AI Pro e Google AI Ultra, enquanto Gmail Live e Keep Live chegam aos planos Google AI Plus, Google AI Pro e Google AI Ultra.
Com os novos modelos, o Google amplia a estratégia de transformar a interação por voz em uma interface capaz não apenas de responder perguntas, mas também de acompanhar conversas enquanto processa informações e executa tarefas em outros serviços.
Foto: ChatGPT

