Pular para o conteúdo principal
Aracaju, Quinta-feira, 17 de setembro de 2026
Pular para o conteúdo
Tecnologia

Google lança Gemini 3.8 Live capaz de raciocinar durante conversas por voz

Google apresenta Gemini 3.8 Live e Extended Thinking, modelos que raciocinam em diálogo por voz e executam tarefas em segundo plano.

17/09/2026 · 09h47
Google lança Gemini 3.8 Live capaz de raciocinar durante conversas por voz

O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, que conseguem raciocinar enquanto conversam com o usuário por voz e executar tarefas em segundo plano sem interromper o diálogo. O Gemini 3.8 Live já está disponível no Search Live, e os recursos do Extended Thinking chegam ao aplicativo Gemini e ao Google Workspace, com acesso de acordo com o serviço e o plano contratado.

Os modelos também já estão disponíveis para desenvolvedores pela Gemini API e pelo Google AI Studio e entram em prévia privada para empresas no Gemini Enterprise. No Google Workspace, o Docs Live está disponível para assinantes dos planos Google AI Pro e Ultra. Já os recursos Gmail Live e Keep Live chegam aos assinantes dos planos AI Plus, Pro e Ultra. Essas integrações permitem usar comandos de voz para interagir com documentos, e-mails e notas enquanto a inteligência artificial trabalha nas solicitações feitas pelo usuário.

Publicidade

A principal diferença entre os dois modelos está no tipo de tarefa para o qual cada um foi desenvolvido. O Gemini 3.8 Live prioriza interações rápidas, escala e custo-benefício, e o Gemini 3.8 Live Extended Thinking foi criado para solicitações que exigem várias etapas de processamento. Os dois contam com suporte visual em tempo real e detecção automática de idiomas, além de conseguirem alternar entre 97 idiomas durante uma mesma conversa.

Os novos modelos foram desenvolvidos para processar informações e executar ações enquanto continuam conversando com o usuário. Em vez de interromper a interação até terminar uma tarefa, o Gemini pode reconhecer uma solicitação, iniciar uma ação em segundo plano e continuar o diálogo enquanto o processo é concluído. A função pode ser usada, por exemplo, para consultar informações, criar códigos ou realizar uma reserva.

“deixe-me verificar isso para você”

Você pode se interessarConteúdo patrocinado · MGID

No Gemini 3.8 Live Extended Thinking, o sistema também utiliza frases curtas para sinalizar que está trabalhando em uma solicitação, como no exemplo acima. A proposta é evitar longos períodos de silêncio durante o processamento e manter o diálogo mais próximo de uma conversa natural. Em tarefas com várias etapas, a IA ainda pode informar o andamento do processo enquanto executa as ações necessárias.

A interação também pode combinar voz e imagem. Com o uso da câmera, o Gemini consegue interpretar o ambiente em tempo real e usar essas informações para responder ao usuário. Entre os exemplos apresentados estão o auxílio durante uma partida de xadrez e a orientação de novos funcionários durante um processo de integração.

Os modelos foram avaliados em diferentes benchmarks de voz. O Gemini 3.8 Live Extended Thinking alcançou 82,6 pontos no Speech to Speech Quality Index, com o primeiro lugar geral, e 97,7% no Big Bench Audio. O modelo ainda registrou 68,6% no τ-Voice, que mede a conclusão de tarefas por agentes de voz, e 35,1% no τ-Voice-banking, voltado a tarefas do setor financeiro. Já o Gemini 3.8 Live ficou em segundo lugar no Speech Agent Arena, que avalia a preferência dos usuários em interações com agentes de voz.

Publicidade

Para identificar conteúdos produzidos pelos modelos, os áudios gerados pelo Gemini Live recebem uma marca d’água imperceptível por meio do SynthID. A tecnologia foi desenvolvida para facilitar a detecção de conteúdo criado por inteligência artificial e aumentar a transparência sobre a origem das gravações.

Gostou? Compartilhe com quem precisa saber:

Recomendado para vocêConteúdo patrocinado · MGID
Publicidade
Mais conteúdos para vocêConteúdo patrocinado · MGID
Sugeridas pra vocêConteúdo patrocinado · MGID
Publicidade
4 min de leitura

O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, que conseguem raciocinar enquanto conversam com o usuário por voz e executar tarefas em segundo plano sem interromper o diálogo. O Gemini 3.8 Live já está disponível no Search Live, e os recursos do Extended Thinking chegam ao aplicativo Gemini e ao Google Workspace, com acesso de acordo com o serviço e o plano contratado.

Os modelos também já estão disponíveis para desenvolvedores pela Gemini API e pelo Google AI Studio e entram em prévia privada para empresas no Gemini Enterprise. No Google Workspace, o Docs Live está disponível para assinantes dos planos Google AI Pro e Ultra. Já os recursos Gmail Live e Keep Live chegam aos assinantes dos planos AI Plus, Pro e Ultra. Essas integrações permitem usar comandos de voz para interagir com documentos, e-mails e notas enquanto a inteligência artificial trabalha nas solicitações feitas pelo usuário.

A principal diferença entre os dois modelos está no tipo de tarefa para o qual cada um foi desenvolvido. O Gemini 3.8 Live prioriza interações rápidas, escala e custo-benefício, e o Gemini 3.8 Live Extended Thinking foi criado para solicitações que exigem várias etapas de processamento. Os dois contam com suporte visual em tempo real e detecção automática de idiomas, além de conseguirem alternar entre 97 idiomas durante uma mesma conversa.

Os novos modelos foram desenvolvidos para processar informações e executar ações enquanto continuam conversando com o usuário. Em vez de interromper a interação até terminar uma tarefa, o Gemini pode reconhecer uma solicitação, iniciar uma ação em segundo plano e continuar o diálogo enquanto o processo é concluído. A função pode ser usada, por exemplo, para consultar informações, criar códigos ou realizar uma reserva.

“deixe-me verificar isso para você”

No Gemini 3.8 Live Extended Thinking, o sistema também utiliza frases curtas para sinalizar que está trabalhando em uma solicitação, como no exemplo acima. A proposta é evitar longos períodos de silêncio durante o processamento e manter o diálogo mais próximo de uma conversa natural. Em tarefas com várias etapas, a IA ainda pode informar o andamento do processo enquanto executa as ações necessárias.

A interação também pode combinar voz e imagem. Com o uso da câmera, o Gemini consegue interpretar o ambiente em tempo real e usar essas informações para responder ao usuário. Entre os exemplos apresentados estão o auxílio durante uma partida de xadrez e a orientação de novos funcionários durante um processo de integração.

Os modelos foram avaliados em diferentes benchmarks de voz. O Gemini 3.8 Live Extended Thinking alcançou 82,6 pontos no Speech to Speech Quality Index, com o primeiro lugar geral, e 97,7% no Big Bench Audio. O modelo ainda registrou 68,6% no τ-Voice, que mede a conclusão de tarefas por agentes de voz, e 35,1% no τ-Voice-banking, voltado a tarefas do setor financeiro. Já o Gemini 3.8 Live ficou em segundo lugar no Speech Agent Arena, que avalia a preferência dos usuários em interações com agentes de voz.

Para identificar conteúdos produzidos pelos modelos, os áudios gerados pelo Gemini Live recebem uma marca d’água imperceptível por meio do SynthID. A tecnologia foi desenvolvida para facilitar a detecção de conteúdo criado por inteligência artificial e aumentar a transparência sobre a origem das gravações.

Gostou? Compartilhe com quem precisa saber:

Receba as notícias no seu WhatsApp

Entre no nosso canal oficial e fique por dentro de tudo que acontece em Sergipe

Entrar no canal →

Publicidade

EM ALTA AGORA