O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, que conseguem raciocinar enquanto conversam com o usuário por voz e executar tarefas em segundo plano sem interromper o diálogo. O Gemini 3.8 Live já está disponível no Search Live, e os recursos do Extended Thinking chegam ao aplicativo Gemini e ao Google Workspace, com acesso de acordo com o serviço e o plano contratado.
Os modelos também já estão disponíveis para desenvolvedores pela Gemini API e pelo Google AI Studio e entram em prévia privada para empresas no Gemini Enterprise. No Google Workspace, o Docs Live está disponível para assinantes dos planos Google AI Pro e Ultra. Já os recursos Gmail Live e Keep Live chegam aos assinantes dos planos AI Plus, Pro e Ultra. Essas integrações permitem usar comandos de voz para interagir com documentos, e-mails e notas enquanto a inteligência artificial trabalha nas solicitações feitas pelo usuário.
A principal diferença entre os dois modelos está no tipo de tarefa para o qual cada um foi desenvolvido. O Gemini 3.8 Live prioriza interações rápidas, escala e custo-benefício, e o Gemini 3.8 Live Extended Thinking foi criado para solicitações que exigem várias etapas de processamento. Os dois contam com suporte visual em tempo real e detecção automática de idiomas, além de conseguirem alternar entre 97 idiomas durante uma mesma conversa.
Os novos modelos foram desenvolvidos para processar informações e executar ações enquanto continuam conversando com o usuário. Em vez de interromper a interação até terminar uma tarefa, o Gemini pode reconhecer uma solicitação, iniciar uma ação em segundo plano e continuar o diálogo enquanto o processo é concluído. A função pode ser usada, por exemplo, para consultar informações, criar códigos ou realizar uma reserva.
“deixe-me verificar isso para você”
No Gemini 3.8 Live Extended Thinking, o sistema também utiliza frases curtas para sinalizar que está trabalhando em uma solicitação, como no exemplo acima. A proposta é evitar longos períodos de silêncio durante o processamento e manter o diálogo mais próximo de uma conversa natural. Em tarefas com várias etapas, a IA ainda pode informar o andamento do processo enquanto executa as ações necessárias.
A interação também pode combinar voz e imagem. Com o uso da câmera, o Gemini consegue interpretar o ambiente em tempo real e usar essas informações para responder ao usuário. Entre os exemplos apresentados estão o auxílio durante uma partida de xadrez e a orientação de novos funcionários durante um processo de integração.
Os modelos foram avaliados em diferentes benchmarks de voz. O Gemini 3.8 Live Extended Thinking alcançou 82,6 pontos no Speech to Speech Quality Index, com o primeiro lugar geral, e 97,7% no Big Bench Audio. O modelo ainda registrou 68,6% no τ-Voice, que mede a conclusão de tarefas por agentes de voz, e 35,1% no τ-Voice-banking, voltado a tarefas do setor financeiro. Já o Gemini 3.8 Live ficou em segundo lugar no Speech Agent Arena, que avalia a preferência dos usuários em interações com agentes de voz.
Para identificar conteúdos produzidos pelos modelos, os áudios gerados pelo Gemini Live recebem uma marca d’água imperceptível por meio do SynthID. A tecnologia foi desenvolvida para facilitar a detecção de conteúdo criado por inteligência artificial e aumentar a transparência sobre a origem das gravações.
:quality(85)/b92fa583-0522-43cb-909b-96b77ee2ee8c.jpg)
LEIA TAMBÉM
Receba as notícias no seu WhatsApp
Entre no nosso canal oficial e fique por dentro de tudo que acontece em Sergipe
Entrar no canal →

