边想边说的实时语音大模型:
Google 发布 Gemini 3.8 Live 与 Extended Thinking
把实时语音推向多步骤推理
基础版本 Gemini 3.8 Live 专注于大规模部署的高性价比。面向高并发、低延迟的日常助理与检索服务。支持在97种语言对话中自动识别并平滑过渡...
兼顾流畅的多模态实时互动(视觉+语音)与极具竞争力的运行成本。
Gemini 3.8 Live Extended Thinking 则主打企业级复杂任务执行。它重点强化了多步骤逻辑推理与规划能力,主要面向客户服务、专业排障、多系统协调等需要深度思考的生产环境
Thinking 版本实现了“实时思考与发音同步”。面对复杂问题时,它会自然地说出“让我查一下…”作为过渡,并在后台执行多步骤任务时同步向用户汇报进度,交流体验就像在与真人通电话。
后台异步工具调用:在调用外部 API、检索数据或订座的同时,前端的语音闲聊完全不中断,实现了真正的并发协作。
近实时多模态视觉理解:模型能一边看着画面一边聊天,例如实时根据员工入职环境答疑、看棋盘下棋,甚至看着草图直接用语音沟通并生成 React 代码。
显示更多