新模型
2026-09-15
🔥 重点
谷歌发布 Gemini 3.8 Live 双工语音模型,边聊边调用工具不卡顿
谷歌发布 Gemini 3.8 Live 双工语音模型,边聊边调用工具不卡顿
发生了什么
9月15日,谷歌正式发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音模型。和过去的语音助手"听写→思考→朗读"三段式不同,这次是原生语音到语音:模型一边听你说话、一边开口回、一边在后台帮你调工具、查系统、看画面,对话全程不中断。
- Gemini 3.8 Live:主打便宜、低延迟、能大规模用,支持图文音视频输入,对话中能"看"到你屏幕上的内容。
- Extended Thinking 版:能在说话的同时做多步推理和后台任务,遇到复杂活儿会先来一句"我查一下",再把进度念给你听,不会让你干等。
- 支持约 97 种语言并在对话中自动切换;所有生成音频都带 SynthID 隐形水印,可被检测为 AI 生成。
- 价格约每分钟输入 0.005 美元、输出 0.018 美元,整体每小时不到 1.4 美元,比对手便宜一半以上。
对我有什么用
这是谷歌把"会干活的语音智能体"从演示变成生产级能力的一步。过去语音 AI 最大的槽点是:让它去查个东西,它就得"静音三秒"再播录音;现在它能在继续跟你聊的同时把活干完。对客服、银行核验、现场指导这类"必须边聊边查系统"的场景,这是质变。第三方评测里 Extended Thinking 版语音质量榜(Speech-to-Speech)以 82.6 分排第一,超过了 OpenAI 的 GPT-Live-1。
我可以怎么做
- 普通用户:在 Gemini App、Google 搜索的 Search Live、以及订阅用户的 Google 文档 / 邮件 / Keep 里,已经能用上更自然的实时语音对话——可以一边说一边让它改文档、清邮件、整理清单。
- 开发者:通过 Gemini API / Google AI Studio 接入,做自己的语音助手或客服机器人;官方还和 Vercel、LiveKit、Agora 等实时音视频平台做了对接。
温馨提醒
- 功能按入口分批开放,地区和订阅档位不一定全球齐步,以你账号里实际出现的为准。
- 模型卡自己写明:偶有变慢、超时或幻觉,后台任务失败会直接漏进对话,重要场景别完全放手。
- 在中国大陆,Gemini API / Workspace 的可用性和数据出境要单独评估,企业落地前先确认开放状态。
📤 一键转发小助手
帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发
💬 说说你的看法