Gemini 3.8 Live发布:人工智能一边聊天,一边做事
视觉输入(shì jué shū rù)
模型收到的画面信息。
语音代理(yǔ yīn dài lǐ)
能用声音完成任务的人工智能程序。
SynthID水印(SynthID shuǐ yìn)
Google放进AI生成音频里的隐藏标记。
Google(开发 Gemini 的公司)在2026年9月15日宣布推出 Gemini 3.8 Live(实时语音对话模型)和 Gemini 3.8 Live Extended Thinking(面向复杂任务的版本)。Google在官方博客中说,这两种模型可以在接近实时的状态下推理、理解视觉输入,并在对话继续时调用工具。消息发布后,也在Hacker News(科技新闻网站)上受到关注,获得350 points和224 comments。这些数字只表示社区关注度,不证明发布内容或性能一定正确。
发布了什么
Live面向大规模使用和成本效率。Google称,它能让对话更流畅,也能在接近实时的状态下处理画面。它可以在一次对话中自动识别并切换97种受支持语言。它还可以在后台调用工具和API,同时继续和用户说话。
Extended Thinking面向高复杂度任务。它会一边说话,一边处理多步推理。它可以先用简短的话告诉用户自己正在检查,再说明任务进度。官方示例包括多步预订和异步处理。示例说明的是产品目标,不等于所有任务都能稳定完成。
背景:让对话和工作同时进行
这次发布的重点,不只是更聪明的答案。模型还要在处理事情时保持对话连贯。Live强调速度和效率;Extended Thinking强调复杂步骤和推理。Google把两者定位为开发者构建语音代理的基础。用户可以用声音提出任务,模型在后台工作,并报告进展。
为什么重要
语音交互把听、看、说和调用服务放进一条流程。如果模型能边回应边完成后台任务,用户就不必每一步都停下来重新下指令。关键是任务没完成时,模型能否说清进度。
Google引用的外部评测显示,Extended Thinking在三个项目中得到82.6、68.6%和97.7%;Live在另一项语音代理评测中排第二。数字来自Google公告,公告没有完整说明测试条件,也没有独立复测。
已确认的提供方式
开发者可从 Gemini API(调用服务的方式)和 Google AI Studio(开发者工具)开始。企业用户可在 Gemini Enterprise(企业服务)中看到私有预览。Live也进入 Search Live(搜索里的语音功能)。Extended Thinking进入 Gemini Live。Google列出 Workspace(办公服务)中的 Docs、Gmail、Keep,供符合条件的用户使用。
Google还称,AI产品生成的音频都带有不可察觉的SynthID水印,用来帮助识别AI音频,并协助减少错误信息传播。
还不知道什么
官方文章没有给出完整价格,也没有逐一说明国家、设备和套餐的开放时间。97种语言在嘈杂环境中的表现、工具调用失败后如何处理、用户能否在关键操作前确认,都无法从这篇公告确认。外部评测的具体条件和比较对象也没有完整展开。
接下来观察
下一步应看实际产品,而不只是演示:对话是否在工具运行时保持自然,任务要等多久,API成本是多少,视觉理解是否稳定。若第三方能在相同条件下复现评测,性能数字才更容易判断。普通用户则可以关注 Search Live、Gemini Live和Google Workspace的实际开放范围。
Gemini 3.8 Live:会聊天,也会在后台做事
📰 完整报道: Gemini 3.8 Live发布:人工智能一边聊天,一边做事
Google发布了两种新的语音人工智能模型,它们能在说话时继续处理任务。
基准测试(jī zhǔn cè shì)
用相同方法比较模型表现的测试。
API(API)
一种让软件使用模型功能的方式。
Hacker News(Hacker News)
分享科技消息并显示关注度的网站。
💡 一句话总结
- Live重视快速、自然的语音对话。
- Extended Thinking处理更难的多步任务。
- 两者都能理解画面,并在后台调用工具。
Google(开发 Gemini 的公司)在9月15日发布了这两种模型。请看官方说明。Gemini 3.8 Live(会用声音对话的模型)可以接收接近实时的视觉信息。Google说,它能在一次对话中识别并切换97种语言。它还可以调用工具和API。任务进行时,对话不必停止。
Gemini 3.8 Live Extended Thinking专门处理复杂工作。它会把任务分成几步来想,同时继续说话。它还会用短句告诉用户正在检查,并说明进度。Google展示了多步预订的例子。这解释了它为什么不只是一个会回答问题的聊天工具:它还试图把请求向后推进。
Google列出了几项外部基准测试结果。Extended Thinking在语音质量、任务完成和音频推理项目中分别是82.6、68.6%和97.7%。不过,这些数字来自Google的公告。测试条件和比较方法没有全部写出。
这条消息在Hacker News(科技新闻网站)上也受到关注。它有350 points和224 comments。这表示很多人看到了消息,不表示模型一定正确或好用。
两种模型会分批开放。开发者可使用Gemini API(调用模型的方式)和Google AI Studio(开发工具)。Live会进入Search Live(搜索里的语音功能),Extended Thinking会进入Gemini Live(语音对话功能)。部分用户还可在Docs、Gmail和Keep中使用。价格、设备范围和全部开放时间,仍需等待更多说明。
💬 Gemini 3.8 Live:好聊,但也会出问题
有些评论者觉得Gemini 3.8 Live很快、好读,也会处理多种语言。另一些人报告它在下棋、查资料和长对话中会犯错。这些是个人体验,不是官方测试结果。
- 有人觉得它在棋局演示中漏掉了一个很容易的将杀。
- 也有人认为,实时模型能合法地下完整盘棋,已经很厉害。
- 用户自称它适合头脑风暴,有人也觉得它的多语言语音和翻译不错。
- 但也有人报告它会编造查资料的答案,或忘记前面的对话。
- 还有人觉得它的声音太夸张,听久了会累。
- 比较结果还可能受到Google搜索系统和计算量的影响,不一定只代表模型本身。
这是评论数为327时的成熟版(修订4)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。
Gemini 3.8 Live:会说话,也会做小任务
📰 完整报道: Gemini 3.8 Live发布:人工智能一边聊天,一边做事
Google发布了会和人说话、还会继续做事的人工智能。
Gemini 3.8 Live(Gemini 3.8 Live)
Google给会用声音聊天的人工智能起的名字。
Gemini 3.8 Live Extended Thinking(Gemini 3.8 Live Extended Thinking)
处理难任务的版本。
Hacker News(Hacker News)
分享科技消息的网站。
Google(开发 Gemini 的公司)在发布说明中介绍了新的人工智能。它叫 Gemini 3.8 Live(用声音聊天的人工智能)。你可以和它说话。它也能看见你给它的画面。Google说,它能在97种语言之间切换。
它还可以让别的工具帮忙。工具工作时,它不会马上停下聊天。
Google还发布了 Gemini 3.8 Live Extended Thinking(处理难任务的版本)。它会把难事分成几步。它一边想,一边告诉你进度。Google举了预订的例子。
这条消息也出现在Hacker News(科技新闻网站)上。那里有350 points和224 comments。这个数字表示很多人注意到了它。这个数字不能证明AI一定正确。
两种AI不会同时到每个人手里。Google会慢慢开放它们。价格和每台设备的情况,还没有说清楚。
💬 大家怎么说Gemini 3.8 Live
大家发现了它的优点,也发现了它的麻烦。
- 有人说它说话快,还会说不同的语言。
- 可是,它下棋时好像犯了一个很容易的错误。
- 有人说它会忘记很久以前说过的话。
- 还有人觉得它的声音太用力,听久了会累。
这是评论数为327时的成熟版(修订4)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 Gemini 3.8 Live:对话自然,但评价要分开看
HN评论认为,Gemini 3.8 Live在对话自然度、速度和多语言语音方面有吸引力;但也有人质疑它的国际象棋演示、据称的幻觉、上下文遗忘、语音疲劳,以及搜索工具链对比较结果的影响。以下是评论者的个人体验和观点,不是独立验证。
这是评论数为327时的成熟版(修订4)。获取300条,并从整体抽取120条总结。内容属于HN用户自述,并非编辑部核实的事实。