Gemini 3.8 TTS:从挑选声音到指挥声音
文本转语音(TTS)(wén běn zhuǎn yǔ yīn)
把写下来的文字转换成声音。
音色复制(yīn sè fù zhì)
根据声音样本制作相似的声音特点。
SynthID(SynthID)
Google放进生成音频里的隐形识别标记。
发生了什么
Google(开发Gemini的科技公司)在2026年9月23日宣布了两种新的语音生成模型:Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。官方说明称,前者面向创作,后者面向大量语音生产。
Gemini 3.8 Flash TTS可以根据自然语言提示,从零设计一种新声音。用户可以描述角色、口音和声音特点。Google称,它支持100多种语言和方言,并提供2000多种可以直接使用的声音。Flash-Lite则重点服务大量配音、音频制作和语音代理。
这两种模型都能逐句控制说话方式。用户可以安排语速、情绪、方言变化和停顿,也可以让两个声音按照同一份脚本对话。Google还称,长篇音频中,声音特点会更稳定。
背景
文本转语音(TTS)就是把文字变成声音。过去,用户通常先从现成声音中选择。Google把这次更新描述为更像一个声音创作工作室:用户不仅选择谁来读,还能安排每一句应该怎样读。
模型还支持有条件的音色复制。用户可以用30秒的音频样本复制自己的声音,或复制自己拥有使用权的声音。系统会核对声音主人的同意录音。Google称,生成的音频会加入SynthID隐形标记,音色复制还会带有C2PA认证信息。
为什么重要
这次更新把语音生成从单纯的朗读,推进到声音和表演的设计。游戏角色、有声书、播客、配音和实时语音代理,都可以更细地控制声音。两个角色用一份脚本自然轮流说话,也可能减少部分制作工作。
但声音和真实身份关系密切。复制声音时,谁同意、谁拥有使用权、听众能否识别人工生成内容,都会变得重要。Google给出了同意核对和隐形标记等方案,不过这些方案的实际效果,还需要产品使用和外部测试来确认。
已确认的信息
Google表示,两个模型已经开始通过Google AI Studio和Gemini API向开发者推出。Gemini 3.8 Flash TTS还会进入Gemini Notebook,Flash-Lite会进入Google Vids。Gemini Enterprise的API支持将在之后提供。音色复制目前不适用于美国伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度。
性能方面,Google介绍了Hume AI的Voice Design Benchmark、质量指数,以及Voice Arena的盲测结果。Google称,Flash TTS在其中一些项目中排名靠前。但这些是Google引用的评测结果,不等于本篇资料已经完成独立验证。
这条消息在Hacker News获得275个积分和125条评论。讨论页面的数字表示社区关注度,不证明Google的产品说法一定正确。
仍不清楚
官方说明没有完整列出价格、调用上限和每种语言的实际效果。长时间生成时,声音能否一直稳定,也需要更多样本。SynthID能在什么条件下被发现,同意核对在真实业务中是否可靠,同样需要外部观察。
接下来关注
接下来应关注独立听测,尤其是日语和其他地区语言。开发者也需要看到清楚的价格、配额和地区规则。更重要的是,声音的授权和来源信息,能否在普通媒体制作中一直保持清楚。
Gemini 3.8能自己设计声音,还能逐句指挥
📰 完整报道: Gemini 3.8 TTS:从挑选声音到指挥声音
Google公布了新的语音工具。它们不只会朗读,还能控制每句话的说法。
文本转语音(TTS)(wén běn zhuǎn yǔ yīn)
让电脑把文字读成声音。
SynthID(SynthID)
放在人工生成声音里的隐形标记。
💡 一句话总结
- Google公布了两种新的语音模型。
- 它们可以设计声音,也可以控制说话方式。
- 这条消息在Hacker News获得275分和125条评论。
Google(开发Gemini的公司)公布了Gemini 3.8 Flash TTS(把文字变成声音的模型)。文本转语音(TTS)就是把写下来的话读出来。这个模型可以从头设计一种新声音,也能控制语速、语气、口音和停顿。
Gemini 3.8 Flash-Lite TTS适合大量配音。Google称,两种模型支持100多种语言和方言。它们还提供2000多种可以直接使用的声音。两个声音可以按照同一份脚本轮流对话。
如果用户有权使用某种声音,就可以用30秒的音频样本复制它。系统会先核对声音主人的同意录音。生成的声音还会加入SynthID标记。这个标记像一个看不见的提示,帮助人们知道声音由人工系统生成。
新模型会进入Google AI Studio、Gemini API、Gemini Notebook和Google Vids。音色复制在一些地区暂时不能使用。官方说明也没有说清全部价格和使用上限。
Hacker News是讨论科技消息的网站。这条消息有275分和125条评论,表示它受到关注。但关注度不是正确证明。可以查看Google的说明和Hacker News讨论。
💬 HN 反应:看起来便宜又有用,但还不够完善
用户既期待能在本地制作声音,也担心质量、价格、使用限制和安全问题。数字都是用户报告或估算。
- 有人在自己的电脑上做出了能让不同角色朗读的有声书工具。一位用户报告称,499条引用中有485条分对了,即97.2%;另一位用户说,用约12分钟录音就做出了很像自己的声音。
- 关于长篇朗读,有人比较后认为 Fish Audio 或 Higgs 更容易听。
- 用户估算每小时约需0.27到0.81美元;一本约150万字符的书,有人算出这里约15美元,另一项服务约75美元。
- 一些人认为声音不够自然、没有完全遵循指令,也还不能用于正式制作;另一些人则觉得效果很真实。
- 还有用户遇到 AI Studio 报错和地区限制,并担心同意录音的保存方式以及克隆声音被滥用。
这是评论数为150时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
Gemini 3.8会把文字变成声音
📰 完整报道: Gemini 3.8 TTS:从挑选声音到指挥声音
你写下故事,电脑就能用声音读出来。
Gemini 3.8 Flash TTS(Gemini 3.8 Flash TTS)
把文字变成声音的Google工具。
SynthID(SynthID)
电脑声音里藏着的小记号。
Google(做Gemini的公司)公布了新的声音工具。
Gemini 3.8 Flash TTS(把字变成声音的工具)可以读故事。 你可以叫它慢一点。 你也可以叫它开心一点。 两个声音可以一起说话。 另一个工具可以做很多声音。
如果要学别人的声音,主人要先同意。 声音里还会有SynthID(看不见的小记号)。 这个记号帮助人们发现电脑做的声音。
Hacker News(讨论技术的地方)也在谈这条消息。 它有275分和125条评论。 这些数字只表示很多人看到了它。 它们不能证明消息一定是真的。
你可以读Google的说明。
💬 大家怎么说:电脑可以用很多声音读书
大家觉得这项技术很神奇,但也发现它还会出问题。
- 有人说,自己的电脑能让书里不同人物用不同声音说话,并正确分开499句话中的485句。另一个人说,约12分钟的录音就能做出很像自己的声音。
- 有人觉得,读很长的书时,其他声音工具更好听。
- 用户估算一小时大约要0.27到0.81美元,大书可能要15美元左右,而别的服务可能要75美元。
- 声音不一定总能听懂指令,有些地方还不能使用;人们也担心别人会怎样保存和滥用被复制的声音。
这是评论数为150时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 HN 反应:Gemini 3.8 TTS 价格有吸引力,但质量、安全和可用性仍有分歧
评论者一方面肯定它的低成本和表现力潜力,另一方面也质疑它是否能准确遵循提示、声音克隆是否会被滥用,以及产品发布是否完善。以下数字、性能和故障都来自用户自报或估算,并非独立验证。
这是评论数为150时的成熟版(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。