minssam.
Published on

Gemini 3.8 Flash TTS:用一句提示词设计声音

输入"冷静专业的声音,略带英式口音",AI就会创造出那个声音。不需要选角,不需要录音棚。

Google于2026年9月23日通过Gemini API和AI Studio发布了Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。这不是简单的文字转语音升级——而是一个设计声音本身的工具。


"订购"声音的时代

传统TTS服务的局限显而易见:从提供的列表中选一个,不满意就没有选择。

Gemini 3.8 Flash TTS的核心功能Voice Design颠覆了这一结构。用自然语言描述想要的声音,AI就会根据描述生成全新的声音。

例如:

  • "安静温暖的声音,中等语速,美国南部口音"
  • "充满活力的播客主持人风格,略带粗犷感"
  • "儿童教育用途,清晰亲切的发音"

可以直接调整声音的口音、速度、情感和停顿。耳语、笑声、叹气等细节表现也可以指定。


2000+预设音色+100种以上语言

如果从头设计太麻烦,可以从2000多个现成音声配置文件出发。

这个列表涵盖100多种语言,包括魁北克法语、苏格兰英语、墨西哥西班牙语等地区方言变体。选择的不是语言,而是声音的"出身地"。

中文也包含在内,为中文内容创作者提供了实用选择。


两个模型的区别:创作用 vs. 大规模生产用

Google此次同时发布了两个变体模型。

模型特点主要用途
Gemini 3.8 Flash TTS深度创意演绎、角色设计、丰富音频游戏、播客、有声书、互动媒体
Gemini 3.8 Flash-Lite TTS高速低成本、大批量处理优化大规模媒体配音、批量内容生成、语音智能体

创意项目选Flash TTS,商业规模自动化选Flash-Lite TTS。


声音克隆:30秒样本就够了

Voice Cloning功能也随之提供。提供30秒音频样本,AI学习该声音的特征后,可以用相同声音读出新的文字。

不过有条件:必须获得声音主人的录音授权。所有生成音频都会自动嵌入Google的SynthID水印和C2PA凭证,确保AI生成音频可追溯。


一个脚本,两个说话者

多说话者功能也值得关注。可以从一个脚本生成两个不同说话者对话的音频。播客访谈、教育内容对话形式、有声书对话场景等可直接应用。


教育与内容创作实用技巧

① 讲课内容自动化:教育者可以快速将讲课脚本转化为统一声音的音频。使用Flash-Lite TTS批量处理可大幅降低成本。

② 多语言内容拓展:构建将中文内容自动翻译并转换为100种语言自然声音的流水线。

③ 个人品牌声音:YouTube创作者或播客主持人可以克隆自己的声音——写好稿子就能完成内容制作。

④ 互动媒体:游戏或教育科技应用中,用Voice Design为每个角色创建独特声音,无需演员费用即可提升沉浸感。


一句话总结

Gemini 3.8 Flash TTS不是"选择"声音的工具,而是"创造"声音的工具。一个提示词代替了一间录音室。


Sources:

Gemini 3.8 Flash TTS:用一句提示词设计声音 | MINSSAM.COM