能力到创作 · 角色配音

给角色一个声音,再导演每句台词:Gemini 3.8 TTS

同一个骑士,可以换一种声音;同一段独白,可以逐句安排停顿与情绪。从官方演示看,短片配音多了哪些可控制的部分。

9 月 23 日发布,9 月 24 日整理。下文使用 Google 官方演示;本站核对了画面与播放入口,尚未自行生成配音或测量中文效果。

本文目录3 个章节

同一个角色,声音也能单独设计

在这段游戏演示里,穿盔甲的骑士站在画面中央,右侧是声音描述和试听按钮。到第 48 秒,描述强调低沉、沙哑的战士声音;到第 73 秒,文字改成高音调、带庄重感的公主声音,骑士形象仍然保留。可以打开原视频,听这两个位置的差别。

这里值得看的是创作顺序:角色长什么样、听起来是什么样,可以分别调整。已经做出人物或动画镜头的人,可以继续研究声音如何塑造性格,而不是把选一个固定音色当作配音的全部。

Google 演示中的盔甲骑士,右侧 Voice Design 面板输入声音描述,下方提供试听。
Google 官方演示第 48 秒原始画面:角色形象与声音描述并列。这是演示应用,不代表 TTS 模型生成了游戏画面。 · 打开大图
来源与延伸阅读

音色确定之后,台词还需要表演

另一段官方演示把侦探独白拆成多个表演段落。画面中,台词旁有情绪和音量说明,句中插入叹气、短暂停顿和呼吸。它展示了两层控制:先确定谁在说话,再安排这一句如何说。

Google 在 9 月 23 日推出 Flash TTS 与 Flash-Lite TTS,前者着重角色声音设计,后者面向大量语音生成;两者都提供逐句表演控制。官方示例说明了操作思路,中文情绪是否自然、同一角色多次生成能否稳定,仍需实际作品和同题试听来补全。

官方独白演示把一句台词的表演说明和叹气、短暂停顿、呼吸标签放在文字旁。
Google 官方独白演示第 40 秒画面。画面左下注明视频已缩短;它展示控制方式,不是连续长音频的本站测试。 · 打开大图
来源与延伸阅读

先找到入口,再带一小段自己的故事

发布时,AI Studio 与 Gemini API 开始逐步开放两款模型;面向现成产品,Flash 对应 Gemini Notebook,Lite 对应 Google Vids。这不等于普通 Gemini 聊天窗口已经拥有演示里的全部控件,具体仍以所用产品与账号可见入口为准。

可以先拿自己写的两三句对白,保持台词和角色设定不变,只调整一次停顿或情绪,听它是否更贴近故事。回看网站的 AI 影像案例时,也可以多留意:画面之外,声音怎样让人物成立。这是可尝试的创作方向,不是这些旧案例已经采用了新模型。

来源与延伸阅读