AI 语音模型
ElevenLabs v4:新语音模型能为 AI RPG 带来什么
认识 Eleven v4 和 v4 Turbo,探索富有表现力的语音能如何丰富 Playworlds 的旁白、角色声音与难忘的冒险。

同一句话,也能改变整个场景
“你回来了。”如释重负的同伴、心存戒备的守卫和负伤的对手,说出这句话时可以怀着完全不同的意图。在 AI 角色扮演游戏中,声音的演绎能帮助你理解人物关系,再决定下一步怎么做。
ElevenLabs 于 2026 年 9 月 28 日发布了 Eleven v4 和 Eleven v4 Turbo。本文将这次发布与 Playworlds 的语音功能联系起来介绍。我们在 10 月 3 日的代码审查中确认,当前语音流程使用的是 Fish Audio;Eleven v4 是值得探索的候选模型,并非 Playworlds 已宣布接入的功能。
认识两个版本
ElevenLabs 将 v4 定位为适合语音内容制作的模型,将 v4 Turbo 定位为适合交互式对话的模型。官方模型目录列出,两者均支持 90 多种语言,标准版 v4 的单次生成上限为 10,000 个字符。这些是供应商公布的规格,并非在 Playworlds 游戏过程中测得的结果。
对游戏而言,真正有用的区分在于场景的任务。章节开场可以给精心安排的表演留出空间;守卫对一个简短问题的回答,则需要为你的下一步行动留出余地。更大的请求上限,不应成为让角色长篇大论的理由。
表现力,也是一种表演指导手段
音频标签让创作者能够直接在脚本中提示说话方式。例如这句原创台词:“[whispering] 遮住提灯。有人在监视那座桥。”标签提供表演方向,实际说出的文字传达警告。ElevenLabs 表示 v4 更善于遵循标签,同时官方文档也承认,生成结果仍不完美。
适合 RPG 的声音,应让玩家第一次听到警告时就能理解它。如果耳语掩盖了线索,或者每句话都听起来惊恐万分,更多的表现力反而会让场景更难游玩。先让每句台词只有一个清晰意图,确认听得懂其含义,再增加修饰。
它与今天的 Playworlds 有何联系
Playworlds 已经为叙述者和角色阵容提供了相应功能:当前代码支持流式旁白、GM 与角色声音选择、试听,以及分别调节语音和音乐音量。这些功能为新语音模型提出了一个明确任务:帮助玩家听清是谁在说话,以及哪些内容值得关注。
语音模型负责演绎文字。它不会决定你的说服是否成功,不会记住隐藏的任务条件,也不会取代游戏主持人。可信的声音演绎应当呈现游戏已经判定的场景,同时把角色下一步的行动留给你决定。
既要听戏剧张力,也要听角色的连贯性
想象你在日落时遇到一位摆渡人,渡河失败后又回来找他。他的情绪可以改变,但声音仍应让你认得出是同一个人。我们建议用问候、警告和重逢三种台词进行试听,检查角色在不同情绪下的身份是否保持一致。
v4 文档说明,它只有 Stability 和 Similarity 两项声音设置,不支持 Style、Speed 滑块或 SSML。因此,现有语音工作流程需要切实审查兼容性。调高某个参数,不能代替连续听同一个角色说上几个回合。
从一次简短冒险开始
选择一个简短的 Playworlds 场景,试听当前提供的声音,并调整旁白与音乐的平衡。留意自己能否认出说话者、听清重要名字,以及台词结束时是否已经准备好行动。无论使用哪种语音模型,这些问题都值得观察。
如果你另外尝试 ElevenLabs,请使用原创场景,并比较多次生成的版本。本系列中的例子是试听练习和设计提案,并非录制得到的 v4 游戏体验结果。本文所依据的资料与 Playworlds 实现均于 2026 年 10 月 3 日核查。