跳转到正文

NPC 声音与对话

Eleven v4 Turbo 与 NPC 对话:为你的下一步行动留出空间

从说话者身份、回合时机到可实际操作的三回合对话练习,探索 v4 Turbo 能如何塑造响应自然的 NPC 交谈。

作者 Playworlds · Elser.AI ·

披着斗篷的冒险者沿石径走向雾山间发光的传送门。

最好的回答,会邀请你继续对话

在紧闭的城门前,一名办事员问你为什么带着王室印玺。同伴刚要开口回答,却停下来等你表态。一段好的有声交谈,应让你轻松分辨说话者,并给你明确的机会去虚张声势、解释情况,或转身离开。

Eleven v4 Turbo 专为交互式语音设计。本文围绕 Playworlds 已有的角色声音提出一种对话体验设想,并不是宣布游戏已支持 Turbo。当前 Playworlds 的语音实现使用 Fish Audio,而这场城门遭遇是一个原创示例。

先弄清速度数字测量的是什么

ElevenLabs 的发布报告称,在排除网络延迟的测试中,Turbo 的首次语音输出时间中位数约为 150 毫秒。这是语音服务层面的测量。你提交行动后到听见 NPC 回答之间的时间,还取决于游戏生成答案以及浏览器开始播放所需的时间。

对于城门场景,可以从提交“我出示印玺”开始计时,直到听见第一句有用的话;接着记录整个回答何时结束。一段迅速开始、却持续三十秒的说教,可能比稍晚开始但简洁的回答更妨碍交谈。响应体验也包括角色给你留下多少空间。

让办事员与同伴各有自己的声音

让办事员说话沉稳而有分寸,让同伴的语气轻快而亲切。这种区别应当经得起情绪变化:办事员可以惊慌,同伴可以温柔,但两人仍应保留各自的声音身份。Playworlds 现有的 GM 和角色配音分配功能,可以作为这类试听的起点。

另外,ElevenLabs 文档介绍了通过 Text to Dialogue,使用标准版 Eleven v4 和 Eleven v3 生成多说话者语音的方式。该指南并未确认同一个接口支持 Turbo。拟议中的集成必须确保每句台词直到播放时都关联正确的说话者;语音模型无法自行推断一句话属于哪个 Playworlds 角色。

不要用表演泄露玩家尚未得知的秘密

在我们的例子中,办事员认出了印玺,却有理由隐瞒这一点。克制的回答可以保留悬念;夸张的倒吸一口气或心虚的笑声,却可能过早揭晓答案,即使台词文字看起来仍然中立。

按照场景本来打算透露的信息来指导表演。“有礼貌,仔细斟酌每一个词”能留下解释空间;“明显在撒谎”则会封死这种空间。这些是供你在外部试听时使用的原创表演方向,并非 Playworlds 玩家界面支持的指令。

把打断与恢复也纳入试听

在未来的 Turbo 原型中,应测试旧回答尚未播完、玩家就继续行动的情况,以及音频传输失败时会发生什么。听众应能理解哪个回答属于当前场景。对新模型的评估,不应止步于它最顺畅、完全未被打断的演示。

保留可阅读的文字回答,并避免把重播当作一次新的游戏行动。这些是更换供应商时建议采用的验收标准,并不意味着 Playworlds 目前提供语音打断功能,或支持通过麦克风与 NPC 实时交谈。

试试三回合的对话

首先,向城门办事员提出一个中性问题;接着,质疑回答中的一个细节;最后,选择一种缓和气氛的回应。听听这个角色是否始终保持一致,同时说话方式会随情境改变。对话结束时,你应当知道发生了什么变化,以及接下来能做什么。

可以用 Playworlds 当前提供的声音尝试这种结构,也可以用自己的脚本单独在 ElevenLabs 中试听。本文没有开展 Turbo 游戏体验基准测试。官方资料和游戏代码均于 2026 年 10 月 3 日审阅。