跳转到正文

语音模型对比

ElevenLabs v4、v3 与 Fish Audio 对比:如何为 AI RPG 选择声音

从表现力、响应速度、角色连贯性与可操作的试听方法出发,比较 Eleven v4、v4 Turbo、v3 及 Playworlds 的 Fish Audio 语音流程。

作者 Playworlds · Elser.AI ·

披着斗篷的冒险者沿石径走向雾山间发光的传送门。

比较一场冒险,而不是一段惊艳的录音

一段动人的独白,可能掩盖声音在游戏中的不自然。同一个模型还需要读出任务道具名称、回答简短问题,并在角色情绪激动时依然让人认得出来。这篇对比从这些玩家需求出发,不会宣布一个适用于所有情况的赢家。

我们于 2026 年 10 月 3 日审阅了 ElevenLabs 官方资料和 Playworlds 的实现,但尚未开展受控音频基准测试。Playworlds 当前通过 Fish Audio 生成语音,使用的模型标识为 s2.1-pro;下文的 ElevenLabs 模型是供评估的替代方案。

Eleven v4 与 Eleven v3

官方目录列出,v4 支持 90 多种语言,单次请求上限为 10,000 个字符;v3 则支持 70 多种语言,上限为 5,000 个字符。ElevenLabs 表示,v4 在声音准确性和表现力方面有所提升,但官方指南也建议,在切换前先对比自己熟悉的声音。

这对已经开展了一段时间的战役很重要。即使新模型更忠实地还原了参考声音,它听起来仍可能与玩家熟悉的同伴不同。对比一段已保存的问候和一次情绪强烈的归来场景,再判断新的演绎是否保留了你想要的角色。

标准版 v4 与 v4 Turbo

标准版 v4 面向注重质量的语音制作,Turbo 则面向实时交互。ElevenLabs 公布,Turbo 的推理延迟中位数约为 100 毫秒,首次语音输出时间中位数约为 150 毫秒。发布时的测量排除了网络延迟,因此这些数字并不等于玩家从点击到听到声音的时间。

为一次发现新事物的叙事场景选择声音时,可以先试听标准版 v4;为与 NPC 的快速交谈选择声音时,则应把 Turbo 纳入比较。测量玩家提交行动后的完整等待时间,包括游戏主持人生成文字、语音传输和播放。即使语音服务很快,整个回合仍可能很慢。

Fish Audio 在这场比较中的位置

Fish Audio 是有意义的比较基准,因为它是 Playworlds 当前代码选用的语音供应商。现有的角色配音分配、试听、流式传输和播放功能,已经组成了一套集成接口。更换供应商,不仅涉及声音本身,也会涉及这些游戏功能。

这并不是一张把 Fish 所有版本都视为等同的评分表。Fish 的公开 S2 资料介绍了富有表现力的语音能力,而 Playworlds 适配器明确指定的是 s2.1-pro。在今后的任何测试中,都应使用配置中指定的这个模型,不要把另一款模型宣传的结果套用到它身上。

为小队设计一次公平的试听

准备五句原创台词:一句问候、一句耳语警告、一个陌生地名、一段两人争执,以及一段平静的回顾。让实际说出的文字和预期表演保持一致。在功能支持且获得许可的情况下使用同一份参考录音,否则就记录下声音选择的差异。

随机排列录音片段,请听众指出自己听懂了哪些词、认出了哪个角色,以及情绪是否合适。记录多次生成结果、失败情况、总等待时间和计费用量。比较每个可用场景的成本,并计入重试,而不是只计算一次碰巧成功的生成。本次尚未开展这项测试,因此这里不报告胜出者。

围绕你的玩法作出选择

我们的编辑建议是:为重要旁白试听 v4,把 Turbo 纳入快速交谈的评估,并保留当前 Fish 集成作为基准。这些只是建议的评估分工,并不是在宣布 Playworlds 设置中将提供这些模型选项。

对玩家而言,可以从冒险中已有的声音开始,完整听完一个场景。对创作者而言,只有当模型同时改善清晰度、连贯性和节奏时,才值得更换。更好的声音,应让你想回应角色,而不仅仅是重播演示。