跳至正文

語音模型比較

ElevenLabs v4、v3 與 Fish Audio 比較:如何為 AI RPG 選擇聲音

從表現力、回應速度、角色連貫性與可操作的試聽方法出發,比較 Eleven v4、v4 Turbo、v3 及 Playworlds 的 Fish Audio 語音流程。

作者 Playworlds · Elser.AI ·

披著斗篷的冒險者沿石徑走向霧山間發光的傳送門。

比較一場冒險,而不是一段驚艷的錄音

一段動人的獨白,可能掩蓋聲音在遊戲中的不自然。同一個模型還需要讀出任務道具名稱、回答簡短問題,並在角色情緒激動時依然讓人認得出來。這篇比較從這些玩家需求出發,不會宣布一個適用於所有情況的贏家。

我們於 2026 年 10 月 3 日審閱了 ElevenLabs 官方資料和 Playworlds 的實作,但尚未進行受控音訊基準測試。Playworlds 目前透過 Fish Audio 生成語音,使用的模型識別碼為 s2.1-pro;下文的 ElevenLabs 模型是供評估的替代方案。

Eleven v4 與 Eleven v3

官方目錄列出,v4 支援 90 多種語言,單次請求上限為 10,000 個字元;v3 則支援 70 多種語言,上限為 5,000 個字元。ElevenLabs 表示,v4 在聲音準確性和表現力方面有所提升,但官方指南也建議,在切換前先比較自己熟悉的聲音。

這對已經進行了一段時間的戰役很重要。即使新模型更忠實地還原了參考聲音,它聽起來仍可能與玩家熟悉的同伴不同。比較一段已儲存的問候和一次情緒強烈的歸來場景,再判斷新的演繹是否保留了你想要的角色。

標準版 v4 與 v4 Turbo

標準版 v4 面向注重品質的語音製作,Turbo 則面向即時互動。ElevenLabs 公布,Turbo 的推理延遲中位數約為 100 毫秒,首次語音輸出時間中位數約為 150 毫秒。發布時的測量排除了網路延遲,因此這些數字並不等於玩家從點選到聽到聲音的時間。

為一次發現新事物的敘事場景選擇聲音時,可以先試聽標準版 v4;為與 NPC 的快速交談選擇聲音時,則應把 Turbo 納入比較。測量玩家提交行動後的完整等待時間,包括遊戲主持人生成文字、語音傳輸和播放。即使語音服務很快,整個回合仍可能很慢。

Fish Audio 在這場比較中的位置

Fish Audio 是有意義的比較基準,因為它是 Playworlds 目前程式碼選用的語音供應商。現有的角色配音分配、試聽、串流傳輸和播放功能,已經組成了一套整合介面。更換供應商,不僅涉及聲音本身,也會涉及這些遊戲功能。

這並不是一張把 Fish 所有版本都視為等同的評分表。Fish 的公開 S2 資料介紹了富有表現力的語音能力,而 Playworlds 轉接器明確指定的是 s2.1-pro。在之後的任何測試中,都應使用設定中指定的這個模型,不要把另一款模型宣傳的結果套用到它身上。

為小隊設計一次公平的試聽

準備五句原創台詞:一句問候、一句耳語警告、一個陌生地名、一段兩人爭執,以及一段平靜的回顧。讓實際說出的文字和預期表演保持一致。在功能支援且獲得許可的情況下使用同一份參考錄音,否則就記錄下聲音選擇的差異。

隨機排列錄音片段,請聽眾指出自己聽懂了哪些詞、認出了哪個角色,以及情緒是否合適。記錄多次生成結果、失敗情況、總等待時間和計費用量。比較每個可用場景的成本,並計入重試,而不是只計算一次碰巧成功的生成。本次尚未進行這項測試,因此這裡不報告勝出者。

圍繞你的玩法作出選擇

我們的編輯建議是:為重要旁白試聽 v4,把 Turbo 納入快速交談的評估,並保留目前 Fish 整合作為基準。這些只是建議的評估分工,並不是在宣布 Playworlds 設定中將提供這些模型選項。

對玩家而言,可以從冒險中已有的聲音開始,完整聽完一個場景。對創作者而言,只有當模型同時改善清晰度、連貫性和節奏時,才值得更換。更好的聲音,應讓你想回應角色,而不僅僅是重播示範。