AI 語音模型
ElevenLabs v4:新語音模型能為 AI RPG 帶來什麼
認識 Eleven v4 和 v4 Turbo,探索富有表現力的語音能如何豐富 Playworlds 的旁白、角色聲音與難忘的冒險。

同一句話,也能改變整個場景
「你回來了。」如釋重負的同伴、心存戒備的守衛和負傷的對手,說出這句話時可以懷著完全不同的意圖。在 AI 角色扮演遊戲中,聲音的演繹能幫助你理解人物關係,再決定下一步怎麼做。
ElevenLabs 於 2026 年 9 月 28 日發布了 Eleven v4 和 Eleven v4 Turbo。本文結合 Playworlds 的語音功能,介紹這次發布的內容。我們在 10 月 3 日的程式碼審查中確認,目前語音流程使用的是 Fish Audio;Eleven v4 是值得探索的候選模型,並非 Playworlds 已宣布整合的功能。
認識兩個版本
ElevenLabs 將 v4 定位為適合語音內容製作的模型,將 v4 Turbo 定位為適合互動式對話的模型。官方模型目錄列出,兩者均支援 90 多種語言,標準版 v4 的單次生成上限為 10,000 個字元。這些是供應商公布的規格,並非在 Playworlds 遊戲過程中測得的結果。
對遊戲而言,真正有用的區分在於場景的任務。章節開場可以給精心安排的表演留出空間;守衛對一個簡短問題的回答,則需要為你的下一步行動留出餘地。更大的請求上限,不應成為讓角色長篇大論的理由。
表現力,也是一種表演指導手段
音訊標籤讓創作者能夠直接在腳本中提示說話方式。例如這句原創台詞:「[whispering] 遮住提燈。有人在監視那座橋。」標籤提供表演方向,實際說出的文字傳達警告。ElevenLabs 表示 v4 更善於遵循標籤,同時官方文件也承認,生成結果仍不完美。
適合 RPG 的聲音,應讓玩家第一次聽到警告時就能理解它。如果耳語掩蓋了線索,或者每句話都聽起來驚恐萬分,更多的表現力反而會讓場景更難遊玩。先讓每句台詞只有一個清楚的意圖,確認聽得懂其含義,再增加修飾。
它與目前的 Playworlds 有何關聯
Playworlds 已經為敘述者和角色陣容提供了相應功能:目前程式碼支援串流旁白、GM 與角色聲音選擇、試聽,以及分別調節語音和音樂音量。這些功能為新語音模型提出了一個明確任務:幫助玩家聽清是誰在說話,以及哪些內容值得關注。
語音模型負責演繹文字。它不會決定你的說服是否成功,不會記住隱藏的任務條件,也不會取代遊戲主持人。可信的聲音演繹應當呈現遊戲已經判定的場景,同時把角色下一步的行動留給你決定。
既要聽戲劇張力,也要聽角色的連貫性
想像你在日落時遇到一位擺渡人,渡河失敗後又回來找他。他的情緒可以改變,但聲音仍應讓你認得出是同一個人。我們建議用問候、警告和重逢三種台詞進行試聽,檢查角色在不同情緒下的身分是否保持一致。
v4 文件說明,它只有 Stability 和 Similarity 兩項聲音設定,不支援 Style、Speed 滑桿或 SSML。因此,現有語音工作流程需要實際檢查相容性。調高某個參數,不能代替連續聽同一個角色說上幾個回合。
從一次簡短冒險開始
選擇一個簡短的 Playworlds 場景,試聽目前提供的聲音,並調整旁白與音樂的平衡。留意自己能否認出說話者、聽清重要名字,以及台詞結束時是否已經準備好行動。無論使用哪種語音模型,這些問題都值得觀察。
如果你另外嘗試 ElevenLabs,請使用原創場景,並比較多次生成的版本。本系列中的例子是試聽練習和設計提案,並非錄製得到的 v4 遊戲體驗結果。本文所依據的資料與 Playworlds 實作均於 2026 年 10 月 3 日查證。