跳至正文

NPC 聲音與對話

Eleven v4 Turbo 與 NPC 對話:為你的下一步行動留出空間

從說話者身分、回合時機到可實際操作的三回合對話練習,探索 v4 Turbo 能如何塑造回應自然的 NPC 交談。

作者 Playworlds · Elser.AI ·

披著斗篷的冒險者沿石徑走向霧山間發光的傳送門。

最好的回答,會邀請你繼續對話

在緊閉的城門前,一名辦事員問你為什麼帶著王室印璽。同伴剛要開口回答,卻停下來等你表態。一段好的有聲交談,應讓你輕鬆分辨說話者,並給你明確的機會去虛張聲勢、解釋情況,或轉身離開。

Eleven v4 Turbo 專為互動式語音設計。本文圍繞 Playworlds 已有的角色聲音提出一種對話體驗設想,並不是宣布遊戲已支援 Turbo。目前 Playworlds 的語音實作使用 Fish Audio,而這場城門遭遇是一個原創示例。

先弄清速度數字測量的是什麼

ElevenLabs 的發布報告稱,在排除網路延遲的測試中,Turbo 的首次語音輸出時間中位數約為 150 毫秒。這是語音服務層面的測量。你提交行動後到聽見 NPC 回答之間的時間,還取決於遊戲生成答案以及瀏覽器開始播放所需的時間。

對於城門場景,可以從提交「我出示印璽」開始計時,直到聽見第一句有用的話;接著記錄整個回答何時結束。一段迅速開始、卻持續三十秒的說教,可能比稍晚開始但簡潔的回答更妨礙交談。回應體驗也包括角色給你留下多少空間。

讓辦事員與同伴各有自己的聲音

讓辦事員說話沉穩而有分寸,讓同伴的語氣輕快而親切。這種區別應當經得起情緒變化:辦事員可以驚慌,同伴可以溫柔,但兩人仍應保留各自的聲音身分。Playworlds 現有的 GM 和角色配音分配功能,可以作為這類試聽的起點。

另外,ElevenLabs 文件介紹了透過 Text to Dialogue,使用標準版 Eleven v4 和 Eleven v3 生成多說話者語音的方式。該指南並未確認同一個端點支援 Turbo。擬議中的整合必須確保每句台詞直到播放時都連結至正確的說話者;語音模型無法自行推斷一句話屬於哪個 Playworlds 角色。

不要用表演洩露玩家尚未得知的秘密

在我們的例子中,辦事員認出了印璽,卻有理由隱瞞這一點。克制的回答可以保留懸念;誇張的倒吸一口氣或心虛的笑聲,卻可能過早揭曉答案,即使台詞文字看起來仍然中立。

按照場景本來打算透露的資訊來指導表演。「有禮貌,仔細斟酌每一個詞」能留下解釋空間;「明顯在撒謊」則會封死這種空間。這些是供你在外部試聽時使用的原創表演方向,並非 Playworlds 玩家介面支援的指令。

把打斷與恢復也納入試聽

在未來的 Turbo 原型中,應測試舊回答尚未播完、玩家就繼續行動的情況,以及音訊傳輸失敗時會發生什麼。聽眾應能理解哪個回答屬於目前場景。對新模型的評估,不應止步於它最順暢、完全未被打斷的示範。

保留可閱讀的文字回答,並避免把重播當作一次新的遊戲行動。這些是更換供應商時建議採用的驗收標準,並不意味著 Playworlds 目前提供語音打斷功能,或支援透過麥克風與 NPC 即時交談。

試試三回合的對話

首先,向城門辦事員提出一個中性問題;接著,質疑回答中的一個細節;最後,選擇一種緩和氣氛的回應。聽聽這個角色是否始終保持一致,同時說話方式會隨情境改變。對話結束時,你應當知道發生了什麼變化,以及接下來能做什麼。

可以用 Playworlds 目前提供的聲音嘗試這種結構,也可以用自己的腳本單獨在 ElevenLabs 中試聽。本文沒有進行 Turbo 遊戲體驗基準測試。官方資料和遊戲程式碼均於 2026 年 10 月 3 日審閱。