AI 遊戲主持人研究
如何比較角色扮演中的 AI 遊戲主持人
一套可重複使用的方法,用於在玩家自主權、故事連貫性、規則、速度與成本方面比較 AI 遊戲主持人,而不把單一精彩場景誤當基準。

好的比較從遊戲回合開始
哪個 AI 模型能成為最好的遊戲主持人?一段話無法回答這個問題。一個角色扮演遊戲回合要成功,回應必須跟隨玩家的嘗試、尊重已確立的事實、套用規則,並留下有意義的下一步選擇。模型可能寫出優美文字,卻過早揭露秘密或替玩家角色決定行動;另一個模型可能簡短,卻能保留整個場景。
本指南是一份測試計畫,而非排名。下方的節日遭遇是原創的說明情境;我們尚未將其作為受控的 Playworlds 模型基準測試執行。本文引用的研究顯示,OpenAI、Anthropic 與 Google 建議不同的提示詞與推理控制。公平的比較應記錄這些設定,而不是把每個模型都當成同一個介面。
使用一個有多種失敗方式的場景
想像一個戴面具的節日,玩家帶著一把損壞的發條鑰匙。玩家曾向兄弟姊妹承諾,沒有證據就不指控公會管家,並懷疑一位鐘錶匠改動了它的機構。鐘錶匠注意到一根替換的彈簧,但不知道誰下達了這筆工作。玩家詢問彈簧時,只展示鑰匙受損的一半。這個場景測試回應是否回答了問題、尊重鐘錶匠有限的知識、記得承諾,並避免強迫指控。
準備多個場景,而不是十份相同副本。包含一段普通對話、一個需要擲骰的不確定行動、一個物品欄限制、一個來自先前會話的線索,以及一個有重大影響的選擇。給每個模型相同的可見情境與相同的事實。除非應用程式刻意允許該 NPC 知道,否則不要將隱藏事實放入 NPC 的摘要中。
在生成回應前保存預期限制。就這個場景而言:鐘錶匠可以識別替換彈簧,但不能說出顧客身分;兄弟姊妹的承諾仍然有效;玩家尚未選擇是否指控任何人。這些是審查者可以套用的檢查項目,即使兩個回應使用完全不同的文字。
執行兩種不同的比較
先測試提示詞可移植性。給每個模型相同的簡短場景摘要與相同要求的輸出。這回答了遷移問題:如果將現有的遊戲主持人提示詞移到新模型,會發生什麼事?不要悄悄為表現較差的模型額外增加提示;共享的提示詞正是被測試的條件。
然後測試最佳化的工作流程。針對相同的遊戲目標,調整每個模型的文件化設定與指示。這回答了另一個問題:合理的生產整合能達到什麼效果?記錄每一項變更。如果一個模型使用結構化決策步驟,而另一個收到純文字請求,請說明工作流程的差異。兩種比較都有用,但將它們的結果合併成一個未解釋的贏家會造成誤導。
在筆記中使用實際 API 模型識別碼、日期、提示詞版本、上下文、工具定義、輸出限制與推理強度設定。消費者聊天會話、程式碼助手、閘道路由與第一方 API 請求可能具有不同的控制項與隱藏上下文。在比較回應前,先識別介面。
評分玩家能注意到的部分
針對每個回合回答五個問題:它是否回應了嘗試的行動?它是否保持已確立的事實與 NPC 知識一致?它是否遵循記錄的擲骰或規則結果?它是否將玩家的情緒與下一步行動留給玩家?它是否創造了明確的下一個決策?用簡短原因與造成失敗的確切行標記失敗。不要將所有五項合併成「文字寫得好」的單一印象。
對於小型探索性測試,將每個場景執行多次,並保留失敗與成功。審查者可能對風格有分歧,因此先定義客觀限制,再單獨評分氛圍。第三位審查者可以在不看模型名稱的情況下解決有爭議的案例。這是一種建議的方法,而非宣稱此處任何樣本大小都能證明統計優越性。
測量從提交行動到有用結果的等待時間,而不只是花在單一模型呼叫上的時間。如果遊戲也擷取狀態、解決擲骰、驗證輸出或生成語音,這些步驟會影響玩家的等待。記錄重試、備援與人工修復。最短的回答不一定是通往可玩下一回合的最快路徑。
計算完整回合,然後計算其成本
一個有用的成本指標是跨所有嘗試的供應商總支出除以成功完成的回合數。假設一個工作流程在 100 次嘗試中花費 $2,完成 80 個可用回合。其每個成功回合的成本為 $0.025。第二個工作流程花費 $1.50 並完成 50 回合,每個成功回合成本為 $0.03,儘管總帳單較低。這些數字是虛構的,用於示範計算;它們不是 Playworlds 的價格或實測數據。
與比率一起報告原始完成回合數。在適用時,加入快取讀寫、額外推理 token、輔助呼叫、重試與語音成本。快取輸入折扣不會自動轉化為整個冒險的相同百分比減少。將供應商使用量與遊戲向玩家顯示的任何點數或價格分開。
結果應是針對特定工作的決策:也許一個模型處理狹窄的 NPC 回應,而另一個被測試用於棘手的任務後果。不要推斷整體排行榜排名能預測你在自己場景上的表現。在模型、提示詞或遊戲規則有意義的變更後重新測試。
先玩遊戲,再判斷下一個選擇
玩家不需要 API 日誌就能注意到冒險是否尊重線索或留下決策空間。選擇一個世界,給你的角色一個立即目標,並嘗試一段對話後接一個不確定行動。稍後回來,看看你是否能理解故事目前的位置。這些是任何 AI 角色扮演遊戲都有用的問題,無論標籤上的模型名稱為何。
Playworlds 將世界、角色卡、骰子與 AI 敘述帶入該流程。可用模型可能隨設定而變,本文不宣稱新的比較結果或特定模型推出。其評分標準是評估你實際收到體驗的方式,也是我們團隊在考慮未來整合時可使用的方法。