AI 游戏主持人研究
如何比较角色扮演中的 AI 游戏主持人
一套可重复使用的方法,用于在玩家自主权、故事连贯性、规则、速度与成本方面比较 AI 游戏主持人,而不把单个精彩场景误当基准。

好的比较从游戏回合开始
哪个 AI 模型能成为最好的游戏主持人?一段话无法回答这个问题。一个角色扮演游戏回合要成功,回应必须跟随玩家的尝试、尊重已确立的事实、套用规则,并留下有意义的下一步选择。模型可能写出优美文本,却过早揭露秘密或替玩家角色决定行动;另一个模型可能简短,却能保留整个场景。
本指南是一份测试计划,而非排名。下方的节日遭遇是原创的说明情境;我们尚未将其作为受控的 Playworlds 模型基准测试运行。本文引用的研究显示,OpenAI、Anthropic 与 Google 建议不同的提示词与推理控制。公平的比较应记录这些设置,而不是把每个模型都当成同一个接口。
使用一个有多种失败方式的场景
设想一个戴面具的节日,玩家带着一把损坏的发条钥匙。玩家曾向兄弟姊妹承诺,没有证据就不指控公会管家,并怀疑一位钟表匠改动了它的机构。钟表匠注意到一根替换的弹簧,但不知道谁下达了这笔工作。玩家询问弹簧时,只展示钥匙受损的一半。这个场景测试回应是否回答了问题、尊重钟表匠有限的知识、记得承诺,并避免强迫指控。
准备多个场景,而不是十份相同副本。包含一段普通对话、一个需要掷骰的不确定行动、一个物品栏限制、一个来自先前会话的线索,以及一个有重大影响的选择。给每个模型相同的可见情境与相同的事实。除非应用明确允许该 NPC 知道,否则不要将隐藏事实放入 NPC 的摘要中。
在生成回应前保存预期限制。就这个场景而言:钟表匠可以识别替换弹簧,但不能说出顾客身分;兄弟姊妹的承诺仍然有效;玩家尚未选择是否指控任何人。这些是审查者可以套用的检查项目,即使两个回应使用完全不同的文本。
运行两种不同的比较
先测试提示词可移植性。给每个模型相同的简短场景摘要与相同要求的输出。这回答了迁移问题:如果将现有的游戏主持人提示词移到新模型,会发生什么事?不要悄悄为某个表现不佳的模型额外增加提示;共享的提示词正是被测试的条件。
然后测试优化的工作流程。针对相同的游戏目标,调整每个模型的文档化设置与指示。这回答了另一个问题:合理的生产集成能达到什么效果?记录每一项变更。如果一个模型使用结构化决策步骤,而另一个收到纯文本请求,请说明工作流程的差异。两种比较都有用,但将它们的结果合并成一个未解释的赢家会造成误导。
在笔记中使用实际 API 模型识别码、日期、提示词版本、上下文、工具定义、输出限制与推理强度设置。消费者聊天会话、代码助手、网关路由与第一方 API 请求可能具有不同的控制项与隐藏上下文。在比较回应前,先识别接口。
评分玩家能注意到的部分
针对每个回合回答五个问题:它是否回应了尝试的行动?它是否保持已确立的事实与 NPC 知识一致?它是否遵循记录的掷骰或规则结果?它是否将玩家的情绪与下一步行动留给玩家?它是否创造了明确的下一个决策?用简短原因与造成失败的确切行标记失败。不要将所有五项合并成“文本写得好”的单一印象。
对于小型探索性测试,将每个场景运行多次,并保留失败与成功。审查者可能对风格有分歧,因此先定义客观限制,再单独评分氛围。第三位审查者可以在不看模型名称的情况下解决有争议的案例。这是一种建议的方法,而非宣称此处任何样本大小都能证明统计优越性。
测量从提交行动到有用结果的等待时间,而不只是花在单一模型调用上的时间。如果游戏也截取状态、解决掷骰、验证输出或生成语音,这些步骤会影响玩家的等待。记录重试、备援与人工修复。最短的回答不一定是通往可玩下一回合的最快路径。
计算完整回合,然后计算其成本
一个有用的成本指标是跨所有尝试的提供商总支出除以成功完成的回合数。假设一个工作流程在 100 次尝试中花费 $2,完成 80 个可用回合。其每个成功回合的成本为 $0.025。第二个工作流程花费 $1.50 并完成 50 回合,每个成功回合成本为 $0.03,尽管总账单较低。这些数字是虚构的,用于示范计算;它们不是 Playworlds 的价格或实测数据。
与比率一起报告原始完成回合数。在适用时,加入缓存读写、额外推理 token、辅助调用、重试与语音成本。缓存输入折扣不会自动转化为整个冒险的相同百分比减少。将提供商使用量与游戏向玩家显示的任何点数或价格分开。
结果应是针对特定工作的决策:也许一个模型处理狭窄的 NPC 回应,而另一个被测试用于棘手的任务后果。不要推断整体排行榜排名能预测你在自己场景上的表现。在模型、提示词或游戏规则有意义的变更后重新测试。
先玩游戏,再判断下一个选择
玩家不需要 API 日志就能注意到冒险是否尊重线索或留下决策空间。选择一个世界,给你的角色一个立即目标,并尝试一段对话后接一个不确定行动。稍后回来,看看你是否能理解故事当前的位置。这些是任何 AI 角色扮演游戏都有用的问题,无论标签上的模型名称为何。
Playworlds 将世界、角色卡、骰子与 AI 叙述带入该流程。可用模型可能随设置而变,本文不宣称新的比较结果或特定模型推出。其评分标准是评估你实际收到体验的方式,也是我们团队在考虑未来集成时可使用的方法。