AI 游戏主持人设计
“逐步思考”对 AI 游戏主持人有帮助吗?
比较 OpenAI、Claude Opus 5.5 与 Gemini 对“逐步思考”的建议,区分 AI 游戏主持人的推理提示、API 强度设置与玩家可见的解释。

一句熟悉的提示词可能隐藏三种不同请求
“逐步思考”听起来像是让 AI 游戏主持人更谨慎的简单方法。但玩家实际应该收到什么?是更准确的裁决、裁决前更多的运算,还是对裁决更长的说明?这些是不同的目标。即使结果正确,如果旁白在每次卫兵对话前都揭露一整页冗长的流程说明,冒险也可能变得较不有趣。
考虑一个示意场景:一名窃贼提着灯笼,试图穿过吱嘎作响的廊道。地板可能坍塌,一名同伴在下方等待,而成功穿过会揭示一座上锁的档案室。模型可能需要解读这个动作,但游戏也需要权威状态与规则结果。通用的推理短语无法取代这些输入。更好的问题是:这个回合的哪个部分需要帮助,而哪项控制能处理它?
官方指引没有给出唯一通用答案
OpenAI 的推理模型指南建议使用简单、直接的指示,并表示像“逐步思考”这样的明确思维链提示词对其推理模型而言并非必要。它建议的起点是清楚的任务、限制条件与输出要求,并在有助于改善时加入范例。这是模型家族的指引,而非该短语对每个 AI 旁白都失效的证明。
Anthropic 的 Opus 5.5 指南表示,聊天应用程序应考虑移除“回答前仔细思考”这类通用指示。在 Anthropic 所述之聊天产品测试中,移除该行文本让回复更早开始,且未见明显品质下降。指南将模型的推理强度设置视为主要控制项。与此同时,Google 表示“非常努力思考”的请求有时有助于困难的 Gemini 推理任务,代价是额外消耗思考 token。这些立场各不相同,且各自属于其模型与接口。
将文本提示词与推理强度设置分开
自然语言提示词出现在提示中:“决定前,请仔细考虑相关线索。”API 推理强度设置是由模型服务提供的请求参数或配置选项。要求提供说明会改变显示给玩家的回答:“简短解释为何穿过需要掷骰。”这些控制项可能相互影响,但不可互换。提供商可以在不改变玩家动作文本的情况下,变更推理强度设置的支持。
对于廊道场景,一个有用的结果可能是一句描述相关风险的句子,接着是所提供掷骰的结果。玩家需要理解灯笼使潜行变得更困难;他们不需要模型隐藏的内部推理。要求简短、面向玩家的裁决理由,是关于清晰度的设计选择。它不应与要求模型印出其私人思维链混为一谈。
测试同一场景,但不要预设胜负
创建一个小型测试,使用相同的已保存场景、玩家动作、角色卡与规则结果。先使用直接指示:“解决所提供的结果,并描述下一个情境。”接着测试一个简短的推理提示词,同时保持推理强度设置不变。在另一组比较中,只变更受支持的推理强度设置。最后,测试要求简短说明是否能改善玩家理解度。一次改变全部三项,将使你无法判断哪项改变有影响。
使用比廊道更多的场景。包含一个简单的问候、一次有风险的穿过、一个模糊的社交交易,以及一个依赖先前场景线索的决定。每个条件运行多次,并查看完整回应,包括它留下的下一个选择。这些是建议的实验;我们尚未运行它们,也未提出 OpenAI、Claude、Gemini 或 Playworlds 的实测成功率。
评估玩家收到的回合
有用的评估会问:旁白是否遵守已知状态、套用所提供结果,并保留玩家的自主权?如果窃贼从未掷骰,旁白是否仍宣布安全穿过?如果灯笼未点亮,场景是否凭空发明明亮火焰?如果同伴在下方,文本是否在没有动作的情况下将他们移到楼上?这些错误对持续的战役而言,比文本是否听起来深思熟虑更重要。
也注意等待时间、可见回答长度、不必要的重复,以及回合后所需的修正次数。一个增加数段文本但没有修正任何裁决的提示词,可能不适合一般游玩。一个只在罕见且重大决定中有效的较高推理强度设置,若选择性使用,仍可能有帮助。如果你正在打造游戏,追踪失败尝试与重试的总成本;在失败回合中较少 token 并非有用的节省。
写提示词和游玩时的实用原则
如果你正在打造 AI 游戏主持人,从直接任务、已验证的场景事实、明确规则边界与简短回应契约开始。只有在识别出可重复发生的失败,并确认该提示词对该模型有效后,再加入推理提示词。在 API 支持的地方,单独调整推理强度。当简短说明有助于玩家理解结果时就要求它;让它关于可观察的游戏事实,而非模型隐藏的审议。
如果你正在游玩,可以用一个指明意图与方法的动作来帮助旁白:“我稳住灯笼,用靴子测试最近的木板,并试着在不呼唤同伴的情况下抵达档案室门。”这为场景提供具体尝试,而不宣称成功。下一个回答可以解决一个不确定时刻,并将下一步留给你。在 Playworlds 中浏览世界,即可在单人冒险中尝试这种动作风格。