AI 模型与游戏
Jev 能让 AI 游戏主持人更快吗?一种游戏设计方案
TypeSafe Jev 能否加速 AI 游戏主持人?了解结构化决策、混合 RPG 工作流,以及更快的模型调用对整体游戏延迟的影响。

Jev 可以处理拖慢回合的小型决策,从而有望加快 AI 游戏主持人的响应:理解尝试的行动、选择工作流,或评估 NPC 可能的反应。机会在于缩短故事继续之前的处理过程。改善幅度取决于这些决策目前占据玩家等待时间的比例。
TypeSafe 于 2026 年 9 月 15 日推出 Jev 的抢先体验版。发布说明将其描述为用于有类型决策、而非自由文本生成的 System One 模型,报告称适用查询的响应为 70–500 毫秒,速度提升 40–200 倍。这些是供应商报告的数据,并非 Playworlds 的测试结果。 TypeSafe 的 Jev 发布公告.
对 AI RPG 而言,这启发了一种搭配:快速决策模型帮助游戏决定接下来发生什么,语言模型则把已结算的结果写成场景。以下是我们提出的游戏设计,并非已实现的 Jev 集成。
想走进一场 AI 冒险吗? 体验 Playworlds:找到喜欢的设定,决定你的角色首先做什么。
为什么 AI 主持人有时要等很久
玩家写道:“同伴引开守卫时,我悄悄溜过去。”这只有一句话,但游戏在描述结果前可能需要回答多个问题。
玩家在对谁说话?正在尝试潜行、交谈还是战斗?同伴能参与吗?目标地点能到达吗?行动需要掷骰吗?哪些信息应进入下一次叙事提示?
某些答案已经存在于游戏状态中,另一些需要理解。如果应用按顺序分别调用通用语言模型来回答每个问题,玩家看到第一个有用的字之前,等待就可能层层累积。
先检查这条处理链。删除多余调用,或直接查询已知事实,可能比更换模型更有价值。只有确实存在需要理解的决策时,快速模型才最有用。
什么是 System One 模型?
TypeSafe 文档介绍了三类问题:Choice 选择一个选项,Score 根据评分标准进行评估,Noul 则针对一个陈述返回零到一之间的值。多个问题可以共用一次调用,但会根据提供的状态独立评估。Choice 和 Score 还返回置信度。 TypeSafe 文档.
这一接口启发了不同的 AI 主持人设计方式:不要先要求一个不受限的计划,再去解析大段文字,而是直接定义游戏真正能使用的决策,并由外围代码负责组合它们。
例如,行动分类器可以在以下标签中选择: sneak, talk, attack, inspect,以及 other。另一个问题可以评估措辞是否要求同伴帮忙。这些标签只是应用设计示例,并非 TypeSafe API 语法。
Jev 可以放在 RPG 回合的哪些环节
游戏任务 | 建议方法 | 原因 |
理解自由文本行动 | 用少量支持的意图类别评估 Jev | 输出可以选择预先定义的工作流。 |
评估 NPC 的回应类别 | 测试怀疑、合作或回避等选项 | 叙事模型可以按照角色特点表达选定反应。 |
检查物品栏或剩余移动量 | 读取权威游戏状态 | 已保存的事实不需要概率性的回答。 |
结算骰子并应用伤害 | 执行游戏规则 | 规则结果应该可复现、可审查。 |
理清复杂任务选择 | 必要时使用更深入的推理步骤 | 可能需要综合考虑多项相互依赖的事实。 |
编写场景和对话 | 使用 Luna 或 Sol 等语言模型 | 玩家需要易读、富有表现力的叙事。 |
这些是待测试的方向,并不是说 Jev 已在 Playworlds 中证明了每项能力。
守卫遭遇场景的更快流程
首先,载入一份精简的当前状态快照:守卫位置、玩家位置、同伴能否参与,以及相关规则。排除决策不需要的事实。
接着,合并提出彼此独立的理解问题。行动的表面意图、是否要求引开注意力,都可根据原始消息评估。依赖掷骰结果的决策必须等待掷骰完成;把有依赖的问题放入同一批次,并不能消除依赖。
然后,让引擎检查前置条件并结算尝试。同伴不在场时,游戏不应悄悄编造其参与。行动不明确时,可以简短询问玩家,或交给更强的理解模型处理。
最后,将已确认的结果交给叙事模型。例如:干扰成功,玩家到达拱门,守卫注意到掉落的搭扣,却认不出主人。叙事模型可以生动呈现这一刻,而不在段落中途改变结果。
玩家体验到的是连续的场景。内部每个环节各司其职,引擎只提交一次最终状态。
你的方法也许是虚张声势、讨价还价,或仔细观察周围。 在 Playworlds 选择下一场冒险 ,把这个意图带入场景。
决策快 100 倍,游戏也会快 100 倍吗?
不会。设想一个示例回合:三个依次进行的理解调用,每个耗时两秒,之后再进行四秒的叙事生成:
3 × 2 秒 + 4 秒 = 10 秒
现在假设每次理解调用只需 0.1 秒:
3 × 0.1 秒 + 4 秒 = 4.3 秒
决策调用快了 20 倍,但整个回合只快了约 2.3 倍,等待时间减少 57%。如果三个决策彼此独立,并可在 0.1 秒内批量完成,示例总时间将变为 4.1 秒。
这些数字是为解释计算而设定的,并非 Jev 或 Playworlds 的实测数据。示例假定各阶段顺序执行,并省略了检索、验证、网络开销和语音生成。
这里仍有很大的改善空间。把长暂停缩短几秒,就可能改变调查或对话的节奏。但一旦叙事成为最慢环节,继续加快决策对总耗时的影响便会减小。应测量从提交行动到收到可用结果的完整链路。
类型安全,不代表剧情判断正确
TypeSafe 的发布说明区分了“保证符合结构定义”与更广泛的性能声明。它也指出,标题中提到的工作流提升可能接近实际改善的上限,且公开速度评估通常在美国西海岸进行。 TypeSafe 基准测试的适用说明.
回应可以符合要求的类型,却仍作出错误决策。当玩家本想虚张声势时,选择 attack 就是一个格式合法、后果却不合意的标签。同样,如果输入遗漏了相关事实,看似合理的 NPC 反应也可能违背早先的承诺。
把不确定性作为游戏流程的一部分。用有代表性的行动测试置信度阈值,保留 other 分支,并让模糊情况能够补救。只有帮助应用判断何时执行、何时索取更多信息时,置信度才有价值。
如何证明主持人确实提速了
有用的测试集应包含普通对话、模糊行动、战斗尝试、复合请求,以及依赖早先线索的场景。让现有流程与新方案处理相同的已保存状态。
同时测量速度和错误的后果:
- 首个有用回应: 玩家收到可以据此行动的信息的时间,而非仅仅看到加载提示。
- 完整回合耗时: 叙事与已确认的状态变更全部就绪的时间。
- 中位数与 p95 延迟: 典型等待时间,以及会打断冒险节奏的较慢回合。
- 决策准确率与回退率: 正确识别行动意图的频率,以及需要额外处理步骤的频率。
- 状态一致性: 回合结束后,物品、位置、资源与任务事实是否一致。
- 每个完成回合的成本: 包括所有调用、重试和回退处理。
最初的实验可以让 Jev 与当前理解模块并行评估,但不允许它更改线上游戏状态。先比较分歧,再决定哪些范围明确的决策适合安全、有效地进入实际流程。
这可能为 Playworlds 带来什么
目标是一场跟得上好奇心的冒险:再问一个问题,再检查一条线索,再尝试一种方法。Jev 是减少其中理解环节延迟的候选方案。完整游戏仍需要可靠规则、持久状态和令人满意的叙事。
本文描述一种可能的架构,并非宣布 Playworlds 已使用 Jev。想体验现有冒险形式,可以 在 Playworlds 选择一个世界。如果想更好地表达角色意图,可阅读我们的 角色扮演行动写作指南.
常见问题
Jev 能取代整个 AI 地下城主持人吗?
更适合把它用于主持人流程中的特定决策。在本文方案中,独立叙事模型编写场景,游戏引擎负责规则和已保存状态。
在 RPG 中,Jev 比 GPT-6 Luna 或 Sol 更快吗?
我们尚未进行 RPG 对比。有效测试应保持决策、上下文、区域和输出要求一致,并测量完整回合,而不只是某一次供应商调用。
Jev 能与 GPT 模型协作吗?
可以。应用可以组合决策服务与文本生成服务。关键在于传递经过验证的结果,让叙事与实际保存的状态一致。
主持人的每次检查都应使用 AI 吗?
不应如此。已知规则和存储事实应用确定性代码处理。只有普通逻辑无法充分处理的理解任务,才交给模型。
为下一场冒险迈出第一步
选一个世界,面对眼前局面,决定你的角色如何回应。 开始体验 Playworlds →