本文へ移動

AIゲームマスターの調査

ロールプレイ向けAIゲームマスターの比較方法

印象的な一場面をベンチマークと取り違えず、プレイヤーの決定権、物語の連続性、ルール、速度、費用からAIゲームマスターを繰り返し比較する方法を紹介します。

著者 Playworlds · Elser.AI ·

開いた日誌から金色の道が城、山々、月明かりの遺跡へと伸びている。

良い比較はゲームの一ターンから始まる

どのAIモデルが最高のゲームマスターになるか?劇的な一段落だけではその質問に答えられない。RPGのターンは、応答がプレイヤーの試行に従い、確立された事実を尊重し、ルールを適用し、意味のある次の選択を残すことで成功する。あるモデルは美しい文章を書きながら、秘密を早く明かしたり、プレイヤーのキャラクターが何をするかを決定してしまうかもしれない。別のモデルは簡潔でありながら、場面全体を保持できる。

このガイドはランキングではなくテスト計画である。以下の祭りの遭遇はオリジナルの例示シナリオであり、Playworldsのモデルベンチマークとして条件を統一して実施したわけではない。この記事の背後にある調査は、OpenAI、Anthropic、Googleが異なるプロンプトと推論の制御を推奨していることを示している。公平な比較は、すべてのモデルが同じインターフェースであるかのように扱うのではなく、それらの設定を記録する。

複数の失敗を見分けられる場面を使用する

プレイヤーが壊れた時計仕掛けの鍵を持っている仮装祭りを想像してほしい。プレイヤーは証拠なくギルドの管理人を非難しないときょうだいに約束し、時計職人がその機構を変更したと疑っている。時計職人は交換されたバネに気づいているが、誰が作業を依頼したかは知らない。プレイヤーは鍵の損傷した半分だけを見せながらバネについて尋ねる。この場面は、応答が質問に答え、時計職人の限られた知識を尊重し、約束を記憶し、非難を強要しないかをテストする。

この場面の10コピーではなく、複数の場面を準備すること。通常の会話、判定が必要な不確実な行動、所持品の制約、以前のセッションからの手がかり、結果を伴う選択を含める。各モデルに同じ見えている状況と同じ確定した事実を与える。アプリケーションが意図的にそのNPCがそれらを知らせている場合を除き、隠された事実をNPCのブリーフから外す。

応答を生成する前に、期待する制約を記録します。この場面では、時計職人は交換されたバネを特定できても依頼主の名前は知らず、きょうだいとの約束は有効なままです。プレイヤーはまだ誰を告発するか選んでいません。二つの応答の文章がまったく違っても、評価者はこの条件を確認できます。

二つの異なる比較を実行する

まずプロンプトの移植性をテストすること。各モデルに同じコンパクトな場面ブリーフと同じ要求された出力を与える。これは移行の質問に答える:既存のゲームマスタープロンプトを新しいモデルに移行するとどうなるか?苦戦しているモデルのために追加のヒントを加えないこと;共有プロンプトがテストされている条件である。

次に最適化されたワークフローをテストすること。同じゲームプレイ目標に対して各モデルの文書化された設定と指示を調整する。これは別の質問に答える:賢明な本番統合は何を実現できるか?すべての変更を記録すること。あるモデルが構造化された決定ステップを使用し、別のモデルが通常の文章リクエストを受け取る場合、ワークフローが異なることを開示すること。両方の比較は有用だが、それらの結果を説明のない一つの勝者に統合することは誤解を招く。

実際のAPIモデル識別子、日付、プロンプトバージョン、コンテキスト、ツール定義、出力制限、effort設定をメモに使用すること。消費者向けチャットセッション、コーディングアシスタント、ゲートウェイルート、提供元の公式APIリクエストは異なる制御と隠れたコンテキストを持つ可能性がある。応答を比較する前にインターフェースを特定すること。

プレイヤーが気づけるものを採点する

各ターンを5つの質問に対してレビューすること:試行された行動に応答したか?確立された事実とNPCの知識を正しく保ったか?記録されたダイスやルールの結果に従ったか?プレイヤーの感情と次の行動をプレイヤーに委ねたか?明確な次の決定を生み出したか?失敗には短い理由とそれを引き起こした正確な行をマークすること。5つすべてを「良い文章」という単一の印象に縮小しないこと。

小規模な探索的試験では、各場面を複数回実行し、成功だけでなく失敗も残します。文体の評価は人によって分かれるため、客観的な条件を先に決め、雰囲気は別に採点します。三人目の評価者がモデル名を見ずに、意見の割れた例を確認する方法もあります。これは提案する手法であり、ここで示す標本数が統計的な優位性を証明するという主張ではありません。

提出された行動から有用な結果までの待機時間を測定し、単一のモデル呼び出しに費やされた時間だけでなく。ゲームが状態を取得し、ダイス判定を処理し、出力を検証し、または音声を生み出す場合、それらのステップはプレイヤーの待機に影響する。再試行、代替処理、人による修正を記録すること。最も短い応答は必ずしもプレイ可能な次のターンへの最速ルートではない。

完了したターンを数え、次にそのコストを数える

有用な経済指標は、すべての試行にわたるプロバイダーの総支出を成功した完了したターンで割ったものである。ワークフローが100回の試行で2ドルを費やし、80の有用なターンを完了すると仮定する。その成功したターンあたりのコストは0.025ドルである。1.50ドルを費やし、50ターンを完了する第2のワークフローは、より低い総請求にもかかわらず、成功したターンあたり0.03ドルのコストである。これらの数値は計算を説明するために創作されたものであり、Playworldsの価格や測定ではない。

比率と一緒に、実際に完了したターン数も示します。該当する場合は、キャッシュの読み書き、追加の推論トークン、補助的な呼び出し、再試行、音声の費用を含めます。入力のキャッシュ割引が冒険全体の費用を同じ割合で下げるとは限りません。提供元の使用量と、ゲームがプレイヤーに示すクレジットや価格は分けて扱います。

結果は特定の用途のための決定であるべきである:おそらくあるモデルが範囲の狭いNPCの返答を処理し、別のモデルが複雑なクエスト結果のためにテストされる。全体的なリーダーボード順位が自分の場面でのパフォーマンスを予測すると推測しないこと。意味のあるモデル、プロンプト、またはゲームルールの変更後に再テストすること。

ゲームを試してから次の選択を判断する

プレイヤーは手がかりを尊重しているか、決定の余地を残しているかに気づくためにAPIログを必要としない。世界を選び、キャラクターに一つの目先の目標を与え、会話に続いて不確実な行動を試す。後で戻り、物語がどこにあるかを理解できるか見てほしい。それらはラベルのモデル名に関係なく、あらゆるAI RPGに有用な質問である。

Playworldsはそのフローに世界、キャラクターシート、サイコロ、AIナレーションをもたらす。利用可能なモデルは設定によって変化し、この記事は新しい比較結果や特定のモデル導入を主張していない。その評価基準は実際に受け取る経験を評価する方法であり、将来の統合を検討する際に私たちのチームが使用できる方法である。