Forschung zu KI-Spielleitern
So vergleicht man KI-Spielleiter für Rollenspiel
Vergleiche KI-Spielleiter anhand von Spielerwahl, Kontinuität, Regeln, Tempo und Kosten. Eine anschauliche Szene allein ist noch kein Benchmark.

Ein guter Vergleich beginnt mit dem Spielzug
Welches KI-Modell macht den besten Spielleiter? Ein einzelner dramatischer Absatz kann diese Frage nicht beantworten. Ein RPG-Spielzug gelingt, wenn die Antwort auf den Versuch des Spielers eingeht, festgelegte Fakten respektiert, die Regeln anwendet und eine sinnvolle nächste Wahl lässt. Ein Modell kann wunderschöne Prosa schreiben, aber ein Geheimnis zu früh offenbaren oder entscheiden, was der Charakter des Spielers tut. Ein anderes kann knapp sein und trotzdem die gesamte Szene erhalten.
Dieser Leitfaden ist ein Testplan, keine Rangliste. Die Festivalbegegnung unten ist ein eigens entworfenes Beispielszenario; wir haben sie nicht als kontrollierten Playworlds-Modell-Benchmark durchgeführt. Die Forschung hinter diesem Artikel zeigt, dass OpenAI, Anthropic und Google unterschiedliche Prompting- und Reasoning-Kontrollen empfehlen. Ein fairer Vergleich dokumentiert diese Einstellungen, statt jedes Modell wie dieselbe Oberfläche zu behandeln.
Nutze eine Szene mit mehreren Möglichkeiten zu scheitern
Stell dir ein Maskenfest vor, bei dem der Spieler einen defekten Uhrwerkschlüssel trägt. Der Spieler hat einem Geschwisterteil versprochen, den Gildenverwalter ohne Beweis nicht zu beschuldigen, und vermutet, dass ein Uhrmacher seinen Mechanismus verändert hat. Der Uhrmacher hat eine Ersatzfeder bemerkt, weiß aber nicht, wer die Arbeit in Auftrag gegeben hat. Der Spieler fragt nach der Feder und zeigt dabei nur die beschädigte Hälfte des Schlüssels. Diese Szene testet, ob eine Antwort auf die Frage eingeht, das begrenzte Wissen des Uhrmachers respektiert, sich an das Versprechen erinnert und eine erzwungene Beschuldigung vermeidet.
Bereite mehrere Szenen vor, nicht zehn Kopien dieser einen. Nimm ein gewöhnliches Gespräch, eine unsichere Aktion, die einen Wurf benötigt, eine Inventarbeschränkung, ein Indiz aus einer früheren Session und eine folgenschwere Wahl auf. Gib jedem Modell dieselbe sichtbare Situation und dieselben autoritativen Fakten. Halte versteckte Fakten aus dem Brief eines NPC heraus, es sei denn, die Anwendung erlaubt diesem NPC bewusst, sie zu kennen.
Speichere die erwarteten Einschränkungen, bevor du eine Antwort generierst. Für diese Szene: Der Uhrmacher kann eine Ersatzfeder identifizieren, kann den Kunden nicht benennen, das dem Geschwisterteil gegebene Versprechen bleibt aktiv, und der Spieler hat noch nicht entschieden, ob er jemanden beschuldigt. Das sind Prüfungen, die ein Reviewer anwenden kann, selbst wenn zwei Antworten völlig unterschiedliche Prosa verwenden.
Führe zwei verschiedene Vergleiche durch
Teste zuerst die Prompt-Portabilität. Gib jedem Modell dasselbe kompakte Szenenbriefing und dieselbe gewünschte Ausgabe. Das beantwortet die Migrationsfrage: Was passiert, wenn ein bestehender Spielleiter-Prompt auf ein neues Modell verschoben wird? Füge dem Modell, das Schwierigkeiten hat, nicht still und leise einen zusätzlichen Hinweis hinzu; der gemeinsame Prompt ist die getestete Bedingung.
Teste dann einen optimierten Workflow. Passe die dokumentierten Einstellungen und Anweisungen jedes Modells für dasselbe Spielziel an. Das beantwortet eine andere Frage: Was würde eine sinnvolle Produktionsintegration erreichen? Dokumentiere jede Änderung. Wenn ein Modell einen strukturierten Entscheidungsschritt verwendet und ein anderes eine einfache Prosa-Anfrage erhält, offenlege, dass die Workflows unterschiedlich sind. Beide Vergleiche sind nützlich, aber ihre Ergebnisse zu einem unerklärten Gewinner zusammenzufassen, ist irreführend.
Verwende in deinen Notizen die tatsächliche API-Modellkennung, das Datum, die Prompt-Version, den Kontext, die Tool-Definitionen, das Ausgabe-Limit und die Reasoning-Aufwands-Einstellung. Eine Consumer-Chat-Sitzung, ein Coding-Assistent, eine Gateway-Route und eine First-Party-API-Anfrage können unterschiedliche Kontrollen und versteckten Kontext haben. Identifiziere die Oberfläche, bevor du Antworten vergleichst.
Bewerte, was ein Spieler bemerken kann
Prüfe jeden Spielzug anhand von fünf Fragen: Ist er auf die versuchte Aktion eingegangen? Hat er festgelegte Fakten und NPC-Wissen sauber gehalten? Hat er das protokollierte Würfel- oder Regel-Ergebnis befolgt? Hat er die Gefühle und die nächste Aktion des Spielers beim Spieler gelassen? Hat er eine klare nächste Entscheidung geschaffen? Markiere Fehler mit einem kurzen Grund und der exakten Zeile, die sie verursacht hat. Fasse nicht alle fünf in einen einzelnen Eindruck von „gutem Schreiben“ zusammen.
Für einen kleinen explorativen Test führe jede Szene mehrere Male aus und behalte Fehler ebenso wie Erfolge. Reviewer können sich über Stil uneinig sein, also definiere zuerst objektive Einschränkungen und bewerte Atmosphäre separat. Ein dritter Reviewer kann umstrittene Fälle klären, ohne den Modellnamen zu sehen. Das ist eine vorgeschlagene Methode, keine Behauptung, dass eine Stichprobengröße hier statistische Überlegenheit beweist.
Messe die Wartezeit von der eingereichten Aktion bis zum nützlichen Ergebnis, nicht nur die Zeit in einem einzelnen Modellaufruf. Wenn ein Spiel auch Zustand abruft, Würfel auflöst, Ausgabe validiert oder Sprache generiert, beeinflussen diese Schritte die Wartezeit des Spielers. Protokolliere Wiederholungen, Fallbacks und menschliche Reparaturen. Die kürzeste Antwort ist nicht unbedingt der schnellste Weg zu einem spielbaren nächsten Spielzug.
Zähle vollständige Spielzüge, dann ihre Kosten
Eine nützliche wirtschaftliche Kennzahl ist die Gesamt-Ausgabe des Anbieters über alle Versuche geteilt durch erfolgreiche abgeschlossene Spielzüge. Angenommen, ein Workflow gibt 2 $ über 100 Versuche aus und schließt 80 nutzbare Spielzüge ab. Seine Kosten pro erfolgreichem Spielzug betragen 0,025 $. Ein zweiter Workflow, der 1,50 $ ausgibt und 50 Spielzüge abschließt, kostet 0,03 $ pro erfolgreichem Spielzug, trotz einer niedrigeren Gesamt-Rechnung. Diese Zahlen sind erfunden, um die Berechnung zu demonstrieren; sie sind keine Playworlds-Preise oder Messungen.
Berichte die rohe Anzahl abgeschlossener Spielzüge neben dem Verhältnis. Füge Cache-Lese- und Schreibvorgänge, zusätzliche Reasoning-Tokens, unterstützende Aufrufe, Wiederholungen und Sprachkosten hinzu, wenn sie zutreffen. Ein Rabatt für gecachte Eingaben übersetzt sich nicht automatisch in dieselbe prozentuale Reduktion für das gesamte Abenteuer. Halte die Anbieter-Nutzung getrennt von jeglichen Credits oder Preisen, die ein Spiel Spielern anzeigt.
Das Ergebnis sollte eine Entscheidung für einen bestimmten Job sein: Vielleicht übernimmt ein Modell eine kurze, eng umrissene NPC-Antwort, während ein anderes für eine knifflige Quest-Folge getestet wird. Schließe nicht daraus, dass eine Platzierung in einer allgemeinen Rangliste die Leistung auf deinen eigenen Szenen vorhersagt. Teste nach bedeutenden Modell-, Prompt- oder Spielregeländerungen erneut.
Probiere das Spiel, dann bewerte die nächste Wahl
Ein Spieler braucht keine API-Logs, um zu bemerken, ob ein Abenteuer ein Indiz respektiert oder Raum für eine Entscheidung lässt. Wähle eine Welt, gib deinem Charakter ein unmittelbares Ziel und versuche ein Gespräch gefolgt von einer unsicheren Aktion. Komm später zurück und sieh, ob du verstehen kannst, wo die Geschichte steht. Das sind nützliche Fragen für jedes KI-RPG, unabhängig vom Modellnamen auf dem Etikett.
Playworlds bringt Welten, Charakterbögen, Würfel und KI-Erzählung in diesen Spielablauf. Verfügbare Modelle können sich mit der Konfiguration ändern, und dieser Artikel behauptet kein neues Vergleichsergebnis oder die Einführung eines bestimmten Modells. Sein Bewertungsraster ist eine Art, die Erfahrung zu bewerten, die du tatsächlich erhältst, und eine Methode, die unser Team verwenden kann, wenn wir zukünftige Integrationen in Betracht ziehen.