KI-Sprachmodelle
ElevenLabs v4: Was das neue Sprachmodell KI-Rollenspielen bringen könnte
Lerne Eleven v4 und v4 Turbo kennen und entdecke, was ausdrucksstarke Sprachausgabe zur Erzählung, zu Charakterstimmen und zu unvergesslichen Abenteuern in Playworlds beitragen könnte.

Dieselben Worte können eine Szene verändern
„Du bist zurückgekommen.“ Ein erleichterter Gefährte, eine misstrauische Wache und ein verwundeter Rivale können diese Worte mit völlig unterschiedlichen Absichten sagen. In einem KI-Rollenspiel hilft dir die Art, wie sie gesprochen werden, eine Beziehung zu verstehen, bevor du deinen nächsten Schritt entscheidest.
ElevenLabs stellte Eleven v4 und Eleven v4 Turbo am 28. September 2026 vor. Diese Einführung stellt die Verbindung zwischen der Veröffentlichung und den Sprachfunktionen von Playworlds her. Unsere Codeprüfung vom 3. Oktober ergab, dass die aktuelle Sprachpipeline auf Fish Audio basiert. Eleven v4 ist ein Kandidat für weitere Erprobungen, keine angekündigte Playworlds-Integration.
Die beiden Versionen kennenlernen
ElevenLabs positioniert v4 für die Produktion von Sprachaufnahmen und v4 Turbo für interaktive Gespräche. Der Modellkatalog nennt für beide mehr als 90 unterstützte Sprachen und für das Standardmodell v4 eine Generierungsgrenze von 10.000 Zeichen. Das sind Angaben des Anbieters, keine Messungen aus einer Playworlds-Sitzung.
Für ein Spiel ist entscheidend, welche Aufgabe eine Szene erfüllt. Ein Kapitelauftakt kann Raum für einen bewusst gestalteten Vortrag bieten. Antwortet eine Wache auf eine kurze Frage, muss Platz für deinen nächsten Zug bleiben. Ein höheres Zeichenlimit pro Anfrage sollte keine Ausrede für längere Reden werden.
Ausdruck als Mittel der Sprechregie
Mit Audio-Tags können Autorinnen und Autoren direkt im Skript Hinweise zur Sprechweise geben. Ein eigens erstelltes Beispiel lautet: „[whispering] Halte die Laterne verdeckt. Die Brücke wird bewacht.“ Der Tag gibt eine Regieanweisung; die gesprochenen Worte vermitteln die Warnung. Laut ElevenLabs befolgt v4 Tags besser, zugleich räumt die Dokumentation ein, dass die Ergebnisse weiterhin nicht vollkommen sind.
Eine hilfreiche Rollenspielstimme macht die Warnung beim ersten Hören verständlich. Wenn das Flüstern den Hinweis verschluckt oder jeder Satz voller Angst klingt, erschwert der zusätzliche Ausdruck das Spielen der Szene. Beginne mit einer klaren Absicht pro Zeile und achte zuerst auf die Bedeutung, bevor du weitere gestalterische Akzente setzt.
Was das mit Playworlds heute verbindet
Playworlds bietet bereits Platz für eine Erzählerstimme und ein Ensemble: Der aktuelle Code unterstützt gestreamte Erzählung, die Auswahl von Spielleiter- und Charakterstimmen, Hörproben sowie getrennte Lautstärkeregler für Sprache und Musik. Diese Funktionen geben einem neuen Sprachmodell eine konkrete Aufgabe: Spielenden dabei zu helfen, zu erkennen, wer spricht und worauf es ankommt.
Das Sprachmodell trägt Text vor. Es entscheidet nicht, ob dein Überzeugungsversuch erfolgreich war, merkt sich keine verborgene Questbedingung und ersetzt nicht die Spielleitung. Ein überzeugender Vortrag sollte die vom Spiel festgelegte Szene ausdrücken und dir die nächste Handlung deines Charakters überlassen.
Auf Wiedererkennbarkeit und Dramatik achten
Stell dir vor, du triffst bei Sonnenuntergang einen Fährmann und kehrst nach einer gescheiterten Überfahrt zu ihm zurück. Seine Stimmung darf sich ändern, aber er sollte weiterhin wie jemand klingen, den du wiedererkennst. Unser vorgeschlagener Hörtest nutzt eine Begrüßung, eine Warnung und ein Wiedersehen, um die Identität über verschiedene Emotionen hinweg zu prüfen.
Laut v4-Dokumentation sind Stability und Similarity die beiden Stimmeneinstellungen; Regler für Style und Speed sowie SSML werden nicht unterstützt. Bestehende Abläufe für die Sprachausgabe benötigen daher eine tatsächliche Kompatibilitätsprüfung. Einen Regler höher zu stellen ersetzt nicht, denselben Charakter über mehrere Spielzüge hinweg anzuhören.
Ein praktisches erstes Abenteuer
Wähle eine kurze Playworlds-Szene, höre die aktuell angebotenen Stimmen vor und stimme Erzählung und Musik aufeinander ab. Achte darauf, ob du die sprechende Person erkennst, den wichtigen Namen verstehst und am Ende der Zeile bereit bist zu handeln. Diese Fragen sind bei jedem Sprachmodell hilfreich.
Wenn du unabhängig davon mit ElevenLabs experimentierst, verwende eine eigene Szene und vergleiche mehrere Aufnahmen. Die Beispiele dieser Reihe sind Hörübungen und Gestaltungsvorschläge, keine aufgezeichneten Ergebnisse aus dem Spielen mit v4. Die Quellen und die Playworlds-Implementierung wurden am 3. Oktober 2026 geprüft.