Zum Inhalt

Sprachmodelle im Vergleich

ElevenLabs v4 im Vergleich zu v3 und Fish Audio: Die passende Stimme für ein KI-Rollenspiel

Vergleiche Eleven v4, v4 Turbo, v3 und die Fish-Audio-Sprachpipeline von Playworlds anhand von Ausdruck, Reaktionszeit, Wiedererkennbarkeit und einem praktischen Hörtest.

Von Playworlds · Elser.AI ·

Ein Abenteurer im Umhang folgt einem Steinpfad zu einem leuchtenden Tor in nebligen Bergen.

Ein Abenteuer vergleichen, nicht nur einen beeindruckenden Clip

Ein wunderschöner Monolog kann darüber hinwegtäuschen, dass eine Stimme im Spiel nicht gut funktioniert. Dasselbe Modell muss auch einen Questgegenstand aussprechen, eine kurze Frage beantworten und wiedererkennbar bleiben, wenn ein Charakter aufgebracht ist. Dieser Vergleich beginnt bei diesen Bedürfnissen der Spielenden, statt einen allgemeingültigen Sieger zu erklären.

Wir haben die offiziellen Materialien von ElevenLabs und die Playworlds-Implementierung am 3. Oktober 2026 geprüft. Einen kontrollierten Audio-Benchmark haben wir nicht durchgeführt. Playworlds leitet die Sprachausgabe derzeit über Fish Audio mit der Modellkennung s2.1-pro; die folgenden ElevenLabs-Modelle sind Alternativen für eine mögliche Evaluierung.

Eleven v4 im Vergleich zu Eleven v3

Der offizielle Katalog führt v4 mit über 90 Sprachen und 10.000 Zeichen pro Anfrage auf, v3 dagegen mit über 70 Sprachen und 5.000 Zeichen. ElevenLabs beschreibt v4 als Verbesserung bei Stimmtreue und Ausdruck, empfiehlt in den eigenen Hinweisen aber auch, vertraute Stimmen vor einem Wechsel zu vergleichen.

Das ist für eine laufende Kampagne relevant. Eine originalgetreuere Wiedergabe einer Referenzstimme kann dennoch anders klingen als der Gefährte, an den sich ein Spieler gewöhnt hat. Vergleiche eine gespeicherte Begrüßung mit einer emotionalen Rückkehrszene und entscheide, ob der neue Vortrag den von dir beabsichtigten Charakter bewahrt.

Standard-v4 im Vergleich zu v4 Turbo

Standard-v4 richtet sich an qualitätsorientierte Produktionen, Turbo an die Live-Interaktion. ElevenLabs nennt für Turbo eine mediane Inferenzlatenz von ungefähr 100 ms und eine mediane Zeit bis zur ersten Sprachausgabe von 150 ms. Bei der Messung zur Markteinführung wurde die Netzwerklatenz herausgerechnet; diese Zahlen entsprechen daher nicht der Zeit vom Klick eines Spielers bis zum hörbaren Ton.

Probiere bei einer erzählten Entdeckung zuerst Standard-v4 aus. Nimm für einen schnellen Austausch mit einem NSC auch Turbo in den Vergleich auf. Miss die gesamte Wartezeit nach dem Absenden einer Spieleraktion, einschließlich der Texterzeugung durch die Spielleitung, der Audioübertragung und der Wiedergabe. Ein schneller Sprachdienst kann trotzdem Teil eines langsamen Spielzugs sein.

Welche Rolle Fish Audio in diesem Vergleich spielt

Fish Audio ist der relevante Ausgangspunkt, weil dieser Sprachanbieter im aktuellen Playworlds-Code ausgewählt ist. Die bestehende Stimmenbesetzung, Hörproben, Streaming und Wiedergabe bilden bereits eine funktionierende Integration. Ein Wechsel des Anbieters beträfe neben dem Klang einer Stimme auch diese Spielfunktionen.

Dieser Vergleich behandelt nicht jede Fish-Veröffentlichung als gleichwertig. Die öffentlichen S2-Materialien von Fish beschreiben ausdrucksstarke Sprache, während der Playworlds-Adapter ausdrücklich s2.1-pro nennt. Verwende bei einem künftigen Test genau dieses konfigurierte Modell und übertrage keine beworbenen Ergebnisse eines anderen Modells darauf.

Ein fairer Hörtest für eine kleine Gruppe

Bereite fünf eigene Zeilen vor: eine Begrüßung, eine geflüsterte Warnung, einen unbekannten Ortsnamen, einen Streit zwischen zwei Sprechenden und eine ruhige Zusammenfassung. Halte die gesprochenen Worte und die beabsichtigte Sprechweise konstant. Verwende dieselbe Referenzaufnahme, sofern dies unterstützt wird und zulässig ist; dokumentiere andernfalls die Unterschiede bei der Stimmenbesetzung.

Spiele die Clips in zufälliger Reihenfolge ab und frage die Zuhörenden, welche Worte sie verstanden, welchen Charakter sie erkannt haben und ob die Emotion passte. Erfasse mehrere Aufnahmen, Fehlschläge, die gesamte Wartezeit und die abgerechnete Nutzung. Vergleiche die Kosten pro akzeptierter Szene einschließlich Wiederholungen, statt nur einen zufällig gelungenen Generierungsversuch zu bepreisen. Hier wird kein Sieger genannt, da dieser Test noch nicht durchgeführt wurde.

Die Wahl an deiner Spielweise ausrichten

Unsere redaktionelle Empfehlung lautet, v4 für größere Erzählpassagen anzuhören, Turbo für schnelle Wortwechsel einzubeziehen und die aktuelle Fish-Integration als Vergleichsbasis beizubehalten. Das sind vorgeschlagene Einsatzbereiche für eine Evaluierung. Wir kündigen damit keine Modelloptionen in den Playworlds-Einstellungen an.

Beginne als Spieler mit den Stimmen, die in deinem Abenteuer verfügbar sind, und höre eine vollständige Szene an. Als kreativer Kopf solltest du ein Modell daran messen, ob es Klarheit, Wiedererkennbarkeit und Tempo gemeinsam verbessert, bevor du wechselst. Eine bessere Stimme sollte Lust machen, dem Charakter zu antworten, und nicht bloß die Demo noch einmal abzuspielen.