本文へ移動

音声モデルの比較

ElevenLabs v4・v3・Fish Audioを比較:AI RPGの声をどう選ぶか

Eleven v4、v4 Turbo、v3、PlayworldsのFish Audio音声処理を、表現力、応答性、一貫性、実践的な聞き比べの観点から比較します。

著者 Playworlds · Elser.AI ·

マント姿の冒険者が霧の山々に囲まれた光る門へ石畳の道を進む。

印象的な音声1本ではなく、冒険全体で比べる

美しい独白だけでは、ゲームで使ったときの声の扱いにくさが見えないことがあります。同じモデルには、クエストアイテムの名前を読み上げ、短い質問に答え、キャラクターが動揺しても同じ人物として聞こえることが求められます。この比較は、万能の勝者を決めるのではなく、そうしたプレイヤーの体験を出発点にします。

ElevenLabsの公式資料とPlayworldsの実装は、2026年10月3日に確認しました。条件を揃えた音声ベンチマークは実施していません。Playworldsの音声は現在、モデル識別子s2.1-proを指定してFish Audioへ送られています。以下のElevenLabsモデルは、評価対象となる別の候補です。

Eleven v4とEleven v3の違い

公式カタログでは、v4は90以上の言語と1回あたり10,000文字、v3は70以上の言語と5,000文字に対応するとされています。ElevenLabsは、v4では声の再現精度と表現力が向上したと説明していますが、同社のガイドでも、切り替える前に使い慣れた声を比較することを勧めています。

これは、すでに続いているキャンペーンでは特に大切です。参照音声をより忠実に再現できても、プレイヤーが親しんできた仲間とは違う声に聞こえるかもしれません。保存してある挨拶と、感情のこもった再会の場面を比較し、新しい演技でも意図したキャラクター像が保たれているかを判断しましょう。

標準のv4とv4 Turboの違い

標準のv4は品質を重視した制作向け、Turboはリアルタイムのやり取り向けです。ElevenLabsはTurboについて、推論遅延の中央値がおよそ100 ms、最初の音声が出るまでの時間の中央値が150 msと報告しています。発表時の計測ではネットワーク遅延を除いているため、これらの数値はプレイヤーがクリックしてから音声を聞くまでの時間ではありません。

発見の場面を語るナレーションなら、まず標準のv4を試聴するとよいでしょう。NPCとの短いやり取りなら、Turboも比較に加えます。プレイヤーが行動を送信してからの待ち時間全体を、ゲームマスターのテキスト生成、音声の配信、再生まで含めて計測してください。音声サービスが速くても、ターン全体は遅いままということがあります。

この比較におけるFish Audioの位置づけ

Playworldsの現在のコードで選ばれている音声プロバイダーだからこそ、Fish Audioが比較の基準になります。声の割り当て、試聴、ストリーミング、再生は、すでに一連の連携として組み込まれています。プロバイダーを変更する場合は、声の響きだけでなく、これらのゲーム機能も対象になります。

ここでは、Fishのすべてのリリースを同じものとして評価するわけではありません。Fishの公開S2資料には表現豊かな音声についての説明がありますが、Playworldsのアダプターが指定しているのはs2.1-proです。今後のテストでも実際に設定されているそのモデルを使い、別のモデルで宣伝されている結果を当てはめないようにしましょう。

少人数のパーティーで行う公平な聞き比べ

オリジナルの台詞を5つ用意します。挨拶、ささやく警告、聞き慣れない地名、2人の意見の対立、落ち着いた振り返りです。実際に話す言葉と演技の意図は揃えてください。対応しており、利用が許可されている場合は、同じ参照録音を使います。それができなければ、声の割り当ての違いを記録します。

音声の順番を無作為にし、聞き手に、どの言葉を聞き取れたか、どのキャラクターだとわかったか、感情が場面に合っていたかを尋ねましょう。複数回の生成結果、失敗、待ち時間全体、課金対象の使用量を記録します。たまたまうまくいった1回の生成料金ではなく、再試行を含め、採用できた場面あたりの費用を比較してください。このテストはまだ実施していないため、ここで勝者を示すことはしません。

自分の遊び方に合わせて選ぶ

編集上の提案としては、重要なナレーションにはv4を試聴し、テンポの速いやり取りにはTurboも加え、現在のFishとの連携を比較基準として残すことを勧めます。これらは評価のために提案する役割です。Playworldsの設定画面にこれらのモデルを追加すると発表しているわけではありません。

プレイヤーは、まず冒険で現在利用できる声を選び、1つの場面を最後まで聞いてみてください。制作者は、明瞭さ、一貫性、テンポが揃って改善することを、モデルを変更する条件にしましょう。よりよい声とは、デモをもう一度再生したくなるだけでなく、そのキャラクターに返事をしたくなる声です。