AI 음성 모델
ElevenLabs v4: 새로운 음성 모델이 AI RPG에 더할 수 있는 것
Eleven v4와 v4 Turbo를 소개하고, 표현력 있는 음성이 Playworlds의 내레이션과 캐릭터 목소리, 기억에 남는 모험에 무엇을 더할 수 있을지 살펴봅니다.

같은 말도 장면을 바꿀 수 있습니다
“돌아왔구나.” 안도하는 동료, 의심하는 경비병, 부상당한 경쟁자는 같은 말을 전혀 다른 뜻으로 건넬 수 있습니다. AI 롤플레잉 게임에서는 그 말투가 다음 행동을 정하기 전에 상대와의 관계를 이해하도록 도와줍니다.
ElevenLabs는 2026년 9월 28일 Eleven v4와 Eleven v4 Turbo를 발표했습니다. 이 글은 새 모델을 Playworlds의 음성 기능과 연결해 소개합니다. 10월 3일 코드를 검토한 결과, 현재 음성 처리에는 Fish Audio가 사용되고 있었습니다. Eleven v4는 검토해 볼 후보이며, Playworlds 도입을 발표하는 것은 아닙니다.
두 가지 버전 살펴보기
ElevenLabs는 v4를 음성 콘텐츠 제작용으로, v4 Turbo를 대화용으로 제시합니다. 공식 모델 카탈로그에 따르면 두 모델 모두 90개 이상의 언어를 지원하며, 표준 v4의 생성 한도는 10,000자입니다. 이는 제공업체의 사양이며, Playworlds 플레이 중에 측정한 수치는 아닙니다.
게임에서는 장면이 어떤 역할을 하는지 구분하는 것이 유용합니다. 챕터 도입부에는 공들인 연기를 충분히 들려줄 여유가 있습니다. 짧은 질문에 답하는 경비병은 플레이어가 다음 행동을 할 틈을 남겨야 합니다. 요청 한도가 커졌다고 해서 대사까지 길어질 필요는 없습니다.
표현력은 연기의 방향을 정하는 수단입니다
오디오 태그를 사용하면 작가는 대본 안에서 말하는 방식을 제안할 수 있습니다. 직접 만든 예시로는 “[whispering] 등불을 가려. 다리를 감시하고 있어.”가 있습니다. 태그는 연기의 방향을 정하고, 실제로 말하는 문장은 경고를 전달합니다. ElevenLabs는 v4가 태그 지시를 더 잘 따른다고 설명하지만, 문서에서는 결과가 여전히 완벽하지 않다는 점도 인정합니다.
RPG에 도움이 되는 목소리는 경고를 한 번에 이해할 수 있게 해주는 목소리입니다. 속삭임 때문에 단서가 들리지 않거나 모든 문장이 겁먹은 듯 들린다면, 표현을 더한 것이 오히려 플레이를 어렵게 만든 셈입니다. 먼저 대사마다 분명한 의도 하나를 정하고, 연출을 더하기 전에 의미가 전달되는지 들어보세요.
현재 Playworlds와 만나는 지점
Playworlds에는 이미 내레이터와 등장인물의 목소리를 활용할 자리가 마련되어 있습니다. 현재 코드는 스트리밍 내레이션, GM과 캐릭터 음성 선택, 미리 듣기, 음성과 음악의 개별 볼륨 조절을 지원합니다. 이러한 기능은 새로운 음성 모델이 맡을 일을 구체적으로 보여줍니다. 누가 말하는지, 무엇이 중요한지 플레이어가 쉽게 파악하도록 돕는 것입니다.
음성 모델은 텍스트를 연기합니다. 설득이 성공했는지 판정하거나, 숨겨진 퀘스트 조건을 기억하거나, 게임 마스터를 대신하지는 않습니다. 설득력 있는 말투는 게임에서 확정된 장면을 표현하되, 캐릭터의 다음 행동은 플레이어가 선택하도록 남겨두어야 합니다.
극적인 표현만큼 일관성도 들어보세요
해 질 무렵 뱃사공을 만난 뒤, 강을 건너지 못하고 돌아오는 상황을 떠올려 보세요. 그의 기분은 달라졌더라도 여전히 알아볼 수 있는 같은 사람의 목소리여야 합니다. 저희가 제안하는 청취 테스트는 인사, 경고, 재회의 대사를 사용해 감정이 달라져도 같은 인물로 들리는지 확인합니다.
v4 문서에 따르면 음성 설정은 Stability와 Similarity 두 가지이며, Style 및 Speed 슬라이더와 SSML은 지원하지 않습니다. 따라서 기존 음성 작업 흐름과 실제로 호환되는지 검토해야 합니다. 설정값을 올리는 것만으로는 여러 턴에 걸쳐 같은 캐릭터의 목소리를 들어보는 과정을 대신할 수 없습니다.
짧은 모험으로 시작하기
Playworlds에서 짧은 장면을 고르고, 현재 제공되는 목소리를 미리 들어본 뒤 내레이션과 음악의 볼륨을 조절해 보세요. 누가 말하는지 알아볼 수 있는지, 중요한 이름을 알아듣는지, 대사가 끝나면 행동할 준비가 되는지 살펴보세요. 어떤 음성 모델을 사용하든 유용한 질문입니다.
ElevenLabs를 별도로 시험한다면 직접 만든 장면을 사용하고 여러 번 생성해 비교하세요. 이 시리즈의 예시는 청취 연습과 설계 제안이며, 녹음된 v4 게임플레이 결과가 아닙니다. 자료와 Playworlds 구현은 2026년 10월 3일에 검토했습니다.