본문으로 이동

AI 게임 마스터 연구

역할극을 위한 AI 게임 마스터 비교법

생생한 장면 하나를 벤치마크로 오해하지 않으면서, 플레이어의 결정권, 이야기의 연속성, 규칙, 속도, 비용을 기준으로 AI 게임 마스터를 반복해서 비교하는 방법을 알아보세요.

작성 Playworlds · Elser.AI ·

펼쳐진 일지에서 황금빛 길이 성과 산, 달빛 아래 유적으로 이어집니다.

좋은 비교는 게임의 한 턴에서 시작합니다

어떤 AI 모델이 최고의 게임 마스터일까요? 극적인 문단 하나만으로는 답할 수 없습니다. RPG의 한 턴은 응답이 플레이어가 시도한 행동을 따르고, 이미 확립된 사실을 지키며, 규칙을 적용하고, 의미 있는 다음 선택지를 남길 때 성공합니다. 어떤 모델은 매력적인 문장을 쓰면서도 비밀을 너무 일찍 드러내거나 플레이어 캐릭터의 행동을 대신 결정할 수 있습니다. 다른 모델은 간결하면서도 장면 전체의 맥락을 지킬 수 있습니다.

이 글은 순위표가 아니라 테스트 계획입니다. 아래의 축제 장면은 설명을 위해 새로 만든 예시이며, Playworlds에서 통제된 모델 벤치마크를 수행한 결과가 아닙니다. 이 글이 인용한 자료에 따르면 OpenAI, Anthropic, Google은 프롬프트와 추론 설정에 관해 서로 다른 지침을 제시합니다. 공정하게 비교하려면 모든 모델을 같은 인터페이스로 취급하기보다 각 설정을 기록해야 합니다.

여러 실패 유형을 드러내는 장면을 사용하세요

가면 축제에서 플레이어가 고장 난 태엽 열쇠를 들고 있다고 상상해 보세요. 플레이어는 증거 없이 길드 관리자를 비난하지 않겠다고 형제자매에게 약속했고, 시계 장인이 그 장치를 개조했다고 의심합니다. 시계 장인은 교체된 스프링을 발견했지만 누가 그 작업을 의뢰했는지는 모릅니다. 플레이어는 열쇠의 손상된 절반만 보여 주며 스프링에 관해 묻습니다. 이 장면은 응답이 질문에 답하고, 시계 장인의 제한된 지식을 지키고, 약속을 기억하며, 플레이어에게 비난을 강요하지 않는지 확인하는 데 쓰입니다.

여러 장면을 준비하세요. 이 장면을 열 번 반복해서는 충분하지 않습니다. 일상적인 대화, 주사위 판정이 필요한 불확실한 행동, 소지품 제약, 이전 세션의 단서, 결과가 큰 선택을 포함하세요. 각 모델에는 플레이어에게 보이는 상황과 권위 있는 확정 사실을 똑같이 제공하세요. 애플리케이션이 NPC에게 숨겨진 사실을 알리기로 의도한 경우가 아니라면, 그 사실을 NPC 설정 요약에서 제외하세요.

응답을 생성하기 전에 예상되는 제약을 기록하세요. 이 장면에서는 시계 장인이 교체된 스프링을 알아볼 수 있지만 의뢰인의 이름은 말할 수 없고, 형제자매와의 약속은 여전히 유효하며, 플레이어는 아직 누구를 비난할지 결정하지 않았습니다. 두 응답의 문체가 완전히 달라도 검토자는 이 항목을 기준으로 확인할 수 있습니다.

서로 다른 두 가지 비교를 진행하세요

먼저 프롬프트의 이식성을 테스트하세요. 각 모델에 같은 간결한 장면 설명과 같은 출력 요청을 제공하세요. 이는 기존 게임 마스터 프롬프트를 새 모델로 옮기면 어떻게 되는지 확인하는 테스트입니다. 어려움을 겪는 모델에만 추가 힌트를 몰래 넣지 마세요. 공통 프롬프트 자체가 이 테스트의 조건입니다.

그다음에는 최적화된 작업 흐름을 테스트하세요. 같은 게임플레이 목표를 위해 각 모델의 문서화된 설정과 지침을 조정하세요. 이는 실제 운영에 적합한 통합이 무엇을 해낼 수 있는지를 묻는 별도의 테스트입니다. 모든 변경 사항을 기록하세요. 한 모델은 구조화된 결정 단계를 거치고 다른 모델은 일반적인 서술 요청만 받았다면, 두 작업 흐름이 다르다고 밝혀야 합니다. 두 비교 모두 유용하지만, 결과를 설명 없이 합쳐 하나의 승자를 발표하면 오해를 부릅니다.

메모에는 실제 API 모델 식별자, 날짜, 프롬프트 버전, 컨텍스트, 도구 정의, 출력 한도, 추론 강도 설정을 기록하세요. 일반 사용자용 채팅, 코딩 어시스턴트, 게이트웨이 경로, 제공사의 공식 API 요청은 제어 옵션과 숨겨진 컨텍스트가 다를 수 있습니다. 응답을 비교하기 전에 어떤 인터페이스를 썼는지 명시하세요.

플레이어가 체감할 수 있는 항목을 평가하세요

각 턴을 다섯 가지 질문으로 검토하세요. 플레이어가 시도한 행동에 응답했나요? 확립된 사실과 NPC의 지식을 정확히 유지했나요? 기록된 주사위 판정이나 규칙 결과를 따랐나요? 플레이어의 감정과 다음 행동을 플레이어에게 맡겼나요? 명확한 다음 결정을 제시했나요? 실패한 경우 짧은 이유와 문제를 일으킨 정확한 문장을 기록하세요. 다섯 항목을 '글을 잘 썼다'는 하나의 인상으로 뭉뚱그리지 마세요.

작은 탐색적 테스트라면 각 장면을 여러 번 실행하고 성공과 실패를 모두 보관하세요. 검토자마다 문체에 대한 의견이 다를 수 있으므로 먼저 객관적인 제약을 정하고 분위기는 별도로 평가하세요. 모델 이름을 모르는 세 번째 검토자가 의견이 갈린 사례를 판정할 수 있습니다. 이는 제안하는 방법일 뿐, 여기서 언급한 표본 크기로 통계적 우월성을 증명했다는 뜻이 아닙니다.

행동 제출부터 유용한 결과가 나올 때까지의 대기 시간을 측정하세요. 모델 호출 하나에 걸린 시간만 재서는 안 됩니다. 게임이 상태를 조회하거나 주사위 판정을 해결하거나 출력을 검증하거나 음성을 생성한다면, 이 단계들도 플레이어의 대기 시간에 영향을 줍니다. 재시도, 대체 처리, 사람이 직접 수정한 경우도 기록하세요. 가장 짧은 응답이 플레이 가능한 다음 턴까지 가장 빨리 이어진다는 보장은 없습니다.

완료된 턴과 그 비용을 함께 세세요

유용한 비용 지표는 모든 시도에 걸쳐 제공사에 지불한 총비용을 성공적으로 완료된 턴 수로 나눈 값입니다. 한 작업 흐름이 100번 시도하며 $2를 지출하고 사용 가능한 턴 80개를 완료했다고 가정해 보세요. 성공한 턴당 비용은 $0.025입니다. 다른 작업 흐름은 총 $1.50만 지출했어도 50턴을 완료했다면 성공한 턴당 비용이 $0.03입니다. 이 숫자는 계산법을 보여 주기 위해 임의로 만든 예시이며, Playworlds의 가격이나 측정 결과가 아닙니다.

비율과 함께 실제로 완료된 턴 수도 보고하세요. 해당한다면 캐시 읽기와 쓰기, 추가 추론 토큰, 보조 호출, 재시도, 음성 비용도 포함하세요. 캐시된 입력에 할인이 적용된다고 해서 모험 전체의 비용이 같은 비율로 줄어드는 것은 아닙니다. 제공사 사용 비용과 게임이 플레이어에게 표시하는 크레딧이나 가격은 구분하세요.

결론은 구체적인 작업에 대한 선택이어야 합니다. 예를 들어 한 모델은 범위가 좁은 NPC 답변을 처리하고, 다른 모델은 복잡한 퀘스트의 결과를 다루는지 테스트할 수 있습니다. 종합 순위표의 순위가 자신의 장면에서도 성능을 예측한다고 단정하지 마세요. 모델, 프롬프트, 게임 규칙에 의미 있는 변화가 생기면 다시 테스트하세요.

직접 플레이하며 다음 선택지를 살펴보세요

플레이어는 모험이 단서를 반영하고 결정을 내릴 여지를 남기는지 알아보기 위해 API 로그를 볼 필요가 없습니다. 세계를 선택하고 캐릭터에게 당장의 목표 하나를 정한 뒤, 대화를 하고 결과가 불확실한 행동을 시도해 보세요. 나중에 돌아와 이야기의 현재 상황을 이해할 수 있는지 확인하세요. 이는 표시된 모델 이름과 관계없이 모든 AI RPG에 유용한 질문입니다.

Playworlds는 세계, 캐릭터 시트, 주사위, AI 서술을 이 흐름에 담습니다. 사용 가능한 모델은 설정에 따라 달라질 수 있으며, 이 글은 새로운 비교 결과나 특정 모델의 도입을 주장하지 않습니다. 이 평가 기준은 실제로 경험한 내용을 살피는 방법이자, 향후 통합을 검토할 때 저희 팀이 활용할 수 있는 방법입니다.