Investigación sobre directores de juego con IA
Cómo comparar directores de juego con IA para juegos de rol
Compara directores de juego con IA en decisiones del jugador, continuidad, reglas, velocidad y costo sin confundir una escena con una prueba controlada.

Una buena comparación comienza por el turno del juego
¿Qué modelo de IA hace el mejor director de juego? Un solo párrafo dramático no puede responder esa pregunta. Un turno en un RPG tiene éxito cuando la respuesta sigue el intento del jugador, respeta los hechos establecidos, aplica las reglas y deja una elección significativa para el siguiente paso. Un modelo puede escribir prosa hermosa mientras revela un secreto demasiado pronto o decide qué hace el personaje del jugador. Otro puede ser breve y aun así preservar toda la escena.
Esta guía es un plan de pruebas, no una clasificación. El encuentro del festival que aparece abajo es un escenario ilustrativo original; no lo hemos ejecutado como prueba comparativa controlada de modelos en Playworlds. La investigación detrás de este artículo muestra que OpenAI, Anthropic y Google recomiendan distintas formas de redactar prompts y configurar el razonamiento. Una comparación justa registra esas configuraciones en lugar de tratar cada modelo como si fuera la misma interfaz.
Usa una escena con varias formas de fallar
Imagina un festival enmascarado donde el jugador lleva una llave de mecanismo de relojería rota. El jugador prometió a uno de sus hermanos no acusar al administrador del gremio sin pruebas y sospecha que un relojero alteró el mecanismo de la llave. El relojero notó un resorte de reemplazo, pero no sabe quién encargó el trabajo. El jugador pregunta por el resorte mostrando solo la mitad dañada de la llave. Esta escena prueba si una respuesta responde a la pregunta, respeta el conocimiento limitado del relojero, recuerda la promesa y evita forzar una acusación.
Prepara varias escenas, no diez copias de esta. Incluye una conversación ordinaria, una acción incierta que requiere una tirada, una restricción de inventario, una pista de una sesión anterior y una elección con consecuencias. Da a cada modelo la misma situación visible y los mismos hechos confirmados. Mantén los hechos ocultos fuera del resumen de un PNJ a menos que la aplicación permita intencionalmente que ese PNJ los sepa.
Guarda las restricciones esperadas antes de generar una respuesta. Para esta escena: el relojero puede identificar un resorte de reemplazo, no puede nombrar al cliente, la promesa hecha a uno de sus hermanos sigue activa y el jugador aún no ha elegido si acusará a alguien. Estas son verificaciones que un revisor puede aplicar incluso si dos respuestas usan textos completamente distintos.
Realiza dos comparaciones distintas
Primero prueba la portabilidad de los prompts. Da a cada modelo el mismo resumen compacto de escena y la misma salida solicitada. Esto responde a la pregunta de migración: ¿qué pasa si un prompt existente de director de juego se mueve a un nuevo modelo? No agregues en silencio una pista extra para el modelo que tiene dificultades; el prompt compartido es la condición que se está probando.
Luego prueba un flujo de trabajo optimizado. Ajusta las configuraciones e instrucciones documentadas de cada modelo para el mismo objetivo de juego. Esto responde a una pregunta diferente: ¿qué lograría una integración sensata en producción? Registra cada cambio. Si un modelo usa un paso de decisión estructurado y otro recibe una solicitud en prosa simple, declara que los flujos de trabajo difieren. Ambas comparaciones son útiles, pero combinar sus resultados en un ganador único sin explicación es engañoso.
Usa el identificador real del modelo de la API, la fecha, la versión del prompt, el contexto, las definiciones de herramientas, el límite de salida y la configuración de esfuerzo en tus notas. Una sesión de chat de uso general, un asistente de programación, una ruta de pasarela y una solicitud a la API oficial del proveedor pueden tener controles y contexto oculto diferentes. Identifica la interfaz antes de comparar respuestas.
Evalúa lo que un jugador puede notar
Revisa cada turno contra cinco preguntas: ¿Respondió a la acción intentada? ¿Mantuvo claros los hechos establecidos y el conocimiento de los PNJ? ¿Siguió el resultado registrado de la tirada o de las reglas? ¿Dejó los sentimientos y la siguiente acción del jugador en manos del jugador? ¿Creó una decisión clara para el siguiente paso? Marca los fallos con un motivo breve y la línea exacta que los causó. No colapses las cinco en una sola impresión de «buena escritura».
Para una prueba exploratoria pequeña, ejecuta cada escena varias veces y conserva los fallos además de los éxitos. Los revisores pueden discrepar sobre estilo, así que define primero restricciones objetivas y califica la atmósfera por separado. Un tercer revisor puede resolver casos disputados sin ver el nombre del modelo. Este es un método propuesto, no una afirmación de que cualquier tamaño de muestra aquí pruebe superioridad estadística.
Mide el tiempo de espera desde la acción enviada hasta un resultado útil, no solo el tiempo gastado en una llamada al modelo. Si un juego también recupera estado, resuelve dados, valida la salida o genera voz, esos pasos afectan la espera del jugador. Registra reintentos, alternativas y correcciones manuales. La respuesta más corta no es necesariamente la ruta más rápida hacia el siguiente turno jugable.
Cuenta turnos completos y luego cuenta su costo
Una medida económica útil es el gasto total del proveedor en todos los intentos dividido por el número de turnos completados con éxito. Supongamos que un flujo de trabajo gasta $2 en 100 intentos y completa 80 turnos utilizables. Su costo por turno exitoso es $0,025. Un segundo flujo de trabajo que gasta $1,50 y completa 50 turnos cuesta $0,03 por turno exitoso, a pesar de una factura total menor. Estas cifras son inventadas para demostrar el cálculo; no son precios ni mediciones de Playworlds.
Reporta la cantidad bruta de turnos completados junto con la proporción. Añade lecturas y escrituras de caché, tokens extra de razonamiento, llamadas de apoyo, reintentos y costos de voz cuando apliquen. Un descuento por entrada en caché no se traduce automáticamente en la misma reducción porcentual para toda la aventura. Mantén el uso del proveedor separado de cualquier crédito o precio que un juego muestre a los jugadores.
El resultado debe ser una decisión para un trabajo específico: quizás un modelo maneja una respuesta breve y acotada de un PNJ mientras otro se prueba para una consecuencia compleja de misión. No infieras que un puesto en una clasificación general predice el rendimiento en tus propias escenas. Vuelve a probar después de cambios significativos en modelo, prompt o reglas del juego.
Prueba el juego, luego juzga la siguiente elección
Un jugador no necesita registros de API para notar si una aventura respeta una pista o deja espacio para una decisión. Elige un mundo, dale a tu personaje un objetivo inmediato e intenta una conversación seguida de una acción incierta. Vuelve más tarde y mira si puedes entender en qué punto está la historia. Esas son preguntas útiles para cualquier RPG con IA, sin importar el nombre del modelo en la etiqueta.
Playworlds integra mundos, hojas de personaje, dados y narración con IA en ese flujo. Los modelos disponibles pueden cambiar según la configuración, y este artículo no afirma un nuevo resultado de comparación ni un despliegue de un modelo concreto. Su rúbrica es una forma de evaluar la experiencia que realmente recibes, y un método que nuestro equipo puede usar al considerar integraciones futuras.