Ir al contenido

Modelos de voz con IA

ElevenLabs v4: lo que el nuevo modelo de voz podría aportar a los juegos de rol con IA

Conoce Eleven v4 y v4 Turbo y descubre lo que una voz expresiva podría aportar a la narración, las voces de los personajes y las aventuras memorables de Playworlds.

Por Playworlds · Elser.AI ·

Un aventurero con capa sigue un camino de piedra hacia un portal luminoso entre montañas con niebla.

Las mismas palabras pueden cambiar una escena

«Has vuelto». Un compañero aliviado, un guardia receloso y un rival herido pueden decir esas palabras con intenciones completamente distintas. En un juego de rol con IA, esa interpretación te ayuda a entender una relación antes de decidir qué hacer a continuación.

ElevenLabs anunció Eleven v4 y Eleven v4 Turbo el 28 de septiembre de 2026. Esta introducción relaciona el lanzamiento con las funciones de voz de Playworlds. Nuestra revisión del código del 3 de octubre constató que Fish Audio alimenta el sistema de voz actual; Eleven v4 es un candidato que explorar, no una integración anunciada de Playworlds.

Conoce las dos versiones

ElevenLabs orienta v4 a la producción de voz y v4 Turbo a las conversaciones interactivas. Su catálogo de modelos indica más de 90 idiomas compatibles para ambos y un límite de generación de 10.000 caracteres para v4 estándar. Son especificaciones del proveedor, no mediciones de una sesión de Playworlds.

En un juego, la distinción útil es la función de la escena. El inicio de un capítulo puede dar espacio a una interpretación pausada e intencionada. Un guardia que responde a una pregunta breve debe dejar sitio a tu siguiente movimiento. Un límite más amplio por solicitud no debería convertirse en una excusa para alargar los discursos.

La expresividad permite dirigir una interpretación

Las etiquetas de audio permiten que quien escribe sugiera una forma de hablar dentro del guion. Un ejemplo original sería: «[whispering] Mantén la linterna tapada. El puente está vigilado». La etiqueta da una indicación interpretativa; las palabras pronunciadas transmiten la advertencia. ElevenLabs afirma que v4 sigue mejor las etiquetas, aunque su documentación reconoce que los resultados siguen siendo imperfectos.

Una voz útil para el rol permite entender la advertencia a la primera. Si el susurro oculta la pista o cada frase suena aterrorizada, una mayor expresividad ha hecho que la escena sea más difícil de jugar. Empieza con una intención clara por línea y escucha si se entiende el significado antes de añadir adornos.

Cómo encaja esto en el Playworlds actual

Playworlds ya tiene espacio para una voz narradora y un reparto: el código actual admite narración transmitida por segmentos, selección de voces para el director de juego y los personajes, muestras de voz y controles de volumen independientes para voz y música. Estas funciones dan a un nuevo modelo de voz una tarea concreta: ayudar a los jugadores a seguir quién habla y qué importa.

El modelo de voz interpreta texto. No decide si tu intento de persuasión ha tenido éxito, no recuerda una condición oculta de una misión ni sustituye al director de juego. Una interpretación convincente debe expresar la escena que el juego ha resuelto y dejar en tus manos la siguiente acción de tu personaje.

Escucha la continuidad, además del dramatismo

Imagina que conoces a un barquero al atardecer y regresas tras una travesía fallida. Su estado de ánimo puede cambiar, pero debería seguir sonando como alguien que reconoces. Nuestra propuesta de prueba de escucha utiliza un saludo, una advertencia y un reencuentro para comprobar la identidad a través de distintas emociones.

La documentación de v4 indica que Stability y Similarity son sus dos ajustes de voz; no admite los controles de Style y Speed ni SSML. Por tanto, los flujos de trabajo de voz existentes necesitan una revisión real de compatibilidad. Subir un ajuste no sustituye a escuchar al mismo personaje durante varios turnos.

Una primera aventura práctica

Elige una escena breve de Playworlds, escucha las muestras de las voces disponibles y equilibra la narración con la música. Fíjate en si reconoces a quien habla, entiendes el nombre importante y te sientes listo para actuar cuando termina la frase. Son preguntas útiles con cualquier modelo de voz.

Si experimentas por separado con ElevenLabs, utiliza una escena original y compara varias tomas. Los ejemplos de esta serie son ejercicios de escucha y propuestas de diseño, no resultados grabados de partidas con v4. Las fuentes y la implementación de Playworlds se revisaron el 3 de octubre de 2026.