Letra estilo YuE2 (tal como se genera)
[Verse 1] [Male Vocals] (saxophone) City lights fading in the rearview (Forever!) [Chorus] We run all night
Guía de subtítulos para canciones con IA
Por Yana Li
Si generaste una canción con YuE2, ya tienes los dos insumos que necesita un lyric video: la letra que escribiste y el audio que produjo el modelo. Lo que falta es el timing: convertir esa letra conocida en líneas de subtítulos que caigan sobre las palabras cantadas. Esta guía cubre el camino completo: limpiar los marcadores de interpretación del generador, alinear letra y audio con la opción de canción activada, revisar los controles de calidad y exportar SRT, VTT, SBV, ASS o JSON.
Letra estilo YuE2 (tal como se genera)
[Verse 1] [Male Vocals] (saxophone) City lights fading in the rearview (Forever!) [Chorus] We run all night
Guion limpio y líneas con tiempo
1 00:00:03,120 --> 00:00:07,480 City lights fading in the rearview 2 00:00:07,900 --> 00:00:11,240 We run all night
Lo que se quita y lo que se queda
"[Male Vocals] (saxophone)" es un marcador de interpretación que nadie canta, así que se elimina antes del timing. "(Forever!)" sí se canta, así que permanece en la letra. Nada se elimina en silencio: la vista previa lista cada línea eliminada antes de enviar, y puedes enviar el texto original en su lugar.
Puntos de decisión
YuE2 recibe una letra estructurada —versos, estribillos e indicaciones de interpretación— más ajustes de estilo, y devuelve audio terminado. Tu letra es la fuente de verdad de las palabras: las escribiste tú y el modelo las cantó. La tarea no es transcribir (adivinar palabras desde el audio) sino alinear (poner palabras conocidas en la línea de tiempo del audio). Ese es exactamente el flujo de guion más audio: conserva tu redacción aprobada en lugar de reemplazarla por lo que un reconocedor crea escuchar.
Las letras escritas para modelos de generación de canciones están llenas de líneas enteras de marcadores de interpretación e instrumentos: "[Male Vocals]", "(saxophone) (brass) (guitar)", "[Vocal ad-libs]", "(电吉他)", "【副歌】", "[主歌1]". En las 99 letras públicas de ejemplo de YuE2, líneas así aparecen sin parar — y nunca se cantan. Dejadas en el guion, se convierten en líneas de subtítulos que nunca coincidirán con el audio. La trampa tiene otra mitad: las líneas entre paréntesis que SÍ se cantan, como "(I'm so good)", "(Forever!)" o las llamadas de coro, deben quedarse. Un limpiador que solo mira corchetes borra letra real; uno que no borra nada deja líneas imposibles en cada archivo exportado.
Guarda tu letra final como texto plano: una línea cantada por línea, con las etiquetas de sección en su propia línea. Guarda el audio generado como MP3 o WAV. En un proyecto de guion + audio, pega o sube la letra, sube el audio de la canción y activa la opción "Es una canción". La vista previa previa al envío lista línea por línea los marcadores que se van a ordenar — etiquetas de sección, marcadores de interpretación y marcadores de repetición — antes de enviar nada. Tras el procesamiento, revisa el resumen de calidad y los problemas reportados, y exporta SRT para editores, VTT o SBV para plataformas, ASS para lyric videos con estilo, o JSON para herramientas propias.
La regla es simple: una línea se elimina solo si todos sus grupos entre corchetes son marcadores reconocidos de interpretación, instrumento o sección — y si un solo grupo contiene una palabra no reconocida, la línea se conserva entera. Las eliminaciones se cuentan y se muestran línea por línea antes de enviar; el guion limpio es el que se guarda y se alinea; y con un clic puedes enviar tu texto original. "[Verse 1]" se elimina; "(Forever!)" no se toca.
Los prompts de YuE2 son un oficio aparte, y la documentación oficial lo explica mucho mejor de lo que debería hacerlo una herramienta de subtítulos: la página oficial del proyecto YuE2 tiene los ejemplos que esta guía referencia, y el repositorio de YuE2 documenta el formato de letra y los ajustes de generación. Tres hábitos ayudan al modelo y al alineador: etiquetas de sección en su propia línea; repeticiones escritas línea por línea en vez de "×2" (la abreviatura se ordena, no se expande — si el estribillo se canta dos veces, escríbelo dos veces); y coros entre paréntesis que de verdad se cantan.
Las exportaciones cubren SRT, VTT, SBV, ASS, JSON y un transcript TXT, empaquetados juntos en un único ZIP con su manifiesto y un readme. SRT y VTT cubren casi todos los editores y plataformas; ASS lleva fuentes y posicionamiento para lyric videos con estilo; JSON da estructura a nivel de palabra para herramientas propias. El producto no exporta LRC; si tu reproductor necesita LRC, conviértela desde el SRT con cualquier convertidor estándar.
Cantar es más difícil de alinear que hablar, y la confianza varía según la mezcla y el idioma. Cuando los controles no pueden establecer un timing fiable, el proyecto reporta el problema y libera el intento en lugar de entregar un timing silenciosamente equivocado — trata la lista de problemas como parte del entregable. Las canciones en chino con la voz al frente ahora se anclan bien: una canción de ejemplo de YuE2 en chino se entregó como archivo de timing preciso en una verificación de producción, con cerca de tres cuartos de sus líneas ancladas a las palabras cantadas. Las mezclas muy producidas donde los instrumentos tapan la voz aún pueden fallar los controles — esas canciones se devuelven con el motivo en lugar de entregarse con un timing poco fiable. Cualquier entrega es una comprobación de flujo, no una garantía de precisión por canción.
Importa el SRT exportado en tu editor o herramienta de lyric videos, define el estilo una vez, y cada línea cae donde la canción la canta. CapCut, Premiere, Resolve y la mayoría de las plataformas aceptan SRT directamente; la guía del flujo en CapCut cubre el recorrido en detalle. Guarda también el JSON exportado — la estructura a nivel de palabra abarata reestilos y traducciones futuras.
Flujo práctico
Exporta tu letra final como texto plano: una línea cantada por línea, etiquetas de sección en su propia línea, repeticiones escritas en vez de "×2".
Guarda el audio generado de la canción como MP3 o WAV.
Crea un proyecto de guion + audio, pega o sube la letra, sube el audio y activa la opción "Es una canción".
Abre la vista previa de limpieza: revisa línea por línea los marcadores listados y elige "Usar el texto original" si algo que cantas aparece en la lista de eliminados.
Cuando termine el procesamiento, lee el resumen de calidad y la lista de problemas antes de confiar en el timing.
Exporta SRT, VTT, SBV, ASS o JSON e impórtalo en tu editor o herramienta de lyric videos.
Límite del producto
Esta guía cubre convertir una letra existente más el audio generado de una canción en archivos de subtítulos. No cubre generar música, los prompts de YuE2 en detalle ni la distribución de canciones generadas; para esos temas usa los recursos oficiales de YuE2. La precisión del timing en voces cantadas varía; los controles de calidad y las listas de problemas son parte del entregable, no una garantía.
Fuentes oficiales consultadas
Referencias oficiales revisadas: 2026-09-28
Guías y herramientas relacionadas
FAQ
No. TimedSubs trabaja después de la generación: toma la letra y el audio que ya tienes y produce archivos de subtítulos verificados. Para el uso del modelo, prompts y descargas, usa la página oficial del proyecto YuE2 y su repositorio.
SRT, VTT, SBV, ASS, JSON y TXT. SRT y VTT los aceptan casi todos los editores y plataformas; ASS admite lyric videos con estilo; JSON conserva estructura a nivel de palabra. LRC no es un formato de exportación — convierte desde SRT si tu reproductor lo requiere.
No. La abreviatura de repetición se ordena fuera del guion, no se expande en más líneas. Si el estribillo se canta dos veces, escríbelo dos veces para que cada línea cantada tenga su propia entrada de subtítulo.
Solo si la línea entera consiste en marcadores reconocidos de interpretación, instrumento o sección. Los coros cantados como "(ooh)" o "(Forever!)" se quedan, porque ninguna palabra coincide con el vocabulario de marcadores. Cada eliminación se muestra en la vista previa y puedes enviar el texto original en su lugar.
Con mezclas donde la voz va al frente, sí: una canción de ejemplo de YuE2 en chino se entregó como timing preciso en una verificación de producción, con cerca de tres cuartos de sus líneas ancladas al canto. Las mezclas muy producidas pueden ser rechazadas por los controles de entrega en vez de entregarse con un timing poco fiable.
El guion limpio — sin etiquetas de sección ni marcadores de interpretación — es el que se guarda y se alinea, y la vista previa muestra cada eliminación por adelantado. Tu texto original permanece en el editor y puede enviarse en su lugar con un clic.
Guías relacionadas
Ver todas las guíasGuía de flujo
Prepara SRT/VTT para YouTube desde guion aprobado y voz final sin depender de texto reescrito por auto captions.
Guía texto a SRT
Aprende a convertir texto o TXT en un borrador SRT válido con tiempos estimados y cuándo usar el audio correspondiente para sincronización precisa.
Guía de flujo
Prepara SRT/VTT con revisión de calidad antes de importar a CapCut o Jianying.