TimedSubs
工作流指南

AI 歌曲字幕指南

YuE2 歌词转 SRT:AI 生成歌曲的歌词字幕

作者:Yana Li

用 YuE2 生成歌曲后,你手里已经有歌词视频需要的全部素材:自己写好的歌词和模型生成的音频。剩下的是时间轴——把已知歌词变成落在演唱位置上的字幕。本指南覆盖完整流程:清理生成器的演唱与乐器标记行,开启「这是一首歌」做文稿+音频对齐,查看质量摘要,最后导出 SRT、VTT、SBV、ASS 或 JSON。

YuE2 风格歌词(生成原样)

[Verse 1] [Male Vocals] (saxophone) City lights fading in the rearview (Forever!) [Chorus] We run all night

清理后的文稿与时间轴

1 00:00:03,120 --> 00:00:07,480 City lights fading in the rearview 2 00:00:07,900 --> 00:00:11,240 We run all night

删了什么、留了什么

「[Male Vocals] (saxophone)」是没人演唱的表演标记,时间轴生成前会被移除;「(Forever!)」真的会被唱出,所以保留在歌词里。任何删除都不会静默发生:提交前预览逐行列出将被移除的行,也可以改用原文提交。

决策点

为什么 YuE2 的输出本身就是字幕问题

YuE2 接收结构化歌词——主歌、副歌和演唱提示——加上风格设置,输出成品音频。歌词是你自己写的,是文字的唯一事实来源:要做的事情不是转写(从音频里猜词),而是对齐(把已知文字放到音频时间轴上)。这正是文稿+音频工作流:保住你审定的措辞,而不是被识别结果改写。

生成器的坑:整行没人唱的标记

写给歌曲生成模型的歌词里充满整行的演唱/乐器标记:"[Male Vocals]"、"(saxophone) (brass) (guitar)"、"[Vocal ad-libs]"、"(电吉他)"、"【副歌】"、"[主歌1]"。官方 99 份公开示例歌词里这类行到处都是——它们永远不会被唱出。留在文稿里,就成了永远对不上音频的字幕行。坑还有另一半:真的会被唱出的括号行,比如 "(I'm so good)"、"(Forever!)" 与和声叫喊,必须保留。只看括号就删会删掉真歌词;什么都不删则每个导出文件里都带着没人唱的行。

一步一步:从歌词加音频到可信的字幕

把最终歌词存成纯文本:一行一句,段落标记单独成行。把生成的音频存成 MP3 或 WAV。在文稿+音频项目里粘贴或上传歌词、上传歌曲音频,并打开「这是一首歌」开关。提交前的预览会逐行列出将要整理的歌词标记——段落标签、演唱标记、结尾重复标记——提交之前一切可见。处理完成后查看质量摘要和问题列表,再导出 SRT(剪辑)、VTT/SBV(平台)、ASS(样式化歌词视频)或 JSON(自定义工具)。

提交前预览会告诉你什么

清理规则很简单:只有整行每个括号组都是已识别的演唱、乐器或段落标记时才删;任何一组里有认不出的词,整行保留。删除会被计数并在提交前逐行展示,存储与对齐用的是清理后的文稿,一键即可改用原文提交。"[Verse 1]" 会被删;"(Forever!)" 不会被动。

写出模型和对齐都喜欢的歌词

YuE2 提示词是另一门手艺,官方项目文档讲得比字幕工具应该讲的好得多:官方 YuE2 项目页有本指南引用的公开示例,YuE2 仓库文档化歌词格式与生成设置。三个习惯对模型和对齐都有帮助:段落标记单独成行;重复按实际演唱逐次写出而不是「×2」(缩写会被整理而不是展开——副歌唱两次就写两次);真实演唱的括号和声保留。

可以导出哪些字幕文件

导出覆盖 SRT、VTT、SBV、ASS、JSON 和 TXT 文稿,连同清单与说明文件打包为单个 ZIP。SRT/VTT 覆盖绝大多数编辑器和平台;ASS 承载样式化歌词视频的字体与定位;JSON 提供词级结构供自定义工具使用。产品不导出 LRC;如果你的播放器需要 LRC,用标准转换器从 SRT 转换即可。

诚实边界:演唱人声与中文歌曲

演唱人声比说话更难对齐,置信度随混音和语言变化。当检查无法建立可靠时间轴时,项目会报告问题并释放本次尝试,而不是交付静默错误的时间轴——把问题列表当作交付物的一部分,而不是噪音。人声清晰的中文歌曲现在对齐良好:一首中文 YuE2 示例歌已在生产检查中作为精确时间轴交付,约四分之三的歌词行锚定到了演唱位置。重混音(器乐盖过人声)仍可能让识别失败——这类歌曲会被如实退回并说明原因,而不是交付不可靠的时间轴。任何交付都是工作流检查,不是逐首准确率保证。

从字幕文件到歌词视频

把导出的 SRT 导入剪辑器或歌词视频工具,样式设置一次,每一行都落在演唱位置上。CapCut、Premiere、Resolve 和大多数平台都直接接受 SRT;CapCut 工作流指南详细覆盖往返流程。导出的 JSON 一并保留——词级结构让日后的重排样式或翻译都便宜。

实际工作流

  1. 1

    把最终歌词导出为纯文本:一行一句,段落标记单独成行,重复按实际演唱逐次写出而不是「×2」。

  2. 2

    把生成的歌曲音频保存为 MP3 或 WAV。

  3. 3

    新建文稿+音频项目,粘贴或上传歌词,上传音频,并打开「这是一首歌」选项。

  4. 4

    打开提交前的清理预览:逐行检查列出的歌词标记,如果唱词出现在删除列表里,选择「使用原文」。

  5. 5

    处理完成后,先读质量摘要和问题列表,再决定是否信任这版时间轴。

  6. 6

    导出 SRT、VTT、SBV、ASS 或 JSON,导入你的剪辑器或歌词视频工具。

产品边界

本指南覆盖把已有歌词和生成的歌曲音频变成字幕文件。不覆盖音乐生成、YuE2 提示词细节或生成歌曲的分发,这些话题请使用官方 YuE2 资源。演唱人声的时间准确度因曲而异;质量检查和问题列表是交付物的一部分,不是保证。

用于判断工作流定位的官方参考

官方参考复查:2026-09-28

FAQ

TimedSubs 能用 YuE2 生成歌曲吗?

不能。TimedSubs 工作在生成之后:接收你已有的歌词和音频,产出经过检查的字幕文件。模型的使用、提示词和下载请使用官方 YuE2 项目页与仓库。

歌词视频可以导出哪些字幕格式?

SRT、VTT、SBV、ASS、JSON 和 TXT。SRT 和 VTT 几乎被所有编辑器与平台接受;ASS 支持样式化歌词视频;JSON 保留词级结构供自定义工具使用。LRC 不是导出格式——如果播放器需要,可从 SRT 标准转换。

「×2」这样的重复缩写会被展开吗?

不会。重复缩写会从文稿中整理掉,而不是展开成更多行。如果副歌唱两遍,就在歌词里写两遍,让每一句演唱都有自己的字幕行。

「(ooh)」这样的括号行会从歌词里删掉吗?

只有整行全部由已识别的演唱、乐器或段落标记组成时才会删除。真正演唱的背景和声如 "(ooh)"、"(Forever!)" 会保留,因为行里没有词命中标记词表。每次删除都会在提交前预览中展示,也可以一键改用原文提交。

中文的 YuE2 歌曲能用吗?

人声清晰的混音可以:一首中文 YuE2 示例歌已在生产检查中作为精确时间轴交付,约四分之三的歌词行锚定到了演唱位置。器乐盖过人声的重混音仍可能被交付检查拒绝——如实退回而不是交付不可靠的时间轴。

我的歌词会被改动吗?

清理后的文稿——移除了段落标签和演唱标记——是存储与对齐用的版本,提交前预览会提前展示每一次删除。原文保留在编辑器里,可以一键改用原文提交。

相关阅读指南

查看全部指南