YuE2風の歌詞(生成のまま)
[Verse 1] [Male Vocals] (saxophone) City lights fading in the rearview (Forever!) [Chorus] We run all night
AI楽曲リリック字幕ガイド
著者:Yana Li
YuE2で曲を生成したら、リリックビデオに必要な素材はすべて揃っています:自分が書いた歌詞と、モデルが生成した音声です。残る作業はタイミング合わせ——分かっている歌詞を、歌われている位置に落ちる字幕行に変えることです。このガイドは全体の流れを扱います:生成マーカー行の整理、「これは歌です」をオンにしたスクリプト+オーディオのアラインメント、品質サマリーの確認、そしてSRT・VTT・SBV・ASS・JSONでの書き出し。
YuE2風の歌詞(生成のまま)
[Verse 1] [Male Vocals] (saxophone) City lights fading in the rearview (Forever!) [Chorus] We run all night
整理後のスクリプトとタイムライン
1 00:00:03,120 --> 00:00:07,480 City lights fading in the rearview 2 00:00:07,900 --> 00:00:11,240 We run all night
削除される行と残る行
「[Male Vocals] (saxophone)」は誰も歌わないパフォーマンス指示なので、タイミング生成の前に削除されます。「(Forever!)」は実際に歌われるので歌詞に残ります。削除が静かに行われることはありません:送信前のプレビューに削除行がすべて並び、元のテキストのまま送信することもできます。
判断ポイント
YuE2は構造化された歌詞——Aメロ、サビ、パフォーマンス指示——とスタイル設定を受け取り、完成した音声を返します。歌詞はあなたが書いた文字情報の真実源です。必要なのは転写(音声から言葉を推測すること)ではなくアラインメント(分かっている言葉を音声のタイムラインに載せること)です。それがまさにスクリプト+オーディオのワークフローであり、認識結果に書き換えさせるのではなく、承認済みの言葉を保ちます。
歌唱生成モデル向けの歌詞には、行全体がパフォーマンス/楽器指示の行が大量にあります:"[Male Vocals]"、"(saxophone) (brass) (guitar)"、"[Vocal ad-libs]"、"(电吉他)"、"【副歌】"、"[主歌1]"。公式の99例の歌詞にもこの種の行が頻出します——そして決して歌われません。スクリプトに残ると、音声と決して一致しない字幕行になります。落とし穴にはもう半分あります:"(I'm so good)"、"(Forever!)" のように実際に歌われる括弧行は残さなければなりません。括弧だけ見て削除すると本編の歌詞を消し、何も削除しないと誰も歌わない行が書き出し物ごとに残ります。
最終歌詞をプレーンテキストで保存します:1行=1つの歌行、セクションラベルは独立した行に。生成音声をMP3かWAVで保存します。スクリプト+オーディオのプロジェクトで歌詞を貼り付けまたはアップロードし、楽曲オーディオをアップロードして「これは歌です」をオンにします。送信前のプレビューが、整理される歌詞マーカー——セクションラベル、パフォーマンス指示、末尾のリピート指示——を行ごとに一覧表示します。処理後は品質サマリーと問題リストを確認し、SRT(エディタ用)、VTT/SBV(プラットフォーム用)、ASS(装飾リリックビデオ用)、JSON(自作ツール用)を書き出します。
整理ルールはシンプルです:行全体のすべての括弧グループが既知のパフォーマンス、楽器、セクション指示である場合にのみ削除し、ひとつでも未知の語があれば行全体を残します。削除はカウントされ送信前に行ごとに表示され、保存とアラインメントには整理済みスクリプトが使われ、ワンクリックで元テキストのまま送信できます。"[Verse 1]" は削除、"(Forever!)" は触られません。
YuE2のプロンプト作りは別の専門で、公式ドキュメントの方が字幕ツールが語るべき範囲を超えて詳しいです:公式YuE2プロジェクトページにこのガイドが参照する公開例があり、YuE2リポジトリが歌詞フォーマットと生成設定を文書化しています。モデルとアライナーの両方に効く習慣は三つ:セクションラベルは独立した行に、「×2」のような省略ではなく繰り返しを行として書き切る(省略は展開されず整理されます——サビが2回歌われるなら2回書く)、実際に歌われる括弧コーラスは残す。
書き出しはSRT、VTT、SBV、ASS、JSON、TXTをカバーし、マニフェストと説明書き付きの単一ZIPにまとめて提供されます。SRTとVTTはほぼすべてのエディタとプラットフォームで受け入れられ、ASSは装飾リリックビデオのフォントと配置を担い、JSONは自作ツール向けの語レベル構造を保ちます。LRCは書き出し形式ではありません。プレーヤーがLRCを必要とする場合は、標準のコンバーターでSRTから変換してください。
歌唱ボーカルは話し声より揃えにくく、信頼度はミックスと言語によって変わります。信頼できるタイミングを確立できないと判断した場合、誤ったタイミングを静かに渡すのではなく、問題を報告して試行を解放します——問題リストは成果物の一部として扱ってください。ボーカルが前に出た中国語の楽曲は現在うまく固定されます:中国語のYuE2サンプル曲が、本番確認で精密タイミングのファイルとして納品され、約4分の3の行が歌われた位置に固定されました。楽器がボーカルを覆う重いミックスは依然として確認に失敗することがあります——その場合、信頼できないタイミングを納品するのではなく、理由とともに正直に差し戻されます。納品はワークフローの確認であり、曲ごとの精度保証ではありません。
書き出したSRTをエディタやリリックビデオツールに読み込み、スタイルを一度設定すれば、各行は曲が歌う位置に落ちます。CapCut、Premiere、Resolve、そして大半のプラットフォームはSRTを直接受け入れます。CapCutワークフローガイドが往復の手順を詳しく扱います。書き出したJSONも保存しておいてください——語レベルの構造が、将来のスタイル変更や翻訳を安くします。
実用ワークフロー
最終歌詞をプレーンテキストで書き出します:1行=1つの歌行、セクションラベルは独立行、「×2」ではなく繰り返しを行として書きます。
生成した楽曲オーディオをMP3かWAVで保存します。
スクリプト+オーディオのプロジェクトを作り、歌詞を貼り付けまたはアップロード、オーディオをアップロードして「これは歌です」をオンにします。
送信前の整理プレビューを開き、表示された歌詞マーカーを行ごとに確認します。歌う行が削除リストにあれば「原文のまま使う」を選びます。
処理が終わったら、タイミングを信頼する前に品質サマリーと問題リストを読みます。
SRT、VTT、SBV、ASS、JSONを書き出し、エディタやリリックビデオツールに読み込みます。
製品境界
このガイドは、既存の歌詞と生成済みの楽曲オーディオを字幕ファイルに変える作業を扱います。音楽の生成、YuE2プロンプトの詳細、生成楽曲の配布は扱わず、それらは公式YuE2リソースをご利用ください。歌唱ボーカルのタイミング精度は楽曲ごとに異なります。品質チェックと問題リストは成果物の一部であり、保証ではありません。
ワークフロー位置づけ確認用の公式参照
公式参照の確認日: 2026-09-28
FAQ
できません。TimedSubsは生成の後に働きます:すでにある歌詞と音声を受け取り、確認済みの字幕ファイルを作ります。モデルの使い方、プロンプト、ダウンロードは公式YuE2プロジェクトページとリポジトリをご利用ください。
SRT、VTT、SBV、ASS、JSON、TXTです。SRTとVTTはほぼすべてのエディタとプラットフォームで受け入れられ、ASSは装飾リリックビデオに対応し、JSONは語レベルの構造を保ちます。LRCは書き出し形式ではありません。必要ならSRTから標準変換してください。
されません。リピート指示は展開されずに整理されます。サビが2回歌われるなら、歌詞に2回書いて、歌われる行ごとに字幕エントリを持たせてください。
行全体が既知のパフォーマンス、楽器、セクション指示だけで構成される場合のみ削除されます。"(ooh)" や "(Forever!)" のように実際に歌われるコーラスは、マーカー語彙に一致する語がないため残ります。削除はすべて送信前プレビューに表示され、元のテキストのまま送信できます。
ボーカルが前に出たミックスなら使えます:中国語のYuE2サンプル曲が、本番確認で精密タイミングとして納品され、約4分の3の行が歌われた位置に固定されました。楽器がボーカルを覆う重いミックスは、納品チェックに拒否されることがあります——信頼できないタイミングを渡す代わりに正直に報告します。
整理済みスクリプト——セクションラベルとパフォーマンス指示を除いたもの——が保存とタイミング合わせに使われ、送信前プレビューにすべての削除が事前に表示されます。元のテキストはエディタに残り、ワンクリックでそちらを送信できます。
関連ガイド
すべてのガイドを見る