YuE2、音楽生成ベンチマークで最高スコア6.9632を達成
Tokenwave.AIが開発した音楽生成・解析システムYuE2は、WildSongBenchの192プロンプトを用いた15の評価設定において、SongBenchで6.9632の最高スコア(best-of-8)を記録した。同じ比較でSuno v5は6.8721を獲得している。
YuE2は音楽生成、音声表現学習、オーディオ・スコア変換の3つの主要コンポーネントから構成される統合システムである。YuE2生成モデルは3.59Bパラメータ・28層の構成を持つ。音声表現学習を担当するMERT2は、14/15のMARBLEメトリクスで最先端の成績を達成し、オーディオ・スコア変換のSheetSage2は、13のベンチマークメトリクスのうち10で最先端結果を実現している。
YuE2生成モデルの構成と性能
YuE2は3.59Bパラメータと28層のアーキテクチャで設計されている。346K時間の音楽データで学習されており、WildSongBenchの192プロンプントに対する15設定の評価で、最高観測平均スコア6.9632を達成した。この数値は同ベンチマークにおけるSuno v5の6.8721を上回っている。
MERT2:音声表現学習モデル
MERT2は音声データの深層表現学習を担当する。ConvNeXtフロントエンドとConformerの24層構成を持ち、エンコーダパラメータは632Mである。訓練コンテキストはMERT2-30sで30秒、MERT2-FSで300秒に設定されている。
MERT2-30sおよびMERT2-FSは、MARBLEベンチマークの15メトリクスのうち14で最先端の成績を達成した。具体的には、GTZANにおけるジャンル認識精度でMERT2-30sが91.72を、GiantStepsにおけるキー判定精度でMERT2-FSが67.05を記録している。700K時間のデータで学習されている。
SheetSage2:オーディオ・スコア変換モデル
SheetSage2はビート・ダウンビート・キー・コード・構造・メロディーの6つのタスクを単一モデルで処理する自動回帰型デコーダである。6層のデコーダ層を備えており、13のベンチマークメトリクスのうち10で最先端結果を達成している。
RWC-Popのボーカルメロディーではピッチクラス・ノートF1スコアで82.51を、osu2017のコード認識ではMaj/minで90.08を記録した。モデルは28.4K時間の音楽データで訓練されている。
訓練データと技術基盤
3つのモデルは主にCC0音楽および合成データで訓練されている。合成訓練データの大部分はTokenwave.AIがライセンスで提供している。YuE2システム全体は346K時間(YuE2生成)、700K時間(MERT2)、28.4K時間(SheetSage2)の多様なデータセットで構築されている。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
YuE2 · Frontier Music with Symbolic Planning https://map-yue2.github.io/