Pikaがテキスト・歌詞・声・既存曲を統合する音楽生成モデル「Pika Music」を発表
この記事の要点
- Pika Musicはテキスト、歌詞、声のリファレンス、音楽リファレンス、これらの組み合わせを条件として1つのモデルで完全な楽曲を生成する。
- 内部は潜在拡散トランスフォーマーで、圧縮された音響表現を扱いデコーダでステレオ波形を出力する設計。
- 同社のベンチマークでは90秒曲を平均6.21秒で生成するなど、実時間より大幅に高速な推論パスを示している。
制作影響度86/100
音声・音楽 AI制作ワークフロー
複数入力を1モデルで統合する生成ワークフロー
制作に効く変更点
- 複数モダリティ(テキスト、歌詞、声、音楽リファレンス)を単一モデルで受けるワークフローを導入
- 声リファレンスはパフォーマンス生成に参加するクリエイティブなボイス条件付けをサポート
- 音楽リファレンスを分離・正規化して新曲の『雰囲気』を条件化し、既存ミックスから単純に切り貼りしない生成を行う
制作の出発点を一本化する影響
提示された変更により、制作の開始点が説明文・歌詞・声・既存曲のいずれでもよくなり、同じモデルで反復を回せるため、多様な素材から統合的に楽曲を作りやすくなる可能性がある。
主な対象:歌詞主導の作曲、ボイス条件でのカスタム歌唱、既存曲を雰囲気として再想像したい音楽制作者