動画生成 · 2026.08.25

Pikaがテキスト・歌詞・声・既存曲を統合する音楽生成モデル「Pika Music」を発表

Pika
この記事の要点

  • Pika Musicはテキスト、歌詞、声のリファレンス、音楽リファレンス、これらの組み合わせを条件として1つのモデルで完全な楽曲を生成する。
  • 内部は潜在拡散トランスフォーマーで、圧縮された音響表現を扱いデコーダでステレオ波形を出力する設計。
  • 同社のベンチマークでは90秒曲を平均6.21秒で生成するなど、実時間より大幅に高速な推論パスを示している。
制作影響度86/100

音声・音楽 AI制作ワークフロー

複数入力を1モデルで統合する生成ワークフロー

制作に効く変更点

  • 複数モダリティ(テキスト、歌詞、声、音楽リファレンス)を単一モデルで受けるワークフローを導入
  • 声リファレンスはパフォーマンス生成に参加するクリエイティブなボイス条件付けをサポート
  • 音楽リファレンスを分離・正規化して新曲の『雰囲気』を条件化し、既存ミックスから単純に切り貼りしない生成を行う

制作の出発点を一本化する影響

提示された変更により、制作の開始点が説明文・歌詞・声・既存曲のいずれでもよくなり、同じモデルで反復を回せるため、多様な素材から統合的に楽曲を作りやすくなる可能性がある。

主な対象:歌詞主導の作曲、ボイス条件でのカスタム歌唱、既存曲を雰囲気として再想像したい音楽制作者