Logo
製品LongCat Avatar
LongCat Avatar

LongCat Avatar

Long duration video generation with identity consistent AI

LongCat Avatarの紹介

LongCat Avatarは、長時間にわたる動画生成を目的とした音声駆動型アバターモデルです。本人同一性の一貫性、正確なリップシンク、および沈黙中のジェスチャーやアイドルモーションなど、自然な人間の動きに重点を置いています。本システムは、長時間、あるいは理論的には無限の長さにわたって視覚的品質を維持するように設計されています。

LongCat-Videoアーキテクチャに基づいて構築されており、複数の生成モードと効率的な推論をサポートし、プロダクションワークフローに適しています。一貫性があり、現実的なアバター動画を大規模に必要とするクリエイター、スタジオ、教育チーム、研究グループ、SaaSプロバイダーにとって有用です。

主なポイント

  • 音声・テキストから動画(AT2V)、音声・テキスト・画像から動画(ATI2V)、音声条件付き動画継続生成を統一されたフレームワークでサポート
  • クロスチャンクラテントステッチングにより、長時間シーケンスにおける品質劣化を最小限に抑制
  • 分離されたモーションモデリングにより、発話がなくても自然なジェスチャーおよびアイドル動作を実現
  • リファレンスキップアテンションにより、コピペアーティファクトなしに本人同一性を保持
  • 複数人物および理論的には無限の長さのシーケンスをサポート
  • 粗~精の生成戦略とブロックスパースアテンションによる効率的な推論。高速720p/30fps向けに最適化
  • 最大1080pまでの出力解像度。長尺コンテンツの安定生成を設計
  • オープンソース(MITライセンス)でローカル展開をサポート。モデルサイズは136億(13.6B)パラメータ

LongCat Avatarの仕組み

ワークフローは、音声入力(スピーチ、音楽、ポッドキャストなど)と任意のリファレンス(画像またはテキスト)から開始します。ユーザーは生成モード(AT2V、ATI2V、音声条件付き動画継続)を選択し、長さ、解像度、複数人物生成の要否を設定します。本システムは、長尺シーケンスにわたり外見の一貫性と安定性を重視して最適化されています。

技術的に、LongCat Avatarは分離されたガイド機構を用いて音声とモーションの役割を明確に区別しています。クロスチャンクラテントステッチングは、長時間にわたる不要なデコード・エンコードサイクルを回避することで、視覚的なドリフトを低減します。リファレンスキップアテンションは、硬直したクローン処理を行わず本人同一性を保持します。粗~精戦略とブロックスパースアテンションを組み合わせることで、720p/30fpsでの実用的かつプロダクション対応の推論を実現しており、最大1080pまでの高解像度出力もサポートしています。

主な利点と用途

  • 長尺プレゼンテーションや講義:長時間の録画にわたり、一貫した外見と自然な話し方を維持。
  • ポッドキャストやインタビュー:外見とリップシンクが安定した、数時間規模の会話動画を生成。
  • エンターテインメントやパフォーマンス:リズムに同期した表現豊かな演技や歌唱を実現。
  • 営業、マーケティング、企業コミュニケーション:沈黙や間を自然に処理できるプレゼンターを生成。
  • 複数人物の会話:個々の人物の同一性を保持しつつ、順番に話すようなマルチスピーカーのやり取りをサポート。

料金概要(一括クレジットパック)

プラン価格クレジット約再生可能回数解像度音声長(1回あたり)複数人物優先度備考
Base$9.990最大18480p/720p/1080p最大60秒未記載標準音声駆動型アバター生成
Pro$29.9400最大80480p/720p/1080p最大60秒あり優先複数人物対応を想定
Ultimate$49.9800最大160480p/720p/1080p最大60秒あり(インタラクション)優先長尺動画生成に対応と記載
Creator$99.91800最大360480p/720p/1080p最大60秒あり最高「複数人物&無限長対応」と記載。プロダクション対応アーキテクチャ。商用利用許諾

備考:本モデルは長尺コンテンツ向けに最適化されており、理論的には無限長のシーケンスをサポートしています。料金プランではクレジット制使用における1回あたりの音声長として最大60秒が記載されていますが、これはサービスレベルの制約を示している可能性があり、モデルの能力そのものを制限するものではありません。