InfiniteTalk AI の紹介
InfiniteTalk AI は、1枚の画像または既存の動画と音声を組み合わせて、自然な会話風の動画を生成する音声駆動型動画生成プラットフォームです。スパースフレーム動画ダビング技術を用いて、正確なリップシンク、表情豊かな頭部および体の動き、長時間にわたる一貫した視覚的アイデンティティを実現します。
このプラットフォームは、ポッドキャスト、講義、研修コンテンツ、ナレーションなど、長尺の音声を扱うクリエイター向けに設計されています。また、効率的なダビングやローカライゼーションが必要なチームにも適しています。1人から複数人のシナリオに対応しており、個別の音声制御により、複雑な対話や複数キャラクターのシークエンスを制作できます。
主な特徴
- 画像から動画、または動画から動画への入力による音声駆動型会話動画生成
- 正確なリップシンクと全身動作を実現するスパースフレーム動画ダビング
- アイデンティティの一貫性を保ちながら無制限の長さで生成可能
- 複数人の動画サポート(別々の音声トラックとリファレンスマスク付き)
- 大規模なワークフローと長尺コンテンツ向けのバッチ処理
- 現在の出力解像度:480p および 720p(高解像度は今後予定)
- 幅広い入出力形式サポート:音声(MP3、WAV、M4A)、画像(JPG、PNG、WebP)、動画(MP4、MOV、AVI)、文字起こし(TXT、SRT)
- 出力形式:MP4(H.264/H.265)、WebM(VP9)、フレームシーケンス(PNG/JPG)
InfiniteTalk AI の動作方法
ユーザーはまずソースとして、単一画像または既存の動画を選択します。次に、対応する音声(スピーチ、ポッドキャスト、対話など)をアップロードし、必要に応じて文字起こしファイルも提供できます。複数人のシーンでは、各キャラクターの位置合わせとタイミングを制御するために、別々の音声トラックとリファレンスマスクを提供可能です。
システムはスパースフレーム動画ダビング技術を適用し、音声から口の形、表情、頭の動き、体の姿勢を駆動させながら、被写体のアイデンティティ、照明、背景を維持します。動画から動画へのワークフローでは、適切な場合に元の構図やモーションヒントを保持します。結果として、音声トラックと密接に一致した生成動画が得られます。
出力は MP4 や WebM 形式、またはポストプロダクションパイプライン向けのフレームシーケンスとして利用可能です。現在の解像度オプションは 480p および 720p で、高解像度は今後提供予定です。このパイプラインは長尺コンテンツおよびバッチ処理に対応しています。
主なメリットと用途
- 長尺コンテンツ変換:手動でのキーフレーム設定や短いクリップの制限なしに、ポッドキャスト、講義、ナレーション付き研修モジュールを対応する会話動画に変換可能。
- ダビングとローカライゼーション:言語ごとに視覚的アイデンティティを一貫して維持しつつ、新たな音声トラックに合わせて口の動きや体の表現を調整可能。
- 複数キャラクター制作:各参加者に個別の音声トラックとマスクを割り当てることで、対話、インタビュー、パネルディスカッションなどを制作可能。
- コンテンツの再利用:既存の音声アーカイブから会話可能なアバター動画を生成し、SNS、ナレッジベース、教材などへ活用可能。
- スケーラブルなワークフロー:バッチ処理とフレームシーケンス出力を使用して、ポストプロダクションを合理化し、既存の編集パイプラインと統合可能。
料金とクレジット(一括購入)
| プラン | 価格 (USD) | クレジット | 約定価格/クレジット | 含まれる機能 |
|---|---|---|---|---|
| スターター | $9.9 | 105 | $0.094 | HD 動画生成;リップシンクおよび体のアニメーション;ダウンロード;メールサポート |
| プロ | $29.9 | 500 | $0.06 | HD 動画生成;リップシンクおよび体のアニメーション;ダウンロード;商用利用ライセンス;優先サポート |
| アルティメット | $49.9 | 1000 | $0.05 | HD 動画生成;リップシンクおよび体のアニメーション;ダウンロード;商用利用ライセンス;優先サポート |
| エンタープライズ | $99.9 | 2400 | $0.041 | HD 動画生成;リップシンクおよび体のアニメーション;ダウンロード;商用利用ライセンス;優先サポート;一括処理 |


