Gemini TTSは、テキストを自然で表現力豊かな音声に変換するテキスト・トゥ・スピーチ(TTS)ソリューションです。開発者、コンテンツ制作者、教育関係者、およびプロダクトチームが、トーン、感情、話速、話し手のアイデンティティを高精度で再現した音声を生成できるように設計されています。従来のTTSシステムと異なり、Gemini TTSは「落ち着いた」「映画的」「徐々に緊迫感を高める」などの自然言語による指示を受け入れ、音声パラメーター(例:ピッチ曲線や音素持続時間)を手動で調整する必要がありません。
このシステムは、リアルタイム音声アシスタント、長尺ナレーション(オーディオブックやチュートリアル)、多言語コンテンツ、複数話し手による対話(ポッドキャストやトレーニングシミュレーションなど)といった多様な用途に対応しています。アーキテクチャ上、インタラクティブなアプリケーション向けの低遅延生成と、高品質メディア向けの高忠実度出力を両立させています。
Gemini TTSは、入力テキストに加えて、話のトーン、感情、話速のヒント(例:「カンマの後に一時停止」「ここでは少しだけ速く話す」)、複数話し手のための話者ラベル、および言語やアクセントの指定を含む任意の指示を処理します。モデルはこれらの指示を文脈とともに解釈し、音響パラメーターの手動調整を経ずに、指示通りの表現を反映した音声を合成します。
複数話し手のケースでは、ユーザーが「ナレーター」「インタビュイー」などの話者識別子を割り当て、順番にテキストを提供します。Gemini TTSは各話者の声質と韻律パターンを発話間で一貫して維持し、不自然な切り替わりを防ぎます。多言語環境では、対応言語間の切り替えにおいても、トーンやリズムの急激な変化を回避し、スタイルの連続性を確保します。
このサービスは、プロトタイピング向けのWebインターフェースおよびAPIによるプログラム連携で利用可能です。開発者はシンプルなプロンプトから始め、指示文の言い回しを段階的に精緻化することで出力を改善でき、モデルの再学習やチューニングを伴わない迅速な反復開発が可能です。