Logo
ログイン
Logo

最も開発者にフォーカスした音声AIプラットフォーム

ISO 27001
ISO 27001
SOC 2
SOC 2
SSL/TLS
SSL/TLS
APPI
APPI
プロダクト
  • リアルタイム音声認識
  • 録音ファイル書き起こし
  • 音声合成
  • 発音評価
  • DolphinTeams デュアルスクリーン端末
  • Tralingo AI翻訳機
  • NihongoScore
リソース
  • ドキュメント
  • ブログ
  • AI アプリ
  • オンライン体験
会社
  • 会社情報
  • お問い合わせ
  • クライアント
法務
  • プライバシーポリシー
  • 利用規約
  • サービスレベル合意(SLA)
  • 特定商取引法に基づく表記
  • DolphinTeams ユーザーマニュアル
© 2026 DolphinVoice All Rights Reserved.
製品LLMRTC Docs
LLMRTC Docs

LLMRTC Docs

OpenSource TypeScript SDK for real-time voice vision AI apps

0 投票ウェブサイトを訪問
LLMRTC Docs Screenshot
LLMRTC Docs Preview
ウェブサイトを訪問

LLMRTC Docs について

LLMRTC Docs は、リアルタイム音声およびビジョンアプリケーションの構築のための TypeScript SDK である LLMRTC の公式ドキュメントです。このSDKは、WebRTCベースの音声/映像ストリーミングを、大規模言語モデル(LLM)、音声認識(STT)、音声合成(TTS)と、単一かつプロバイダーに依存しないAPIを通じて統合します。対話的で会話型のシステムに適した、低遅延の双方向ストリーミングに焦点を当てています。

このドキュメントは、音声アシスタント、マルチモーダルエージェント、カスタマーサポートフローなど、会話型AI向けの信頼できるインフラが必要な開発者を対象としています。LLMRTCは、セッション管理、プロバイダーのオーケストレーション、音声活動検出(VAD)、再接続などの複雑なランタイム処理を抽象化することで、チームがアプリケーションロジックに集中できるようにします。

主なポイント

  • WebRTCによるリアルタイム音声/映像ストリーミング(1秒未満の遅延)
  • 自然な発話の順番制御を実現するサーバー側の音声活動検出(VAD)および割り込み(barge-in)機能
  • クラウドおよびローカルモデル間でのプロバイダーに依存しない設計。LLM、STT、TTSプロバイダーを自由に組み合わせ可能
  • JSON Schemaを使用したツール呼び出しにより、検証済み関数の実行をサポート
  • 設定可能な遷移を持つ多段階会話のためのプレイブック機能
  • 文境界検出によるエンドツーエンドのストリーミングパイプライン(STT → LLM → TTS)
  • TTFT、トークン数、処理時間など観測可能なフックおよびメトリクス
  • 自動再接続と会話履歴の保持によるセッションの耐障害性

LLMRTC Docs の仕組み

LLMRTCは、コアロジック、サーバー機能、ブラウザ連携を分離した3つのパッケージから構成されています:

パッケージ機能
@llmrtc/llmrtc-core共有タイプ、オーケストレーター、ツール、フック
@llmrtc/llmrtc-backendWebRTC、VAD、プロバイダー連携を備えたNode.jsサーバー
@llmrtc/llmrtc-web-client音声/映像の取得および再生のためのブラウザSDK

実行時には、ユーザーの音声がサーバーにストリーミングされ、VADによって音声の区間が検出され、音声からテキストへ変換されます。その文字起こしデータはLLMによって処理され、必要に応じてJSON Schemaで定義された開発者独自のツールを呼び出すことができます。応答は音声に変換され、クライアントにストリーミングされます。文境界検出により、生成が完了する前に早期かつ自然なTTS再生が可能になります。

開発者は、アプリケーションコードを変更することなく、プロバイダーの切り替えや組み合わせが可能であり、たとえばLLMにはあるプロバイダー、STTには別のプロバイダー、TTSにはさらに別のプロバイダーといった設定が可能です。SDKは、ログ記録、デバッグ、カスタム動作のために20以上のフックポイントを提供し、組み込みのメトリクスも備えています。セッションの耐障害性には再接続と状態の継続性が含まれます。本番環境では、安定したWebRTC接続を確保するためにTURNサーバーの導入が必要です。ドキュメントにはその設定に関するガイダンスが含まれています。

主な利点と用途

LLMRTCは、会話型およびマルチモーダルなさまざまなユースケースをサポートしています:

  • 音声アシスタント:低遅延で中断可能な発話を実現し、特定領域のツールを備えたアシスタントを構築
  • カスタマーサポート:プレイブックを通じて認証、トリアージ、解決までの流れをユーザーに案内
  • マルチモーダルエージェント:音声にカメラまたは画面入力を組み合わせ、文脈を理解した支援を実現
  • デバイス上AI:Ollama、Faster-Whisper、Piperなどのプロバイダーを使ってローカルで実行し、プライバシーとコストを制御

主な利点には、プロバイダーに依存しないアーキテクチャ、包括的な型定義を備えた統一されたTypeScript API、検証済みのツール呼び出し、フックとメトリクスによる運用可視性が含まれます。アーキテクチャのストリーミングパイプラインと文脈を意識したTTSにより、体感遅延が低減され、セッション管理および再接続機能によって、実際のネットワーク環境下での信頼性が向上します。

タグ

#TypeScript#WebRTC#LLM#Speech-to-Text#Text-to-Speech#AI SDK#Real-Time Streaming#Provider Agnostic#Multimodal AI#Developer Tools

おすすめ

Guideflow

Guideflow

The AI demo automation platform for SaaS

1259
CyberCut AI

CyberCut AI

AI video studio for viral social clips

706
Incredible

Incredible

Deep Work AI Agents - powered by Agent MAX

653
Typeless

Typeless

AI voice dictation that's actually intelligent

625

AI Apps でアプリを無料で紹介

革新者のコミュニティに参加して、あなたの AI ツールを毎日何千人ものユーザーに届けましょう。

掲載を申し込む
DolphinVoice Console

BlogPage.PromoContent.title

BlogPage.PromoContent.description

BlogPage.PromoContent.cta