コンテンツにスキップ

音声パイプライン

ローカル優先の音声インテリジェンス——ASR、TTS、VAD、リアルタイム音声ルーム。


たとえ話:同時通訳者のツールキット

Section titled “たとえ話:同時通訳者のツールキット”

プロの同時通訳者には3つのものが必要です:

  1. — 話者を聞いて理解する(ASR:音声→テキスト)
  2. — 翻訳を明確に発話する(TTS:テキスト→音声)
  3. 判断力 — 話者が話しているか、間を置いているかを知る(VAD:音声活動検出)

そして会議通訳にはブースが必要です——複数の通訳者が異なる言語ペアで同時に作業できる制御された環境(LiveKit音声ルーム)。

DuDuClawの音声パイプラインは4つすべてのコンポーネントを提供し、ローカル処理を強く優先します——音声データは明示的にクラウドにルーティングしない限り、あなたのマシンに留まります。


4つのプロバイダー、プライバシーとコスト順:

プロバイダー 場所 速度 言語 コスト
SenseVoice (ONNX) ローカル 高速 CJK + 多言語 無料
Whisper.cpp ローカル 中速 99言語 無料
OpenAI Whisper API クラウド 高速 57言語 分課金
Deepgram クラウド 超高速 36言語 分課金

auto設定時、ローカルプロバイダーを優先:

音声メッセージ受信(OGG Opus / MP3 / WAV)
|
v
オーディオデコード(symphonia:OGG/MP3/AAC/WAV/FLAC → PCM)
|
v
SenseVoice ONNX利用可能?
+--+--+
| |
はい いいえ → Whisper.cpp利用可能?
| +--+--+
| | |
| はい いいえ → クラウドAPIにフォールバック
| |
v v
ローカルASR → テキスト変換

Telegram統合:ユーザーが音声メッセージを送信すると、BotがOGG Opusファイルを自動ダウンロード、PCMにデコード、テキスト変換し、タイプされたメッセージとして処理します。

4つのプロバイダー:

プロバイダー 場所 品質 言語 コスト
Piper (ONNX) ローカル 良好 30+言語 無料
MiniMax T2A クラウド 優秀 CJK + ラテン(自動検出) 文字課金
Edge TTS クラウド 良好 400+ボイス 無料
OpenAI TTS クラウド 優秀 多言語 文字課金

MiniMax T2Aプロバイダーは自動言語検出を含みます:テキスト内容を分析してCJK(中国語/日本語/韓国語)かラテン文字かを判定し、適切な音声モデルを選択します。

Silero VAD(ONNX)がローカルで実行され、ユーザーが話しているか無音かを検出します:

  • Discord音声チャンネル:録音の開始/停止タイミング把握
  • LiveKit音声ルーム:マルチエージェント会話のターンテイキング管理
  • ストリーミングASR:連続オーディオを個別発話に分割

symphoniaクレートが対応:OGG Opus、MP3、AAC、WAV、FLAC → 16kHzモノラルPCM。


リアルタイム音声:DiscordとLiveKit

Section titled “リアルタイム音声:DiscordとLiveKit”

Songbird(Rust Discord音声ライブラリ)経由でDiscord音声チャンネルと統合:

ユーザーがDiscord音声チャンネルに参加
|
v
Botが同じチャンネルに参加(Songbird)
|
v
VADが音声検出 → ASRがテキスト変換
|
v
Agentがテキスト変換結果を処理
|
v
TTSが音声レスポンスを生成
|
v
Botが音声チャンネルでオーディオを再生

マルチエージェント音声コラボレーション用にLiveKit WebRTC音声ルームをサポート:

LiveKit音声ルーム
├── Agent A(カスタマーサポート)
├── Agent B(技術スペシャリスト)
├── Agent C(翻訳者)
└── 人間ユーザー

サポートシナリオ:

  • 引き継ぎ会話:サポートエージェントがスペシャリストにエスカレーション
  • 多言語会議:翻訳エージェントがリアルタイムで言語の橋渡し
  • 協調デバッグ:複数の専門エージェントが問題を共同議論

音声パイプラインは埋め込みエンジンとインフラを共有——両方ともONNX Runtimeを使用。BERT WordPieceトークナイザー + ONNX Runtime ベクトル埋め込み生成。bge-small-zhqwen3-embedding-0.6bなどのモデルをサポート。


ローカルASRとTTSにより、音声データがマシンから出ることはありません。医療、法律、コンプライアンスの文脈では妥協できない要件です。

ローカルモデル(SenseVoice、Piper)は初回ダウンロード後無料。高ボリュームの音声インタラクションで大幅なコスト削減。

ローカルモデルはネットワーク往復を排除。最新GPUでは音声メッセージをミリ秒で文字変換可能。

音声はエージェントをテキストツールから会話パートナーに変えます。運転中、料理中、散歩中でもインタラクション可能——タイピング不要。


  • チャンネル統合:Telegram音声メッセージ自動文字変換、Discord音声チャンネルでリアルタイム音声。
  • Multi-Runtime:文字変換された音声はAgentの設定に従ったruntimeで処理。
  • メモリシステム:音声インタラクションはエピソード記憶として保存。
  • Confidence Router:音声クエリも他のクエリと同様にルーティング。
  • 推論エンジン:ONNX Runtimeインフラを共有。

音声は最も自然なヒューマンインターフェースです。DuDuClawの音声パイプラインは、プライバシーを犠牲にせず予算も超過せずにそれを実現します——ローカル優先のASRとTTSが一般的なケースを無料で処理し、クラウドプロバイダーがエッジケースを処理し、LiveKitがマルチエージェント音声コラボレーションの未来を支えます。