音声パイプライン
ローカル優先の音声インテリジェンス——ASR、TTS、VAD、リアルタイム音声ルーム。
たとえ話:同時通訳者のツールキット
Section titled “たとえ話:同時通訳者のツールキット”プロの同時通訳者には3つのものが必要です:
- 耳 — 話者を聞いて理解する(ASR:音声→テキスト)
- 声 — 翻訳を明確に発話する(TTS:テキスト→音声)
- 判断力 — 話者が話しているか、間を置いているかを知る(VAD:音声活動検出)
そして会議通訳にはブースが必要です——複数の通訳者が異なる言語ペアで同時に作業できる制御された環境(LiveKit音声ルーム)。
DuDuClawの音声パイプラインは4つすべてのコンポーネントを提供し、ローカル処理を強く優先します——音声データは明示的にクラウドにルーティングしない限り、あなたのマシンに留まります。
ASR(自動音声認識)
Section titled “ASR(自動音声認識)”4つのプロバイダー、プライバシーとコスト順:
| プロバイダー | 場所 | 速度 | 言語 | コスト |
|---|---|---|---|---|
| SenseVoice (ONNX) | ローカル | 高速 | CJK + 多言語 | 無料 |
| Whisper.cpp | ローカル | 中速 | 99言語 | 無料 |
| OpenAI Whisper API | クラウド | 高速 | 57言語 | 分課金 |
| Deepgram | クラウド | 超高速 | 36言語 | 分課金 |
auto設定時、ローカルプロバイダーを優先:
音声メッセージ受信(OGG Opus / MP3 / WAV) | vオーディオデコード(symphonia:OGG/MP3/AAC/WAV/FLAC → PCM) | vSenseVoice ONNX利用可能? +--+--+ | | はい いいえ → Whisper.cpp利用可能? | +--+--+ | | | | はい いいえ → クラウドAPIにフォールバック | | v vローカルASR → テキスト変換Telegram統合:ユーザーが音声メッセージを送信すると、BotがOGG Opusファイルを自動ダウンロード、PCMにデコード、テキスト変換し、タイプされたメッセージとして処理します。
TTS(テキスト→音声)
Section titled “TTS(テキスト→音声)”4つのプロバイダー:
| プロバイダー | 場所 | 品質 | 言語 | コスト |
|---|---|---|---|---|
| Piper (ONNX) | ローカル | 良好 | 30+言語 | 無料 |
| MiniMax T2A | クラウド | 優秀 | CJK + ラテン(自動検出) | 文字課金 |
| Edge TTS | クラウド | 良好 | 400+ボイス | 無料 |
| OpenAI TTS | クラウド | 優秀 | 多言語 | 文字課金 |
MiniMax T2Aプロバイダーは自動言語検出を含みます:テキスト内容を分析してCJK(中国語/日本語/韓国語)かラテン文字かを判定し、適切な音声モデルを選択します。
VAD(音声活動検出)
Section titled “VAD(音声活動検出)”Silero VAD(ONNX)がローカルで実行され、ユーザーが話しているか無音かを検出します:
- Discord音声チャンネル:録音の開始/停止タイミング把握
- LiveKit音声ルーム:マルチエージェント会話のターンテイキング管理
- ストリーミングASR:連続オーディオを個別発話に分割
オーディオデコード
Section titled “オーディオデコード”symphoniaクレートが対応:OGG Opus、MP3、AAC、WAV、FLAC → 16kHzモノラルPCM。
リアルタイム音声:DiscordとLiveKit
Section titled “リアルタイム音声:DiscordとLiveKit”Discord音声チャンネル
Section titled “Discord音声チャンネル”Songbird(Rust Discord音声ライブラリ)経由でDiscord音声チャンネルと統合:
ユーザーがDiscord音声チャンネルに参加 | vBotが同じチャンネルに参加(Songbird) | vVADが音声検出 → ASRがテキスト変換 | vAgentがテキスト変換結果を処理 | vTTSが音声レスポンスを生成 | vBotが音声チャンネルでオーディオを再生LiveKit音声ルーム
Section titled “LiveKit音声ルーム”マルチエージェント音声コラボレーション用にLiveKit WebRTC音声ルームをサポート:
LiveKit音声ルーム ├── Agent A(カスタマーサポート) ├── Agent B(技術スペシャリスト) ├── Agent C(翻訳者) └── 人間ユーザーサポートシナリオ:
- 引き継ぎ会話:サポートエージェントがスペシャリストにエスカレーション
- 多言語会議:翻訳エージェントがリアルタイムで言語の橋渡し
- 協調デバッグ:複数の専門エージェントが問題を共同議論
ONNX埋め込み
Section titled “ONNX埋め込み”音声パイプラインは埋め込みエンジンとインフラを共有——両方ともONNX Runtimeを使用。BERT WordPieceトークナイザー + ONNX Runtime ベクトル埋め込み生成。bge-small-zhやqwen3-embedding-0.6bなどのモデルをサポート。
プライバシー
Section titled “プライバシー”ローカルASRとTTSにより、音声データがマシンから出ることはありません。医療、法律、コンプライアンスの文脈では妥協できない要件です。
ローカルモデル(SenseVoice、Piper)は初回ダウンロード後無料。高ボリュームの音声インタラクションで大幅なコスト削減。
レイテンシー
Section titled “レイテンシー”ローカルモデルはネットワーク往復を排除。最新GPUでは音声メッセージをミリ秒で文字変換可能。
自然なインタラクション
Section titled “自然なインタラクション”音声はエージェントをテキストツールから会話パートナーに変えます。運転中、料理中、散歩中でもインタラクション可能——タイピング不要。
他システムとの連携
Section titled “他システムとの連携”- チャンネル統合:Telegram音声メッセージ自動文字変換、Discord音声チャンネルでリアルタイム音声。
- Multi-Runtime:文字変換された音声はAgentの設定に従ったruntimeで処理。
- メモリシステム:音声インタラクションはエピソード記憶として保存。
- Confidence Router:音声クエリも他のクエリと同様にルーティング。
- 推論エンジン:ONNX Runtimeインフラを共有。
音声は最も自然なヒューマンインターフェースです。DuDuClawの音声パイプラインは、プライバシーを犠牲にせず予算も超過せずにそれを実現します——ローカル優先のASRとTTSが一般的なケースを無料で処理し、クラウドプロバイダーがエッジケースを処理し、LiveKitがマルチエージェント音声コラボレーションの未来を支えます。