Deepgramとは
Deepgramは、開発者向けに音声認識(Speech-to-Text)・音声合成(Text-to-Speech)・音声エージェント構築を単一APIで提供する音声AIプラットフォーム。現行の主力モデルは会話特化の「Flux STT」「Flux TTS」で、ターン検出(誰がいつ話し終えたか)・割り込み処理・会話文脈の保持をモデル側でネイティブに扱う点が特徴。従来主力だったNova-3(STT)・Aura(TTS)も引き続き提供されている。
主要機能
- Voice Agent API: STT・TTS・LLM orchestrationを1本のAPIに統合し、音声入力から応答音声出力までを単一の構成で実装できる。
- Flux STT / Flux TTS: リアルタイム会話向けに、発話の区切り検出と割り込み対応を組み込んだストリーミング処理。クラウド提供と自己ホスト(self-hosted)の両方に対応。
- Nova-3 STT: 45以上の言語に対応し、話者分離(ダイアライゼーション)、フォーマット整形、キーワード検出、言語自動判定などの機能を持つ。
- バッチ書き起こし・録音ファイル処理: REST API経由で録音済み音声をまとめて文字起こし可能。
想定ユーザー
音声機能や音声エージェントを自社プロダクトに組み込みたい開発者・SaaSチーム、コールセンターや会話ログを扱うプラットフォーム/パートナー企業向け。管理はAPI・コード前提のため、ノーコードで使いたい層には不向き。


