Fish Audioとは

Fish Audioは、Text To Speech・Voice Cloning・Speech To Text・Voice Agentの4つを軸にした音声AIプラットフォームです。主力モデル「S2.1 Pro」はリアルタイム生成と感情タグ制御([angry][whispering][laughing]など)に対応し、低遅延な会話AIから動画ナレーションまで幅広く使えます。

主要機能

1. ボイスクローン10秒前後の音声サンプルから話者の声を再現。公式は「15秒でperfect fidelityの複製」とも表現しています。

2. 多言語対応:API経由で30以上の言語を同一声質のまま生成可能。

3. 200万以上のボイスライブラリ:ユーザーがアップロードした200万件超の音声から選択・利用できます。

4. Speech To Text / Voice Agent:マルチスピーカー・感情タグ・自然言語での話者記述に対応した文字起こしと、エンドツーエンドの音声エージェント構築機能を提供します。

想定ユーザー

動画ナレーションやゲーム・アニメのキャラクターボイス、カスタマーサポート向け音声エージェントを開発したいクリエイターや開発者に向いています。無料プランで試用でき、API利用にはPremium以上の契約が必要です。