コンテンツにスキップ

TTS 品質・性能ベンチマーク比較表

提案書で「数字で勝てる」を示すための公開ベンチマーク数値集。

指標の定義: - MOS: Mean Opinion Score (5 段階主観品質、4.0 超で「自然」、4.3 超で「人間と区別困難」) - RTF: Real-Time Factor (推論時間/合成音声長、0.1 = 10 倍速) - TTFA: Time to First Audio (ストリーミング初音までの時間) - WER: Word Error Rate (zero-shot 系の文字起こし精度)


エグゼクティブサマリー

Piper-Plus の競争力マトリクス

✅ 数字で勝てる項目 (差別化軸)

指標 比較対象
RTF (GPU) < 0.1 Fish S2 Pro 0.195、ElevenLabs N/A
TTFA < 50ms ElevenLabs < 500ms
モデルサイズ 18-35M params Kokoro 82M、Fish S2 4B
組込実装実績 Raspberry Pi / ESP32 等多数 ほぼ唯一の実用例

⚠️ 数字で負ける項目 (要改善・捨てる)

指標 piper-plus 勝者
MOS 3.2-3.8 Kokoro 4.0+、Fish S2 4.5+、ElevenLabs v3 4.5+
対応言語数 35 Fish S2 Pro 80+
日本語ボイス数 2-3 VOICEVOX 200+
zero-shot 対応 非対応 Fish S2, Kokoro

「軽量・高速・組込」で勝ち、「主観品質・話者数・zero-shot」を次世代モデルで埋める戦略の根拠。


ベンチマーク比較表 (主要指標)

モデル MOS RTF (GPU) TTFA パラメータ 言語数 zero-shot ライセンス
piper / piper-plus 3.2-3.8 < 0.1 < 50ms 18-35M 35 OSS (MIT/GPL)
Kokoro-82M 4.0+ 中速 高速 82M 8 Open weights
Fish Speech S2 Pro 4.5+ * 0.195 ~100ms 4B 80+ OSS
Style-Bert-VITS2 4.0+ 中速 (GPU 必須) 中速 ~100M 日本語ほぼ AGPL OSS
VOICEVOX (公式未公開) 中速 中速 100-500M 日本語のみ LGPL OSS
GPT-SoVITS 4.0+ 中速 中速 ~250M 多言語 OSS
Coqui XTTS-v2 3.8-4.0 中速 中速 ~700M 16 CPML (商用制限)
ElevenLabs v3 4.5+ N/A (cloud) < 500ms クローズド 30+ 商用 API
Cartesia Sonic-3 4.5+ N/A ~40ms ** クローズド 42 商用 API
OpenAI Realtime TTS 4.5+ N/A < 800ms クローズド 50+ 商用 API
AITalk (エーアイ) 4.0 (推定) N/A N/A クローズド 日本語+α 商用 SDK
HOYA ReadSpeaker 3.8-4.0 (推定) N/A N/A クローズド 45 商用 SDK
Cerence 4.0+ (推定) N/A N/A クローズド 70+ 商用 SDK

* Fish S2 Pro: Seed-TTS Eval WER 0.54-0.99% (最良)、Audio Turing Test 0.515
** Cartesia Sonic-3: sub-100ms 公称、on-device は更に高速


市場セグメント別ポジショニング

セグメント 最強モデル 第 2 位 piper-plus の位置
エッジ・IoT・モバイル組込 piper / piper-plus KDDI N2 (旧世代) 首位
クラウド高品質 Fish S2 Pro / ElevenLabs OpenAI 圏外 (next-gen で挑戦)
日本語特化 VOICEVOX SBV2 コミュニティ流入で取りに行く
zero-shot voice cloning Cartesia / ElevenLabs Fish S2 / Kokoro 圏外 (next-gen で挑戦)
多言語 (10+) Fish S2 Pro / Cartesia OpenAI 中位 (35 言語あるが品質差)
OSS 完全 (学習+推論+ウェイト) piper-plus (なし) 首位

ベンチマークソース (信頼度別)

⭐⭐⭐⭐⭐ 最高信頼

モデル ソース
Fish S2 Pro arXiv:2603.08823 (WER 0.54-0.99%)、GitHub
Kokoro HF Model CardEVAL.md、TTS Spaces Arena
Piper GitHub OHF-Voice/piper1-gpl

⭐⭐⭐⭐ 高信頼

モデル ソース
ElevenLabs 公式ドキュメント・商用実装事例
Coqui XTTS GitHub + ReadTheDocs
GPT-SoVITS GitHub + 論文

⭐⭐⭐ 中信頼

モデル ソース
VOICEVOX voicevox.hiroshiba.jp、ベンチマーク非公開
AITalk 公開ベンチマーク限定
Cerence/HOYA/RECAIUS クローズド、推定値のみ

piper-plus 差別化戦略 (このデータから言えること)

強み維持

  • エッジ・IoT 市場の RTF < 0.1 / TTFA < 50ms / モデル < 35M ポジションを失わない
  • ベンチマーク表自体を公式 Web に掲載 → 「SBV2 で動かなかったモバイル」検索ユーザー流入導線

弱点補強 (piper-plus 側で可能なもの)

  • 日本語ボイス数 2-3 → 30+ (つくよみちゃん方式コーパス受入)
  • MOS 3.8 → 4.0+ (学習データ拡張・声優コラボ)
  • zero-shot 対応: 仕様調査のみ (本格実装は next-gen 側)

弱点補強 (next-gen 側で吸収するもの)

  • MOS 4.5+ (最新アーキテクチャ・zero-shot)
  • 対応言語 80+ (Fish S2 Pro 並)
  • クラウド配信品質 (ElevenLabs / Cartesia 比較対抗)

提案書での見せ方 (テンプレ)

A. ゲーム会社向け

「Unity モバイル向け TTS で動作実証されているのは piper-plus のみ。
 RTF < 0.1 (60 FPS ゲーム内同期可)、TTFA < 50ms (リアルタイム発話)
 モデルサイズ < 35M (モバイル APK 容量制約クリア)」

B. ロボット・IoT 向け

「Raspberry Pi / ESP32 実装事例多数。Cortex-M4 級デバイスでの
 ニューラル TTS 動作が piper-plus の差別化軸。KDDI N2 (4MB) の
 旧世代 HMM 方式に対し、piper-plus はニューラル品質を維持。」

C. カーナビ・車載向け

「Cerence は車載業界標準だが、クラウド依存・多言語追加に時間。
 piper-plus はオンデバイス + 35 言語、TTFA < 50ms で
 ボイスアシスタント発話応答の体感速度を改善。」

D. コールセンター・IVR 向け

「Amazon Polly 等クラウド TTS は個人情報をクラウド送信。
 piper-plus はオンプレ・閉域展開可能、座席数連動課金から
 買い切り型へ移行で TCO 削減。」

自社ベンチマーク (継続的に計測すべき項目)

uPiper が公式に計測・公開すべき数値:

指標 計測条件 公開方法
MOS (日本語) クラウドソーシング N=50 公式 Web + 比較 Demo
MOS (英語) 同上 同上
RTF (CPU x86) Intel i5、ARM64、Cortex-M4 各種 ベンチマーク表
TTFA ストリーミング有効時 同上
メモリ使用量 推論時ピーク モデルカードに記載
モデルサイズ パラメータ数・ディスク・量子化後 同上
言語別品質マトリクス 各言語の MOS 言語追加時

関連ドキュメント

調査日: 2026/06/25 | 確度: OSS 系 High (HF/GitHub 公開数値)、商用系 Medium-Low (推定値)