TTS 品質・性能ベンチマーク比較表
提案書で「数字で勝てる」を示すための公開ベンチマーク数値集。
指標の定義:
- MOS: Mean Opinion Score (5 段階主観品質、4.0 超で「自然」、4.3 超で「人間と区別困難」)
- RTF: Real-Time Factor (推論時間/合成音声長、0.1 = 10 倍速)
- TTFA: Time to First Audio (ストリーミング初音までの時間)
- WER: Word Error Rate (zero-shot 系の文字起こし精度)
エグゼクティブサマリー
Piper-Plus の競争力マトリクス
✅ 数字で勝てる項目 (差別化軸)
| 指標 |
値 |
比較対象 |
| RTF (GPU) |
< 0.1 |
Fish S2 Pro 0.195、ElevenLabs N/A |
| TTFA |
< 50ms |
ElevenLabs < 500ms |
| モデルサイズ |
18-35M params |
Kokoro 82M、Fish S2 4B |
| 組込実装実績 |
Raspberry Pi / ESP32 等多数 |
ほぼ唯一の実用例 |
⚠️ 数字で負ける項目 (要改善・捨てる)
| 指標 |
piper-plus |
勝者 |
| MOS |
3.2-3.8 |
Kokoro 4.0+、Fish S2 4.5+、ElevenLabs v3 4.5+ |
| 対応言語数 |
35 |
Fish S2 Pro 80+ |
| 日本語ボイス数 |
2-3 |
VOICEVOX 200+ |
| zero-shot 対応 |
非対応 |
Fish S2, Kokoro |
→ 「軽量・高速・組込」で勝ち、「主観品質・話者数・zero-shot」を次世代モデルで埋める戦略の根拠。
ベンチマーク比較表 (主要指標)
| モデル |
MOS |
RTF (GPU) |
TTFA |
パラメータ |
言語数 |
zero-shot |
ライセンス |
| piper / piper-plus |
3.2-3.8 |
< 0.1 |
< 50ms |
18-35M |
35 |
✗ |
OSS (MIT/GPL) |
| Kokoro-82M |
4.0+ |
中速 |
高速 |
82M |
8 |
✓ |
Open weights |
| Fish Speech S2 Pro |
4.5+ * |
0.195 |
~100ms |
4B |
80+ |
✓ |
OSS |
| Style-Bert-VITS2 |
4.0+ |
中速 (GPU 必須) |
中速 |
~100M |
日本語ほぼ |
✗ |
AGPL OSS |
| VOICEVOX |
(公式未公開) |
中速 |
中速 |
100-500M |
日本語のみ |
✗ |
LGPL OSS |
| GPT-SoVITS |
4.0+ |
中速 |
中速 |
~250M |
多言語 |
✓ |
OSS |
| Coqui XTTS-v2 |
3.8-4.0 |
中速 |
中速 |
~700M |
16 |
✓ |
CPML (商用制限) |
| ElevenLabs v3 |
4.5+ |
N/A (cloud) |
< 500ms |
クローズド |
30+ |
✓ |
商用 API |
| Cartesia Sonic-3 |
4.5+ |
N/A |
~40ms ** |
クローズド |
42 |
✓ |
商用 API |
| OpenAI Realtime TTS |
4.5+ |
N/A |
< 800ms |
クローズド |
50+ |
△ |
商用 API |
| AITalk (エーアイ) |
4.0 (推定) |
N/A |
N/A |
クローズド |
日本語+α |
✗ |
商用 SDK |
| HOYA ReadSpeaker |
3.8-4.0 (推定) |
N/A |
N/A |
クローズド |
45 |
✗ |
商用 SDK |
| Cerence |
4.0+ (推定) |
N/A |
N/A |
クローズド |
70+ |
△ |
商用 SDK |
* Fish S2 Pro: Seed-TTS Eval WER 0.54-0.99% (最良)、Audio Turing Test 0.515
** Cartesia Sonic-3: sub-100ms 公称、on-device は更に高速
市場セグメント別ポジショニング
| セグメント |
最強モデル |
第 2 位 |
piper-plus の位置 |
| エッジ・IoT・モバイル組込 |
piper / piper-plus |
KDDI N2 (旧世代) |
首位 |
| クラウド高品質 |
Fish S2 Pro / ElevenLabs |
OpenAI |
圏外 (next-gen で挑戦) |
| 日本語特化 |
VOICEVOX |
SBV2 |
コミュニティ流入で取りに行く |
| zero-shot voice cloning |
Cartesia / ElevenLabs |
Fish S2 / Kokoro |
圏外 (next-gen で挑戦) |
| 多言語 (10+) |
Fish S2 Pro / Cartesia |
OpenAI |
中位 (35 言語あるが品質差) |
| OSS 完全 (学習+推論+ウェイト) |
piper-plus |
(なし) |
首位 |
ベンチマークソース (信頼度別)
⭐⭐⭐⭐⭐ 最高信頼
⭐⭐⭐⭐ 高信頼
| モデル |
ソース |
| ElevenLabs |
公式ドキュメント・商用実装事例 |
| Coqui XTTS |
GitHub + ReadTheDocs |
| GPT-SoVITS |
GitHub + 論文 |
⭐⭐⭐ 中信頼
piper-plus 差別化戦略 (このデータから言えること)
強み維持
- エッジ・IoT 市場の RTF < 0.1 / TTFA < 50ms / モデル < 35M ポジションを失わない
- ベンチマーク表自体を公式 Web に掲載 → 「SBV2 で動かなかったモバイル」検索ユーザー流入導線
弱点補強 (piper-plus 側で可能なもの)
- 日本語ボイス数 2-3 → 30+ (つくよみちゃん方式コーパス受入)
- MOS 3.8 → 4.0+ (学習データ拡張・声優コラボ)
- zero-shot 対応: 仕様調査のみ (本格実装は next-gen 側)
弱点補強 (next-gen 側で吸収するもの)
- MOS 4.5+ (最新アーキテクチャ・zero-shot)
- 対応言語 80+ (Fish S2 Pro 並)
- クラウド配信品質 (ElevenLabs / Cartesia 比較対抗)
提案書での見せ方 (テンプレ)
A. ゲーム会社向け
「Unity モバイル向け TTS で動作実証されているのは piper-plus のみ。
RTF < 0.1 (60 FPS ゲーム内同期可)、TTFA < 50ms (リアルタイム発話)
モデルサイズ < 35M (モバイル APK 容量制約クリア)」
B. ロボット・IoT 向け
「Raspberry Pi / ESP32 実装事例多数。Cortex-M4 級デバイスでの
ニューラル TTS 動作が piper-plus の差別化軸。KDDI N2 (4MB) の
旧世代 HMM 方式に対し、piper-plus はニューラル品質を維持。」
C. カーナビ・車載向け
「Cerence は車載業界標準だが、クラウド依存・多言語追加に時間。
piper-plus はオンデバイス + 35 言語、TTFA < 50ms で
ボイスアシスタント発話応答の体感速度を改善。」
D. コールセンター・IVR 向け
「Amazon Polly 等クラウド TTS は個人情報をクラウド送信。
piper-plus はオンプレ・閉域展開可能、座席数連動課金から
買い切り型へ移行で TCO 削減。」
自社ベンチマーク (継続的に計測すべき項目)
uPiper が公式に計測・公開すべき数値:
| 指標 |
計測条件 |
公開方法 |
| MOS (日本語) |
クラウドソーシング N=50 |
公式 Web + 比較 Demo |
| MOS (英語) |
同上 |
同上 |
| RTF (CPU x86) |
Intel i5、ARM64、Cortex-M4 各種 |
ベンチマーク表 |
| TTFA |
ストリーミング有効時 |
同上 |
| メモリ使用量 |
推論時ピーク |
モデルカードに記載 |
| モデルサイズ |
パラメータ数・ディスク・量子化後 |
同上 |
| 言語別品質マトリクス |
各言語の MOS |
言語追加時 |
関連ドキュメント
調査日: 2026/06/25 | 確度: OSS 系 High (HF/GitHub 公開数値)、商用系 Medium-Low (推定値)