API 參考文字轉語音即時文字轉語音
即時文字轉語音 v1
維護仍使用已凍結 Realtime TTS WebSocket v1 協定的客戶端。
Realtime TTS v1 是現有客戶端的凍結相容協定。新接入應使用上級 v3 協定;v1、v2、v3 的事件與欄位並不相同。
端點、驗證與編碼
| 項目 | 值 |
|---|---|
| WebSocket | wss://realtime.fishaudio.org/v1/tts/live |
| 子協定 | realtime.tts.msgpack.v1 |
| 編碼 | MessagePack 二進位幀 |
Authorization: Bearer FISHAUDIO_API_KEY
Sec-WebSocket-Protocol: realtime.tts.msgpack.v1不要把憑證放入 URL 或瀏覽器程式碼。
事件流程
authenticated → start → ready → text → flush → audio → usage → stop → finish客戶端事件為 start、text、flush、stop、ping。服務端事件為 authenticated、ready、audio、usage、pong、warning、finish、error。音訊位於 audio.data;可在 stop 前重複 text → flush 以產生多個分段。
start.request
| 欄位 | 規則 |
|---|---|
model_id | 必填,公開音色/模型 UUID;亦接受 modelId。 |
engine_model_id | 選填;亦接受 engineModelId。 |
format | mp3、wav、pcm、opus,預設 mp3。 |
speed / volume | 0.5–2 / 0–10。 |
language | 1–32 個字元。 |
chunk_length | 100–300 的整數。 |
latency | normal 或 balanced。 |
所有訊息都是 MessagePack Map,未知欄位會被拒絕。系統按成功接受的 flush 分段結算;v1 不提供持久重放或分段冪等。錯誤包含 code、message、retryable。新功能請遷移到即時文字轉語音 v3。