百炼 TTS 模型与接入概览
36 个语音合成模型与 3 个音色服务的接口、格式、音色和计费对应关系。
本组文档介绍 Qwen-Audio-TTS、CosyVoice、Qwen-TTS 和 MiniMax 的合成、实时输出、声音复刻与声音设计。模型清单核对于 2026-10-06;实际开放模型、价格和令牌权限以 ModelSell 控制台为准。
鉴权与地址
所有示例使用 ModelSell API Key。客户端调用 ModelSell 域名;供应商 Key 和业务空间地址由渠道管理。
export MODELSELL_BASE_URL="https://api.modelsell.com"
export MODELSELL_WS_URL="wss://api.modelsell.com"
export MODELSELL_API_KEY="YOUR_MODELSELL_API_KEY"HTTP 请求使用 Authorization: Bearer $MODELSELL_API_KEY 和 Content-Type: application/json;WebSocket 握手使用相同的 Authorization 请求头。
完整模型与文档对应表
| 模型 ID | 对接文档 | 协议 | 用量单位 |
|---|---|---|---|
qwen-audio-3.0-tts-plus | Qwen-Audio / CosyVoice | HTTP / inference WS | 字符 |
qwen-audio-3.1-tts-flash | Qwen-Audio / CosyVoice | HTTP / inference WS | 输入、输出 Token |
qwen-audio-3.0-tts-flash | Qwen-Audio / CosyVoice | HTTP / inference WS | 字符 |
cosyvoice-v3.5-plus | Qwen-Audio / CosyVoice | HTTP / inference WS | 字符 |
cosyvoice-v3.5-flash | Qwen-Audio / CosyVoice | HTTP / inference WS | 字符 |
cosyvoice-v3-plus | Qwen-Audio / CosyVoice | HTTP / inference WS | 字符 |
cosyvoice-v3-flash | Qwen-Audio / CosyVoice | HTTP / inference WS | 字符 |
cosyvoice-v2 | Qwen-Audio / CosyVoice | HTTP / inference WS | 字符 |
cosyvoice-v1 | Qwen-Audio / CosyVoice | inference WS;speech 桥接 | 字符 |
qwen3-tts-flash | Qwen HTTP | HTTP | 字符 |
qwen3-tts-flash-2025-11-27 | Qwen HTTP | HTTP | 字符 |
qwen3-tts-flash-2025-09-18 | Qwen HTTP | HTTP | 字符 |
qwen3-tts-instruct-flash | Qwen HTTP | HTTP | 字符 |
qwen3-tts-instruct-flash-2026-01-26 | Qwen HTTP | HTTP | 字符 |
qwen3-tts-vc-2026-01-22 | Qwen HTTP · 复刻 | HTTP | 字符 |
qwen3-tts-vd-2026-01-26 | Qwen HTTP · 设计 | HTTP | 字符 |
qwen-tts | Qwen HTTP | HTTP | 输入、输出 Token |
qwen-tts-latest | Qwen HTTP | HTTP | 输入、输出 Token |
qwen-tts-2025-05-22 | Qwen HTTP | HTTP | 输入、输出 Token |
qwen-tts-2025-04-10 | Qwen HTTP | HTTP | 输入、输出 Token |
qwen3-tts-flash-realtime | Qwen 实时 TTS | realtime WS | 会话累计字符 |
qwen3-tts-flash-realtime-2025-11-27 | Qwen 实时 TTS | realtime WS | 会话累计字符 |
qwen3-tts-flash-realtime-2025-09-18 | Qwen 实时 TTS | realtime WS | 会话累计字符 |
qwen3-tts-instruct-flash-realtime | Qwen 实时 TTS | realtime WS | 会话累计字符 |
qwen3-tts-instruct-flash-realtime-2026-01-22 | Qwen 实时 TTS | realtime WS | 会话累计字符 |
qwen3-tts-vc-realtime-2026-01-15 | Qwen 实时 TTS · 复刻 | realtime WS | 会话累计字符 |
qwen3-tts-vc-realtime-2025-11-27 | Qwen 实时 TTS · 复刻 | realtime WS | 会话累计字符 |
qwen3-tts-vd-realtime-2026-01-15 | Qwen 实时 TTS · 设计 | realtime WS | 会话累计字符 |
qwen3-tts-vd-realtime-2025-12-16 | Qwen 实时 TTS · 设计 | realtime WS | 会话累计字符 |
qwen-tts-realtime | Qwen 实时 TTS | realtime WS | 每个 response 的 Token |
qwen-tts-realtime-latest | Qwen 实时 TTS | realtime WS | 每个 response 的 Token |
qwen-tts-realtime-2025-07-15 | Qwen 实时 TTS | realtime WS | 每个 response 的 Token |
MiniMax/speech-2.8-hd | MiniMax TTS | HTTP | 字符 |
MiniMax/speech-02-hd | MiniMax TTS | HTTP | 字符 |
MiniMax/speech-2.8-turbo | MiniMax TTS | HTTP | 字符 |
MiniMax/speech-02-turbo | MiniMax TTS | HTTP | 字符 |
voice-enrollment | 音色定制 | customization HTTP | 创建/管理操作 |
qwen-voice-enrollment | 音色定制 | customization HTTP | 创建/管理操作 |
qwen-voice-design | 音色定制 | customization HTTP | 创建/管理操作 |
选择接口
| 需求 | 入口 | 响应 |
|---|---|---|
| 完整文本,直接保存音频 | POST /v1/audio/speech | 音频字节 |
| Qwen-Audio / CosyVoice 原生参数 | POST /api/v1/services/audio/tts/SpeechSynthesizer | JSON 或 SSE |
| Qwen HTTP / MiniMax 原生参数 | POST /api/v1/services/aigc/multimodal-generation/generation | JSON 或 SSE |
| Qwen-Audio / CosyVoice 双向流式 | GET /api-ws/v1/inference?model=... | JSON 事件与二进制帧 |
| Qwen realtime 逐段输入 | GET /api-ws/v1/realtime?model=... | JSON 事件与 Base64 音频 |
| 创建或管理专属音色 | POST /api/v1/services/audio/tts/customization | JSON |
cosyvoice-v1 没有原生 HTTP 合成接口;标准 speech 请求由网关桥接到 inference WS。Qwen realtime 型号使用 WebSocket。本文所述 HTTP/WS 接口不提供 AOQ/QUIC 端侧传输。
标准 speech 示例
curl --fail-with-body "$MODELSELL_BASE_URL/v1/audio/speech" \
-H "Authorization: Bearer $MODELSELL_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "cosyvoice-v3-flash",
"input": "欢迎使用 ModelSell,开始今天的语音创作。",
"voice": "longanyang",
"response_format": "mp3",
"speed": 1.0,
"extra_body": {"input": {"sample_rate": 24000, "seed": 0}}
}' --output speech.mp3标准参数包括 model、input(文本)、voice、response_format、speed、instructions。extra_body 补充原生 input / parameters;显式 0 和 false 会保留。它不能更换 model,也不能用 input.text 替换标准文本。
stream: true 返回二进制分片,stream_format: "sse" 返回原生 SSE;后者用于读取时间戳和用量。音频格式由模型决定,网关不转码:Qwen HTTP 非流式为 WAV、流式为 PCM,MiniMax/CosyVoice 按具体参数选择格式。
价格与用量
字符模型按照上游报告的 usage.characters(MiniMax 也可能在 output.extra_info.usage_characters)结算;Token 模型区分输入和输出用量。Qwen3 realtime 为会话累计字符,不能把多个 response 的累计值再次相加;旧 Qwen realtime 需要汇总各 response 的 Token。音色创建、更新与查询等操作可能使用不同价格,查询是否免费以站点规则为准。
文档清单与实际开放范围
清单用于查找接口格式,不承诺所有型号均已在你的分组开放。模型权限、可用渠道及最新价格请查看控制台;音色必须与创建时的目标模型和供应商业务空间匹配。
官方依据:语音合成模型概述。各指南列出对应 API 参考;示例使用占位符和自编文本,不包含供应商凭据。