ModelSell 文档
音频与其他百炼语音合成

百炼 TTS 模型与接入概览

36 个语音合成模型与 3 个音色服务的接口、格式、音色和计费对应关系。

本组文档介绍 Qwen-Audio-TTS、CosyVoice、Qwen-TTS 和 MiniMax 的合成、实时输出、声音复刻与声音设计。模型清单核对于 2026-10-06;实际开放模型、价格和令牌权限以 ModelSell 控制台为准。

鉴权与地址

所有示例使用 ModelSell API Key。客户端调用 ModelSell 域名;供应商 Key 和业务空间地址由渠道管理。

export MODELSELL_BASE_URL="https://api.modelsell.com"
export MODELSELL_WS_URL="wss://api.modelsell.com"
export MODELSELL_API_KEY="YOUR_MODELSELL_API_KEY"

HTTP 请求使用 Authorization: Bearer $MODELSELL_API_KEY 和 Content-Type: application/json;WebSocket 握手使用相同的 Authorization 请求头。

完整模型与文档对应表

模型 ID对接文档协议用量单位
qwen-audio-3.0-tts-plusQwen-Audio / CosyVoiceHTTP / inference WS字符
qwen-audio-3.1-tts-flashQwen-Audio / CosyVoiceHTTP / inference WS输入、输出 Token
qwen-audio-3.0-tts-flashQwen-Audio / CosyVoiceHTTP / inference WS字符
cosyvoice-v3.5-plusQwen-Audio / CosyVoiceHTTP / inference WS字符
cosyvoice-v3.5-flashQwen-Audio / CosyVoiceHTTP / inference WS字符
cosyvoice-v3-plusQwen-Audio / CosyVoiceHTTP / inference WS字符
cosyvoice-v3-flashQwen-Audio / CosyVoiceHTTP / inference WS字符
cosyvoice-v2Qwen-Audio / CosyVoiceHTTP / inference WS字符
cosyvoice-v1Qwen-Audio / CosyVoiceinference WS;speech 桥接字符
qwen3-tts-flashQwen HTTPHTTP字符
qwen3-tts-flash-2025-11-27Qwen HTTPHTTP字符
qwen3-tts-flash-2025-09-18Qwen HTTPHTTP字符
qwen3-tts-instruct-flashQwen HTTPHTTP字符
qwen3-tts-instruct-flash-2026-01-26Qwen HTTPHTTP字符
qwen3-tts-vc-2026-01-22Qwen HTTP · 复刻HTTP字符
qwen3-tts-vd-2026-01-26Qwen HTTP · 设计HTTP字符
qwen-ttsQwen HTTPHTTP输入、输出 Token
qwen-tts-latestQwen HTTPHTTP输入、输出 Token
qwen-tts-2025-05-22Qwen HTTPHTTP输入、输出 Token
qwen-tts-2025-04-10Qwen HTTPHTTP输入、输出 Token
qwen3-tts-flash-realtimeQwen 实时 TTSrealtime WS会话累计字符
qwen3-tts-flash-realtime-2025-11-27Qwen 实时 TTSrealtime WS会话累计字符
qwen3-tts-flash-realtime-2025-09-18Qwen 实时 TTSrealtime WS会话累计字符
qwen3-tts-instruct-flash-realtimeQwen 实时 TTSrealtime WS会话累计字符
qwen3-tts-instruct-flash-realtime-2026-01-22Qwen 实时 TTSrealtime WS会话累计字符
qwen3-tts-vc-realtime-2026-01-15Qwen 实时 TTS · 复刻realtime WS会话累计字符
qwen3-tts-vc-realtime-2025-11-27Qwen 实时 TTS · 复刻realtime WS会话累计字符
qwen3-tts-vd-realtime-2026-01-15Qwen 实时 TTS · 设计realtime WS会话累计字符
qwen3-tts-vd-realtime-2025-12-16Qwen 实时 TTS · 设计realtime WS会话累计字符
qwen-tts-realtimeQwen 实时 TTSrealtime WS每个 response 的 Token
qwen-tts-realtime-latestQwen 实时 TTSrealtime WS每个 response 的 Token
qwen-tts-realtime-2025-07-15Qwen 实时 TTSrealtime WS每个 response 的 Token
MiniMax/speech-2.8-hdMiniMax TTSHTTP字符
MiniMax/speech-02-hdMiniMax TTSHTTP字符
MiniMax/speech-2.8-turboMiniMax TTSHTTP字符
MiniMax/speech-02-turboMiniMax TTSHTTP字符
voice-enrollment音色定制customization HTTP创建/管理操作
qwen-voice-enrollment音色定制customization HTTP创建/管理操作
qwen-voice-design音色定制customization HTTP创建/管理操作

选择接口

需求入口响应
完整文本,直接保存音频POST /v1/audio/speech音频字节
Qwen-Audio / CosyVoice 原生参数POST /api/v1/services/audio/tts/SpeechSynthesizerJSON 或 SSE
Qwen HTTP / MiniMax 原生参数POST /api/v1/services/aigc/multimodal-generation/generationJSON 或 SSE
Qwen-Audio / CosyVoice 双向流式GET /api-ws/v1/inference?model=...JSON 事件与二进制帧
Qwen realtime 逐段输入GET /api-ws/v1/realtime?model=...JSON 事件与 Base64 音频
创建或管理专属音色POST /api/v1/services/audio/tts/customizationJSON

cosyvoice-v1 没有原生 HTTP 合成接口;标准 speech 请求由网关桥接到 inference WS。Qwen realtime 型号使用 WebSocket。本文所述 HTTP/WS 接口不提供 AOQ/QUIC 端侧传输。

标准 speech 示例

curl --fail-with-body "$MODELSELL_BASE_URL/v1/audio/speech" \
  -H "Authorization: Bearer $MODELSELL_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "cosyvoice-v3-flash",
    "input": "欢迎使用 ModelSell,开始今天的语音创作。",
    "voice": "longanyang",
    "response_format": "mp3",
    "speed": 1.0,
    "extra_body": {"input": {"sample_rate": 24000, "seed": 0}}
  }' --output speech.mp3

标准参数包括 model、input(文本)、voice、response_format、speed、instructions。extra_body 补充原生 input / parameters;显式 0 和 false 会保留。它不能更换 model,也不能用 input.text 替换标准文本。

stream: true 返回二进制分片,stream_format: "sse" 返回原生 SSE;后者用于读取时间戳和用量。音频格式由模型决定,网关不转码:Qwen HTTP 非流式为 WAV、流式为 PCM,MiniMax/CosyVoice 按具体参数选择格式。

价格与用量

字符模型按照上游报告的 usage.characters(MiniMax 也可能在 output.extra_info.usage_characters)结算;Token 模型区分输入和输出用量。Qwen3 realtime 为会话累计字符,不能把多个 response 的累计值再次相加;旧 Qwen realtime 需要汇总各 response 的 Token。音色创建、更新与查询等操作可能使用不同价格,查询是否免费以站点规则为准。

文档清单与实际开放范围

清单用于查找接口格式,不承诺所有型号均已在你的分组开放。模型权限、可用渠道及最新价格请查看控制台;音色必须与创建时的目标模型和供应商业务空间匹配。

官方依据:语音合成模型概述。各指南列出对应 API 参考;示例使用占位符和自编文本,不包含供应商凭据。

On this page