ModelSell 文档
音频与其他百炼语音合成

Qwen HTTP 语音合成

Qwen3 Flash、Instruct、VC、VD 和旧版 Qwen-TTS 的 HTTP 请求与响应。

系列模型
Qwen3 Flashqwen3-tts-flash、qwen3-tts-flash-2025-11-27、qwen3-tts-flash-2025-09-18
指令控制qwen3-tts-instruct-flash、qwen3-tts-instruct-flash-2026-01-26
专属音色qwen3-tts-vc-2026-01-22、qwen3-tts-vd-2026-01-26
旧版qwen-tts、qwen-tts-latest、qwen-tts-2025-05-22、qwen-tts-2025-04-10

接口与入参

POST /api/v1/services/aigc/multimodal-generation/generation
Authorization: Bearer $MODELSELL_API_KEY
Content-Type: application/json
字段类型说明
modelstring必填,HTTP 型号,不使用 realtime 型号
input.textstring必填,待朗读文本;旧 Qwen 上限 512 Token,Qwen3 上限 600 字符
input.voicestring必填,系统音色或该模型专属音色
input.language_typestring可选,如 Chinese、English、Auto
input.instructionsstring仅 Instruct 系列,控制语气与风格
input.optimize_instructionsboolean仅 Instruct 系列,默认 false,依赖 instructions
curl --fail-with-body "$MODELSELL_BASE_URL/api/v1/services/aigc/multimodal-generation/generation" \
  -H "Authorization: Bearer $MODELSELL_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"qwen3-tts-flash","input":{"text":"欢迎来到我们的语音工作室。","voice":"Cherry","language_type":"Chinese"}}'

指令示例:

{"model":"qwen3-tts-instruct-flash","input":{"text":"今天我们一起探索新的创意。","voice":"Cherry","language_type":"Chinese","instructions":"用平稳清晰的语气朗读,句尾稍作停顿。","optimize_instructions":false}}

VC / VD 不使用 Cherry:先分别通过 声音复刻或声音设计 创建音色,再把 output.voice 填入 input.voice;target_model 必须与合成型号匹配。

响应与流式

{"request_id":"REQUEST_ID","output":{"finish_reason":"stop","audio":{"url":"SIGNED_WAV_URL","data":"","id":"AUDIO_ID","expires_at":0}},"usage":{"characters":14}}

非流式音频 URL 指向 WAV。旧 Qwen 模型使用 usage.input_tokens 和 usage.output_tokens;Qwen3 使用字符计费。

请求头添加 X-DashScope-SSE: enable 开启流式。每个 SSE 事件的 output.audio.data 为 Base64 PCM 分片;解码并按顺序拼接,不能将 Base64 字符串直接写入 WAV 文件。按 SSE 空行边界解析,保留 finish_reason 和最终 usage。

也可使用 标准 speech:普通请求指定 response_format: "wav",流式指定 response_format: "pcm";网关不进行格式转换。语言和指令优化选项放入 extra_body.input。

官方参考:Qwen-TTS API、模型清单。核对日期:2026-10-06。

On this page