ModelSell 文档
音频与其他百炼语音合成

MiniMax 语音合成与复刻

4 个 MiniMax Speech 模型的 HTTP、SSE、hex 音频、字幕与声音克隆。

适用模型:MiniMax/speech-2.8-hd、MiniMax/speech-02-hd、MiniMax/speech-2.8-turbo、MiniMax/speech-02-turbo。

接口与参数

POST /api/v1/services/aigc/multimodal-generation/generation
Authorization: Bearer $MODELSELL_API_KEY
Content-Type: application/json
字段类型说明
model / input.textstring必填,型号和朗读文本
input.voice_setting.voice_idstring必填,系统或克隆音色
input.voice_setting.speed / vol / pitchnumber可选,语速、音量、音高
input.voice_setting.emotionstring可选,情感;取值能力依型号而定
input.audio_settingobject可选,format、sample_rate、bitrate、channel
input.output_formatstringhex(默认)或 url;流式仅 hex
input.stream_options.exclude_aggregated_audioboolean流式设 true,尾帧不再返回整段音频
input.pronunciation_dict / timbre_weights / voice_modifyobject / array / object发音词典、音色混合、声音效果
input.language_boost / latex_read / text_normalizationstring / boolean / boolean语言增强、公式朗读、文本规范化
input.subtitle_enableboolean非流式字幕,支持范围见官方参考
input.aigc_watermarkboolean非流式隐性标识
curl --fail-with-body "$MODELSELL_BASE_URL/api/v1/services/aigc/multimodal-generation/generation" \
  -H "Authorization: Bearer $MODELSELL_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"MiniMax/speech-2.8-turbo","input":{"text":"欢迎收听我们的创作分享。","voice_setting":{"voice_id":"female-shaonv","speed":1.0,"pitch":0},"audio_setting":{"format":"mp3","sample_rate":24000},"output_format":"hex"}}' \
  --output response.json

读取音频与字幕

{"request_id":"REQUEST_ID","output":{"data":{"audio":"HEX_AUDIO","status":2},"extra_info":{"usage_characters":12},"base_resp":{"status_code":0,"status_msg":""}},"usage":{"characters":12}}

示例响应只展示关键字段。output.data.audio 为 hex 时用十六进制解码,不能 Base64 解码:

import json
from pathlib import Path

result = json.loads(Path("response.json").read_text())
Path("speech.mp3").write_bytes(bytes.fromhex(result["output"]["data"]["audio"]))

output_format: "url" 时该字段为短期下载 URL。开启字幕后还可能有 output.data.subtitle_file;保留完整响应读取该地址。output.base_resp.status_code 非零表示供应商业务错误。

SSE 与标准 speech

请求头添加 X-DashScope-SSE: enable 以 SSE 返回 hex 分片。设置 input.stream_options.exclude_aggregated_audio: true 后按顺序解码音频,避免重复追加默认尾帧中的整段音频。

标准 speech 会解码 hex 并直接返回字节;voice 映射到 voice_setting.voice_id,speed 映射到 voice_setting.speed,response_format 映射到 audio_setting.format。字幕、情感等扩展放入 extra_body.input。

声音克隆

同一个 multigen 接口使用 input.action: "voice_clone",不是 customization 路径:

{"model":"MiniMax/speech-2.8-turbo","input":{"action":"voice_clone","voice_id":"MyStudioVoice20261006","audio_url":"https://example.com/my-voice-sample.wav","text":"这是一段用于确认新音色的试听文本。","need_noise_reduction":false,"need_volume_normalization":false}}

替换为可公网访问的真实样本 URL,并使用唯一 voice_id。检查 output.base_resp,从 output.demo_audio 试听;后续合成使用同一 voice_id。该百炼接口不提供 MiniMax 音色列表、查询、更新和删除功能。克隆试听及首次使用可能涉及供应商费用,ModelSell 收费以控制台规则为准。

官方参考:同步合成 API、声音复刻 API。核对日期:2026-10-06。

On this page