MiniMax 语音合成与复刻
4 个 MiniMax Speech 模型的 HTTP、SSE、hex 音频、字幕与声音克隆。
适用模型:MiniMax/speech-2.8-hd、MiniMax/speech-02-hd、MiniMax/speech-2.8-turbo、MiniMax/speech-02-turbo。
接口与参数
POST /api/v1/services/aigc/multimodal-generation/generation
Authorization: Bearer $MODELSELL_API_KEY
Content-Type: application/json| 字段 | 类型 | 说明 |
|---|---|---|
model / input.text | string | 必填,型号和朗读文本 |
input.voice_setting.voice_id | string | 必填,系统或克隆音色 |
input.voice_setting.speed / vol / pitch | number | 可选,语速、音量、音高 |
input.voice_setting.emotion | string | 可选,情感;取值能力依型号而定 |
input.audio_setting | object | 可选,format、sample_rate、bitrate、channel |
input.output_format | string | hex(默认)或 url;流式仅 hex |
input.stream_options.exclude_aggregated_audio | boolean | 流式设 true,尾帧不再返回整段音频 |
input.pronunciation_dict / timbre_weights / voice_modify | object / array / object | 发音词典、音色混合、声音效果 |
input.language_boost / latex_read / text_normalization | string / boolean / boolean | 语言增强、公式朗读、文本规范化 |
input.subtitle_enable | boolean | 非流式字幕,支持范围见官方参考 |
input.aigc_watermark | boolean | 非流式隐性标识 |
curl --fail-with-body "$MODELSELL_BASE_URL/api/v1/services/aigc/multimodal-generation/generation" \
-H "Authorization: Bearer $MODELSELL_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"MiniMax/speech-2.8-turbo","input":{"text":"欢迎收听我们的创作分享。","voice_setting":{"voice_id":"female-shaonv","speed":1.0,"pitch":0},"audio_setting":{"format":"mp3","sample_rate":24000},"output_format":"hex"}}' \
--output response.json读取音频与字幕
{"request_id":"REQUEST_ID","output":{"data":{"audio":"HEX_AUDIO","status":2},"extra_info":{"usage_characters":12},"base_resp":{"status_code":0,"status_msg":""}},"usage":{"characters":12}}示例响应只展示关键字段。output.data.audio 为 hex 时用十六进制解码,不能 Base64 解码:
import json
from pathlib import Path
result = json.loads(Path("response.json").read_text())
Path("speech.mp3").write_bytes(bytes.fromhex(result["output"]["data"]["audio"]))output_format: "url" 时该字段为短期下载 URL。开启字幕后还可能有 output.data.subtitle_file;保留完整响应读取该地址。output.base_resp.status_code 非零表示供应商业务错误。
SSE 与标准 speech
请求头添加 X-DashScope-SSE: enable 以 SSE 返回 hex 分片。设置 input.stream_options.exclude_aggregated_audio: true 后按顺序解码音频,避免重复追加默认尾帧中的整段音频。
标准 speech 会解码 hex 并直接返回字节;voice 映射到 voice_setting.voice_id,speed 映射到 voice_setting.speed,response_format 映射到 audio_setting.format。字幕、情感等扩展放入 extra_body.input。
声音克隆
同一个 multigen 接口使用 input.action: "voice_clone",不是 customization 路径:
{"model":"MiniMax/speech-2.8-turbo","input":{"action":"voice_clone","voice_id":"MyStudioVoice20261006","audio_url":"https://example.com/my-voice-sample.wav","text":"这是一段用于确认新音色的试听文本。","need_noise_reduction":false,"need_volume_normalization":false}}替换为可公网访问的真实样本 URL,并使用唯一 voice_id。检查 output.base_resp,从 output.demo_audio 试听;后续合成使用同一 voice_id。该百炼接口不提供 MiniMax 音色列表、查询、更新和删除功能。克隆试听及首次使用可能涉及供应商费用,ModelSell 收费以控制台规则为准。