Skip to main content
POST
获取人声音轨
从音频片段中提取人声音轨。返回的 idvox_audio_id,用于 创建 Persona — 构建可用于 task=inspirationpersona_style: "vox"Vox Persona 的第一步。
此端点直接返回结果(不是任务 ID)。提取过程是同步处理的。
默认内部截取约 45~74 秒 人声。若歌曲短于 74 秒或需其他区间,请按集成方式处理 vocal_start_s / vocal_end_s(如支持)。

请求体

string
必填
要从中提取人声的音频片段 ID。

响应

string
人声音频 ID。创建角色时作为 vox_audio_id 使用。
string
提取状态(例如 "complete")。
string
被处理的原始片段 ID。
number
检测到的人声开始时间(秒)。
number
检测到的人声结束时间(秒)。
string
提取的人声音频文件 URL。

示例

响应示例

工作流程:创建 Vox Persona

  1. Get Vox Stem — 提取人声,将返回的 id 作为 vox_audio_id
  2. 创建 Personaclip_idroot_clip_id,并设置 root clip 上的人声范围
创建 Persona 时的 vocal_start_s / vocal_end_s 表示 root clip 上的有效人声范围(常为 0 至 clip 总时长),不是 getVoxStem 内部 45~74 秒的截取区间。
Inspiration 生成 中使用该 Persona:persona_style: "vox"artist_clip_id 设为 Persona 的 root_clip_id