人声与歌声合成全景深度调研
音高 / 响度 / 情绪 / 时长 / 音色克隆 / 声乐技巧控制 × 数据 × 训练 × 产品版图
本报告系统梳理歌声合成(SVS)、歌声转换(SVC)、歌曲生成(Song Generation)与人声可控生成领域的研究工作、模型架构、数据采集与构造方法、SFT/RL 训练范式、评测基准、性能优化手段,以及全球产品与公司竞争格局,并对声乐专业术语(混声、头声、胸声、气声、闭合等)给出面向机器学习的可操作定义。
0 · 执行摘要
一句话总结:人声/歌声生成在 2021–2023 年由「两阶段声学模型 + 神经声码器」的 DiffSinger 范式主导;2023–2024 年开源社区以 RVC / so-vits-svc 把音色克隆平民化;2024–2026 年主战场转移到 Token-LM 与 Flow Matching 的整曲生成(Seed-Music、YuE、SongGen、LeVo、ACE-Step、DiffRhythm、Mureka O1、Suno/Udio),并把后训练(RLHF/DPO、多偏好对齐、CoT 推理)引入音乐生成。可控性的前沿不再是「能不能唱」,而是「能不能精确控制」——音高曲线、响度包络、情绪标签、时长对齐、零样本音色、乃至声乐技巧级(mix / belt / breathy / falsetto / vibrato)的细粒度操控。
- 控制维度的「显式化」是分水岭。传统 SVS 用 variance adaptor 显式建模音高/时长/能量;LM 系整曲生成把控制交给 prompt,但牺牲了逐音符编辑能力——两条路线正在融合(ACE-Step 的 flow 编辑、LeVo 的 lead sheet 条件、Seed-Music 的三表示框架)。
- 声乐技巧成为新的数据护城河。GTSinger 把 mix voice / falsetto / breathy / pharyngeal / vibrato / glissando 六种技巧做成受控对照标注;VocalSet 提供技巧分类基线;商业引擎(SynthV 的 Vocal Modes、ACE Studio 的 Power/Soft/Breathy/Chest 参数)已把技巧做成产品参数。
- 数据工程决定上限。录音棚采集 → 人声分离(Mel-RoFormer SDR≈12dB)→ 强制对齐(AutoLyrixAlign 等)→ RMVPE/FCPE 提取 F0 → 质量过滤 → 合成数据自举(ACE-Opencpop 式「合成+人工调参」)构成标准流水线。
- 后训练范式从 TTS 迁移到歌唱。SpeechAlign(迭代 DPO/PPO)验证了 codec-LM 的偏好优化路径;LeVo 提出 multi-preference alignment(半自动偏好数据 + 后训练);Mureka O1 引入 MusiCoT 结构化推理;歌唱任务天然存在可验证奖励(唱词准确率、F0 对齐乐谱),适合 GRPO 类算法。
- 评测仍以主观 MOS 为金标准。SingMOS/SingMOS-Pro 是相关性最高的神经 MOS;客观指标中 chroma-alignment(CQT/CENS)与 speaker embedding 相关性最好;SVCC 2025 新增 singing style 任务并发现 ARLM+Diffusion 组合最优。
- 法律成为产品设计约束。Tennessee ELVIS Act(2024)、中国《人工智能生成合成内容标识办法》(2025-09-01 施行)、北京互联网法院「AI 声音第一案」(2024)共同推动「授权音库 + 内容标识 + 溯源水印」的工程默认项。
1 · 领域全景图
2 · 人声机理与声乐术语体系
要把「混声、头声、胸声、气声、闭合」这些声乐术语变成模型可学习的控制信号,必须先在生理机制 → 声学特征 → ML 特征三层之间建立映射。本章给出这一映射表,它是第 5.6 节技巧控制的方法论基础。
2.1 发声机理与声学特征
人声产生遵循 source–filter 模型:声带振动产生激励源(source,基频 F0 与谐波列),声道(咽喉、口腔、鼻腔)作为滤波器塑造共振峰(formants)。歌唱与说话的核心差异在于:
- F0 范围:说话 F0 窄且平稳;歌唱横跨 2–4 个八度,且有 vibrato、滑音等周期性/非周期性调制。
- 声区切换:说话几乎只使用 modal register(真声);歌唱需要在 chest / mixed / head / falsetto / whistle 间连续过渡。
- 频谱能量分布:歌唱大量使用 singer's formant(约 2.8–3.2 kHz 的共振峰聚集,用于穿透乐队)与 belting 等高能量策略。
- 气声与噪声成分:breathy singing 中 aspiration noise(湍流噪声)显著提高 HNR(谐波噪声比)下降。
对应到 ML 特征:F0 轨迹(semitone 域)、能量/RMS 包络、mel 频谱 / CQT、HNR / spectral tilt、jitter/shimmer(声带周期微扰)、formant 频率与带宽、periodicity(WORLD 的 BAP/aperiodicity 参数)。这些正是 WORLD/pyworld、CREPE、RMVPE、FCPE 等 F0 提取器和声码器条件输入的基础。
2.2 声区体系:真声、假声、混声、头声、胸声、哨音
| 术语 | 英文 | 生理机制(简化) | 典型听感/用途 | 可测声学线索 |
|---|---|---|---|---|
| 胸声 | Chest voice / modal register | 声带全长振动、闭合较紧、纵向质量参与多 | 低中音区的「实」「厚」,流行主歌主力 | 强谐波、低 spectral tilt 小(亮)、HNR 高 |
| 真声 | Modal voice | 即日常说话的默认发声模式,常与胸声音区重叠但概念不同 | 自然、口语化演唱(如民谣) | F0 低、动态小 |
| 头声 | Head voice | 声带边缘振动为主、环甲肌主导拉伸 | 高音区明亮通透(美声上声区) | 高频谐波丰富、F0 高、能量略低 |
| 假声 | Falsetto | 声带仅边缘薄部振动、闭合不完全、有漏气 | 轻盈缥缈的高音(男声假音流行常用) | HNR 低(气感)、谐波弱、动态受限 |
| 混声 | Mixed voice / mix | 胸声与头声肌肉配比的连续混合,是换声点(passaggio)平滑过渡的关键技术 | 流行/音乐剧高音「既实又高」的核心技巧;分 strong mix / light mix | 介于两者之间的频谱形态;GTSinger 将其列为六大受控技巧之一 |
| 哨音 | Whistle register | 声带极短部分振动(海豚音) | 极端高音装饰(Mariah Carey) | F0 > C6,谐波极少接近正弦 |
| 咽音 | Pharyngeal voice | 会厌折叠收窄强化咽腔共鸣 | 金属芯、穿透力(摇滚/戏腔相关) | singer's formant 能量集中 |
Breath/Air 做成连续推子、DiffSinger 社区用 aperiodicity 曲线编辑的理论依据。2.3 声乐技巧词典(面向 ML 的定义)
GTSinger(浙大,NeurIPS 2024 Spotlight)把六种「歌曲中最常用」的技巧做成了受控对照数据集;VocalSet(ISMIR 2018)覆盖 17 种标准/扩展技巧。下表合并两套本体并补充工业界常用的控制参数名。
| 技巧 | 英文 | 定义与听感 | 声学/ML 特征 | 数据与产品对应 |
|---|---|---|---|---|
| 颤音 | Vibrato | F0 的周期性调制(5–7 Hz,幅度 ±20–100 cents),长音自然出现 | F0 局部正弦检测;幅度/频率/延迟 onset 三参数可显式合成 | GTSinger 技巧①;ACE Studio Vibrato 工具(幅度/相位/频率/包络四手柄);SynthV 自动 vibrato 深度 |
| 直声 | Straight tone | 无 vibrato 的平直长音,常作 vibrato 对照组 | F0 平稳度 | GTSinger 对照;VocalSet 分类基线类 |
| 气声 | Breathy voice | 声门不完全闭合、明显气流噪声的轻声唱法 | HNR↓、aperiodicity↑、高频噪声抬升 | GTSinger 技巧③;ACE Breath/Air 参数;SynthV Breathy/Whispery vocal mode |
| 假声(唱法) | Falsetto | 见 2.2;流行中作为音色选项 | 同上 | GTSinger 技巧②;ACE Falsetto 参数;SynthV Airy mode |
| 混声 | Mixed voice (mix) | 见 2.2 | 中间态频谱;需受控对照才能标注 | GTSinger 技巧①(受控对照设计是其核心贡献);ACE Verse25 引擎 Power/Chest 轴 |
| 咽音 | Pharyngeal | 见 2.2;金属质感 | singer's formant 增强 | GTSinger 技巧④ |
| 滑音 | Glissando / slide | 音高连续滑动连接两音 | F0 连续曲线(无阶跃) | GTSinger 技巧⑥;SVS 中由 pitch curve 编辑实现 |
| 怒音/嘶吼 | Growl / distortion | 假声带(室带)振动叠加或失真效果 | 非线性噪声、亚谐波 | MVD 数据集(金属嘶吼分类);YuE 论文展示 zero-shot death growl 能力 |
| 气泡音 | Vocal fry | 极低频不规则振动(<50 Hz) | 脉冲间隔高度不均 | VocalSet 分类类;说话韵律研究常见 |
| 强声 | Belt | 高音区保持胸声主导的高强度唱法(音乐剧标志) | 高能量 + 高 F0 + 明亮频谱 | VocalSet 类;SynthV Belt mode;ACE Tension/Energy 参数 |
| 花腔转音 | Melisma / riff & runs | 单音节跨多个音符快速演唱 | 音符级 F0 序列密度 | ACE-KiSing 数据集专门强化(27% 乐句含 melisma vs Opencpop 1.5%) |
| 吸气唱法 | Inhaled singing | 吸气时发声的扩展技巧 | 反向气流、噪声主导 | VocalSet 扩展技巧类 |
| 换气 | Breath (aspiration) | 乐句间/句中的呼吸声——真实感的隐形支柱 | 宽带噪声事件检测与插入 | ACE Studio 显式 breath 参数与自动呼吸插入;SVS 数据清洗时须决定保留/剔除 |
| 说唱 | Rap | 节奏化准语音演唱 | F0 平坦、节拍对齐强 | SynthV 1.9 加入 Rap 支持;ACE Studio 多语言 Rap 音源;M4Singer 含说唱风格 |
| 戏腔 | (Chinese opera timbre) | 戏曲化行腔润色(中国特有需求) | 装饰音密集、咽腔共鸣强 | 全民K歌「AI 戏腔唱金曲」功能;M4Singer 含戏曲风格子集 |
3 · 任务定义与技术路线演进
3.1 任务谱系
| 任务 | 输入 → 输出 | 控制粒度 | 代表系统 |
|---|---|---|---|
| SVS 歌声合成 | 乐谱(音素+音符+时值)+ 音色 → 歌声 | 逐音符级,最强可控性 | XiaoiceSing、DiffSinger、SynthV/ACE Studio 引擎 |
| SVC 歌声转换 | 源歌声 + 目标歌手参考 → 换音色歌声 | 保留源演唱表现力,换 timbre | so-vits-svc、RVC、DDSP-SVC、seed-vc、SVCC 参赛系统 |
| STS 说转唱 | 说话音频 + 旋律/乐谱 → 歌声 | 从语音迁移韵律到歌唱 | NANSY-SVS、AlignSTS、GTSinger STS benchmark |
| Song Generation 整曲生成 | 歌词 + 文本描述(±参考音频)→ 人声+伴奏整曲 | prompt 级,弱细粒度控制 | Suno/Udio、YuE、SongGen、LeVo、ACE-Step、DiffRhythm、Mureka |
| SVS 零样本化 | 乐谱 + 几秒参考音色 → 任意人演唱 | 音符级 + 零样本音色 | TCSinger(2)、StyleSinger、SoulX-Singer(2026)、Seed-Music Leadsheet2Vocals |
| 歌声编辑 | 已有歌声 + 局部修改指令 → 编辑后歌声 | 局部 inpainting / flow 操作 | Seed-Music 后期编辑、ACE-Step repaint/lyric edit、SynthV 参数面板 |
| 实时变声/K歌 | 流式输入 → 低延迟转换输出 | <100ms 级延迟约束 | w-okada voice-changer、DDSP-SVC realtime、StreamVC、Voicemod |
3.2 四代技术路线时间线
3.3 三大建模范式的取舍
| 维度 | 两阶段(acoustic model + vocoder) | 扩散 / Flow Matching(latent) | AR Token-LM |
|---|---|---|---|
| 可控性 | ★★★★★ 显式 F0/duration/energy 条件;可逐帧编辑 代表:XiaoiceSing、DiffSinger variance 分支 | ★★★☆☆ 条件注入后仍难精确约束;需 flow 编辑/ControlNet 补救 代表:ACE-Step、HiddenSinger | ★★☆☆☆ prompt 级控制;细粒度靠特殊 token 代表:YuE、SongGen、Suno |
| 音质上限 | 高(NSF-HiFiGAN/BigVGAN 成熟)但过平滑风险 | 最高之一;latent 扩散保真度好 | 受 codec 上限约束;LeVo 自研 codec RTF 0.09 已接近可用 |
| 推理速度 | 快(RTF ≪ 1,可实时) | 中(少步 FM/DiT 可 15× 于 LLM 系:ACE-Step A100 上 4 分钟歌约 20 秒) | 慢(token 逐个生成),需并行解码或小 codec 帧率 |
| 长程结构 | 弱(依赖外部乐谱编排) | 中(全局条件 + 分块注意力) | 强(LLM 天然长上下文;MusiCoT 先出结构再出 token;YuE 结构渐进条件) |
| 数据需求 | 强标注乐谱数据(稀缺!) | 大规模弱标音频即可起步 | 海量 in-the-wild 歌曲 + MSS 分离伪 stem |
| 典型失败模式 | 过平滑、vibrato 丢失 | 歌词咬字不清(靠 REPA 类语义对齐损失缓解) | 幻觉词/漏词、人声伴奏混叠(track-decoupled 解耦缓解) |
4 · 代表性模型与研究工作
4.1 两阶段与扩散系 SVS 主线
XiaoiceSing(Interspeech 2020,微软)确立了 FastSpeech 式「频谱+F0+时长一体化」的 SVS 基线;ByteSing 用时长分配 encoder-decoder + WaveRNN 工程化。VISinger(ICASSP 2022)/ VISinger2 把 VITS 的端到端 VAE+flow+NSF 架构引入 SVS,直接从乐谱端到端生成波形,成为 ESPnet-Muskits 工具包的两大基线之一。
DiffSinger(AAAI 2022,浙大)是本领域引用最高的工作:用浅扩散机制(shallow diffusion)——先用简单 MSE decoder 预测 mel 谱,再从预测结果与真值扩散轨迹的交点处启动少量去噪步——同时解决过平滑与推理慢。其影响远超论文本身:
- 官方代码 MoonInTheRiver/DiffSinger 与社区维护版 openvpi/DiffSinger(OpenVPI 团队)持续演进,加入 variance predictor(音素时长/F0/能量)、多说话人、零样本微调等;
- 渲染器并入 OpenUtau(ONNX 运行),形成全球最大的开源 AI 歌声音库生态(任何人都可录制并训练自己的 DiffSinger voicebank),配套中文文档、调教师社群与「AI 合成 + 人工调参」的工作流——这一生态直接孕育了 ACE-Opencpop 数据集(见 6.5);
- 浅扩散思想被移植进 SVC(so-vits-svc diffusion 分支、Diffusion-SVC、DDSP-SVC)。
后续扩散/生成式 SVS 变体:Multi-Singer DiffSinger(多歌手)、RefuseSinger(参考歌声引导)、Learn2Sing 2.0(说→唱迁移)、SmoothSinger(多分辨率条件扩散)、LAPS-Diff(语言感知韵律风格)、HiddenSinger(neural codec latent 扩散)、DiTSinger(ICASSP 2026,RoPE+qk-norm 的 DiT 系统性 scaling + 隐式对齐)、FM-Singer(2026,flow matching 修正 cVAE latent mismatch)。风格侧:StyleSinger(AAAI 2024)做零样本风格迁移 SVS;TCSinger(EMNLP 2024)/ TCSinger 2实现 audio+text prompt 双模态风格的零样本 SVS(覆盖唱法/情绪/节奏/技巧/发音五维风格);AlignSTS 做 rhythm-free 的说转唱。
4.2 Token-LM 系歌曲生成(2024–2026 主战场)
Seed-Music(字节 Seed,arXiv 2409.09214,2024-09)是目前公开细节最完整的工业框架:三种中间表示(symbolic token / audio token / vocoder latent)× 三条流水线:
- Lyrics2Leadsheet2Song:AR-LM 先把歌词生成为「lead sheet token」(对齐音素的旋律/和声/节奏符号序列,可读可编辑),再由第二个 LM 渲染成音频;配置成只输出 vocal stem 即为 SVS(Leadsheet2Vocals);
- Token2Vocal/Song:zero-shot 歌声转换与克隆(10 秒样本);
- Vocoder-latent Diffusion Transformer:非因果扩散天然适配后期制作——lead sheet 条件 inpainting 实现已生成音频中的歌词/旋律就地编辑。
- 训练分三段:预训练 → 微调(data FT 提升 musicality / instruction FT 提升可控性)→ RL 后训练(明确声明使用 RL 对齐人类偏好)。
YuE(HKUST × M-A-P,arXiv 2503.08638,Apache 2.0):基于 LLaMA2 的开源整曲基座,万亿 token 预训练,可生成最长 5 分钟带人声歌曲。三项关键设计:track-decoupled next-token prediction(人声/伴奏双轨并行 token 流,防止密集器乐淹没人声)、structural progressive conditioning(按 [verse]/[chorus] 分段渐进条件保证长程一致性)、多任务多阶段预训练配方;支持 ICL 风格迁移(city pop → 英文 rap 保伴奏)与双向生成;社区展示出未专门训练过的 scatting、death growl、多声部阿卡贝拉等涌现能力。2025-06 加入 LoRA 微调。
SongGen(ICML 2025):单阶段 AR transformer 文本到歌曲,混合模式(mixed mode)与双轨模式(dual-track mode)两种 token 排布的系统对比实验给出模式选择洞见;支持 3 秒参考音色克隆;完全开源(16kHz/30s 版本)。
LeVo(腾讯 AI Lab,arXiv 2506.07520):song generation LM + 音乐编解码器(Music Codec,RTF 0.0902,比 MuCodec 快约 7 倍);双轨/混合 token 并行预测(优于 SongGen 的 interleaved 方案在长曲上的表现);核心贡献是 multi-preference alignment——半自动构建多维偏好(整体质量/旋律吸引力/人声-伴奏和谐/结构清晰度/音质/歌词贴合)数据并进行后训练,还支持偏好向量插值以平衡不同音乐属性。主观评测全面领先开源系统,LYC(歌词贴合)超出 Suno V4.5 0.21 分。
Mureka O1 / V6(昆仑万维,2025-03-26):全球首个引入思维链的音乐模型。MusiCoT 基于 CLAP 表示,在细粒度音频 token 预测之前先生成整体音乐结构的「思考链」,提升结构连贯性与配器精度;训练含 RL(策略优化器:梯度压缩、探索利用平衡)与 CoT 数据集;V6 基座引入自研 ICL 强化人声质感,支持 10 语种、歌曲参考 prompt 与音色克隆;开放 API + 模型微调服务。
ACE-Step(ACE Studio × StepFun,arXiv 2506.00045,Apache 2.0,3.5B):「音乐的 Stable Diffusion」路线——Music-DCAE(改编自 Sana 的深度压缩自编码器,latent 约 10.77 Hz)+ Linear DiT + 条件流匹配(FM)损失 + REPA 式语义对齐辅助损失(DiT 第 8 层特征对齐 MERT/mHuBERT,显著改善咬字)。A100 上 4 分钟歌曲约 20 秒(比 LLM 基线快 15×)。原生支持 remix、repaint(时间轴 inpainting)、歌词编辑等 flow 操作级控制,并示范 LoRA / ControlNet 式下游扩展(如 lyric-to-vocal 合成、text-to-sample)。1.5 版(2026-02)演进为 2B DiT + 4B LM 混合架构。DiffRhythm(西工大 ASLP,2025)则用纯 latent diffusion 实现 8× 实时的全曲生成。
4.3 SVC 歌声转换生态(音色克隆主力)
| 系统 | 架构要点 | 特色 |
|---|---|---|
| so-vits-svc | Soft-VC(HuBERT soft units)内容特征 + VITS(VAE + normalizing flow + 判别器)+ NSF 源滤波解码器 | 2023 年现象级开源项目(>15k stars);可选 shallow diffusion 提升自然度;训练成本高、已归档但仍是效果基准 |
| RVC(Retrieval-based VC) | 同族架构 + 检索增强:推理时从训练集 HuBERT 特征索引中检索近邻并按比例混入 | 检索混合让输出更贴近目标歌手的演唱风格分布;训练快(小时级)、消费级显卡可训;衍生 v2 与庞大 WebUI 生态,是「AI 翻唱」事实标准 |
| DDSP-SVC | 可微分数字信号处理(谐波+滤波噪声)轻量合成器 + ContentVec;后期版本接 shallow diffusion 或 rectified flow(reflow)增强 | 训练资源低一个数量级、实时变声资源占用低于 so-vits;GUI 采用滑窗+SOLA 拼接+上下文参考实现准实时 |
| seed-vc(字节) | DiT 扩散变换器 zero-shot VC | 零样本克隆 + 流式实时变声分支;歌声场景表现好 |
| InvoxSVC(2025) | Latent Flow Matching + in-context learning | any-to-any 零样本 SVC,客观/主观均超 so-vits-svc |
| kNN-VC / FreeVC / StreamVC | kNN 特征替换 / VITS 变体 / Google 端侧流式 | 分别代表极简路线、单阶段路线与 on-device 低延迟路线 |
4.4 模型对比总表
| 系统 | 机构/年份 | 范式 | 控制能力 | 开源 |
|---|---|---|---|---|
| DiffSinger (+OpenVPI) | 浙大 2021 / 社区至今 | 浅扩散两阶段 | 乐谱级 + pitch/variance 曲线编辑 | MIT 开源 |
| VISinger2 | Microsoft 2022 | VAE+flow 端到端 | 乐谱级 | 未开源 |
| StyleSinger / TCSinger 2 | 浙大 2024–25 | 扩散 + 风格编码 | 零样本风格(唱法/情绪/节奏/技巧) | 开源 |
| Seed-Music | 字节 2024 | 三表示混合 AR+Diffusion | leadsheet 符号编辑 + 音频 prompt + 后期 inpainting | 闭源(豆包内) |
| YuE | HKUST/M-A-P 2025 | LLaMA2 AR,track-decoupled | 歌词/tag prompt + ICL 风格迁移 | Apache 2.0 |
| SongGen | CASIA 等 ICML 2025 | 单阶段 AR | 歌词+描述+3s 克隆;mixed/dual-track 对照 | 开源 |
| LeVo | 腾讯 AI Lab 2025 | AR + 自研 Music Codec | prompt + 多维偏好插值 | 开源(songgeneration) |
| Mureka O1/V6 | 昆仑万维 2025 | AR + MusiCoT 推理 + RL | 参考歌曲 prompt + 音色克隆 + API/微调 | API 商业 |
| ACE-Step | ACE Studio×StepFun 2025 | DCAE + Linear DiT + FM + REPA | tag/歌词/时长 + repaint/remix/ControlNet/LoRA | Apache 2.0 |
| DiffRhythm | 西工大 2025 | Latent Diffusion 全曲 | 歌词+风格,8× 实时 | 开源 |
| Suno(v5/v5.5) | Suno Inc. 2023–26 | 闭源(推测 AR/LM 混合) | prompt/personas/stems 导出 | 商业订阅 |
| RVC / so-vits-svc / DDSP-SVC | 社区 2023 | SVC 三件套 | 音色克隆 + 实时变声 | MIT/开源 |
注:Suno/Udio 未发表技术报告,业界普遍推测为「语义 token LM + 声码/扩散解码 + 大规模许可/爬取歌曲数据」的组合;本报告不对其内部架构作确定性断言。
5 · 六大控制维度深潜
5.1 音高控制(Pitch Control)
音高是歌声区别于语音的第一变量,也是所有 SVS 系统的「第一公民」。控制手段按显式程度分三层:
(a)乐谱级:音符 → F0 的自动演绎
- F0 条件建模:两阶段系统把 F0 作为声学模型输入。FastSpeech 系用 continuous wavelet transform(CWT)把 F0 轨迹分解为多尺度成分分别预测(XiaoiceSing/FAST 一脉);VISinger 在 VAE 内部联合建模 F0;DiffSinger 用独立的 pitch predictor + F0 条件 mel 扩散。
- 演绎建模:同一乐谱的演唱 F0 并非严格落在音符中心——portamento 滑入滑出、vibrato onset 延迟、blue note 偏移构成「唱法」。早期系统直接量化到音符,听感机械;后续工作学习 note→F0 的残差分布,或像 ACE Studio/SynthV 那样由 AI 先生成一条「AI Pitch」曲线供人工覆写。
- 评估指标:
F0 RMSE、Semitone Accuracy、VUV error;对转换任务用 mir_eval 的RPA/RCA/COR。
(b)曲线级:逐帧编辑(专业制作标配)
- SynthV 提供 AI Retakes / Pitch Deviation / Manual Mode 与参数面板(vibrato envelope、portamento、tone shift);ACE Studio 提供 6 个音高工具(Brush/Anchor/Fixed/Erase/Vibrato/Modulation),其中 Vibrato 工具暴露幅度、相位、频率、起振/收尾包络四组手柄,「Modulation」工具整体压缩/放大 AI 生成的音高动态——这是「生成式先验 + 参数化覆写」混合控制的典范。
- 底层技术:编辑后的 F0 曲线作为条件重新渲染(扩散系需重跑去噪或局部 repaint)。ACE-Step 展示了在 latent flow 空间做旋律重绘的可能性。
(c)Token 级:LM 系统中的音高
- Seed-Music 把音高写进可读的 lead sheet token(AR 第一阶段输出),因此「改调」= 改符号序列再重渲染,天然支持精确编辑——这是 token 系里音高可控性最好的设计。
- MusiCoT(Mureka O1)在结构层推理中隐含旋律规划;YuE/Suno 类纯 prompt 系统无法保证指定旋律复现,只能靠参考音频 ICL 近似。
5.2 响度控制(Loudness / Dynamics)
| 手段 | 说明 | 代表 |
|---|---|---|
| 能量/响度预测器 | variance adaptor 中与 duration/pitch 并列的 energy 分支,从乐谱预测逐帧 RMS | XiaoiceSing、FastSpeech2-SVS 一脉 |
| 强度曲线条件 | 把 intensity/loudness curve 作为时间对齐条件加入去噪过程 | Seed-Music 明确支持 "melody contours, intensity curves" 类时变条件注入 diffusion |
| 产品级动态参数 | 连续推子控制乐句动态包络(渐强渐弱 messa di voce) | SynthV Loudness/动态参数;ACE Studio Energy/Tension 参数自动化 |
| STS 能量对齐 | 说转唱时把说话能量对齐到目标歌唱响度轮廓 | AlignSTS(rhythm-free STS) |
| 混音一致性 | 生成人声与伴奏的相对响度(LUFS 归一化、sidechain ducking);LeVo 主观维度之一就是 vocal-instrument harmony | 整曲生成的隐性难题:人声过响/过闷是 Suno 类产品的常见差评点 |
工程要点:训练数据的响度分布高度依赖录音链路(麦克风/压缩器/mastering),需要在预处理阶段做 LUFS 统计与归一化策略设计(全局 vs 分歌手归一化),并在推理端提供用户侧 gain 匹配(如 K 歌场景的伴奏-人声自动平衡)。
5.3 情绪控制(Emotion / Style)
- 标签条件:M4Singer 提供多风格标注(美声/民族/流行/音乐剧等 10 种风格 × 20 歌手);GTSinger 给每首歌打 global style 标签(singing method / emotion / range / pace 四维)。情绪 embedding 通过 lookup + FiLM/cross-attention 注入声学模型是最常见做法。
- 参考音频(style prompt):TCSinger 用 audio+text 双模态风格编码器做零样本风格迁移,把「唱法/情绪/节奏/技巧/发音」五维解耦;Seed-Music/YuE/SongGen/Mureka 均支持音频参考驱动整体风格。
- 文本描述:LM 系统接受自由文本情绪描述("melancholic, breathy female vocal");CLAP 对齐损失让 latent 空间具备文本可引导性(ACE-Step 的 REPA 损失部分承担此角色)。
- 技巧即情绪:气声≈亲密感、belt≈爆发力、气口频率≈脆弱感——第 5.6 节的技巧控制在实践中常被用作情绪控制的低层实现路径;两条控制轴正交性越好,组合空间越大。
- 评测:情绪相似度目前没有公认客观指标,普遍做法是 CMOS/ABX 主观测试 + 风格分类器准确率代理(GTSinger technique-recognition benchmark 可复用为 style classifier)。
5.4 时长控制(Duration / Timing)
- 音素级 duration predictor:SVS 标配。乐谱给出音符时值,但音素在音符内的切分(辅音占比、元音起始)需要模型决定——ACE Studio 甚至把这个比例做成可视化拖拽编辑(辅音/元音 shading 直接拉伸)。
- 节奏对齐:整曲生成要求人声落拍。LeVo 以 PER(phoneme error rate)+ 歌词贴合 MOS 度量;YuE 用 structural progressive conditioning 维持段落节拍稳定。
- 用户指定总时长:ACE-Step 支持用户指定输出时长;SynthV/ACE Studio 天然由 MIDI 决定。
- 编辑语义:改一个词的时值后其余部分如何流动?传统方案是 variance inpainting(重预测邻域 duration);diffusion 方案是 masked inpainting(Seed-Music 后期编辑);这是「歌声编辑」任务的核心难点。
- 实时约束:K 歌评分场景还需要演唱与参考旋律的 onset 偏移度量(全民 K 歌多维实时打分系统的核心组件之一)。
5.5 音色克隆(Timbre Cloning)
音色控制有两条互补路线:
| 路线 | 机制 | 优势 | 短板 |
|---|---|---|---|
| SVC 重灌(synthesize then convert) | 先用任意音色 SVS 出干声,再用 RVC/so-vits/seed-vc 转成目标音色 | 目标音色保真度高(RVC 检索增强贴近目标唱法);目标只需几分钟~几小时干声 | 两段误差累积;F0 范围不匹配会失真(男转女需移调);表现力受源演唱限制 |
| 零样本 SVS(zero-shot singing synthesis) | 声学模型条件于 singer embedding(GE2E/d-vector/ECAPA/RawNet3)或参考 encoder;训练时多歌手 + speaker augmentation 解耦 | 一次生成即为目标音色,保留乐谱级控制;SECS 相似度可优化 | 需要大规模多歌手带谱数据(稀缺);跨音域泛化难;「音色-技巧-F0」纠缠 |
| 定制 voicebank(fine-tune / LoRA) | 目标歌手少量录音微调基座(DiffSinger 微调、ACE Studio 用户上传样本训练自定义音源、YuE LoRA) | 效果上限最高;商业授权清晰时可形成资产 | 采集成本高;过拟合小数据;版权敏感 |
5.6 技巧控制(Vocal Technique Control)——当前最前沿
技巧控制的目标:给定乐谱 + 「这段用 mix,那段换 falsetto,长音加 vibrato」的指令,模型按技巧演绎。方法谱系:
- 受控对照数据 + 技巧标签:GTSinger 是标杆——六种技巧 × 同旋律对照 × 音素级标注,配套四个 benchmark(technique-controllable SVS、technique recognition、style transfer、STS)。其 technique-controllable SVS 基线证明:把音素级技巧 embedding 注入 DiffSinger 类声学模型即可实现可控合成,且 recognition 准确率可作为控制保真度的客观代理。
- 连续参数化合成:不学离散标签,而是把技巧映射到连续声学参数轴——vibrato(幅度/频率/相位)、breathiness(aperiodicity/HNR)、belting(能量+频谱 tilt)、闭合度(HNR 连续值)。WORLD 声码器的参数化使这条路线可直接落地为产品推子(ACE Studio 的 Breath/Air/Falsetto/Tension/Energy/Formant;Verse25 引擎的 Power/Soft/Breathy/Chest + breath noise)。优点是可解释、可插值、可自动化;缺点是各轴不完全正交。
- 技巧转换(technique transfer):VocalSet 论文展望的任务——直声↔vibrato、清声↔气声互相转换。2026 年已出现专门工作(如基于 VocalSet 的 SVC vibrato 表达控制,把 pitch 类技巧与 timbre 类技巧分开独立控制以提升正交性)。
- 涌现式技巧:YuE 团队报告 scatting、death growl、阿卡贝拉和声等未专门训练的技巧在大规模 LM 上涌现——提示「数据规模 + 多样性」本身是一种技巧获取途径,但不可控、不可验证,只能事后发现。
- 技巧识别器作为奖励/过滤器:技巧分类器(VocalSet CNN 基线、GTSinger Tech-Recognition benchmark)可以反过来当数据清洗过滤器和 RL 奖励模型——见第 7 章。
5.7 四层控制体系逐层深度调研(L0–L3)
把 §5.1–5.6 的控制维度重组为四层栈:L0 声学参数层(逐帧连续曲线,监督来自信号处理、零人工成本)、L1 音符·技巧层(离散标签+局部参数,依赖受控对照种子集)、L2 表演风格层(乐句~歌曲级全局量,回归打分器+统计特征)、L3 制作美学层(stem/混音域)。粒度越细监督越便宜、用户价值越间接;本节逐层回答:物理/感知基础 → 提取标注算法 → 模型注入方式 → 保真度探针。
5.7.1 L0 声学参数层
(a)音高/F0。提取器谱系已在 §6.3(CREPE 精而慢 RTF≈0.48;RMVPE 复调鲁棒;FCPE 快 5.3× 且精度持平)。条件建模侧的关键进阶是把 F0 分解为「音准 intonation + 颤音参数化」两段:Bonada & Blaauw 的混合神经-参数 F0 模型(ICASSP 2020)用 Hilbert 变换提取 depth/rate/phase 三参数并在音符边界强制 depth→0;ExpressiveSing(ICASSP 2023)指出这会在非颤音段残留噪声,于是引入第四参数 vibrato likeliness(颤音存在概率,由自动标注网络打标),合成时 v(t) = l(t)·e(t)·cos(2πr(t)t/f_s + φ) 并按音符平均 likeliness≥0.5 门控——NUS-48E 上 F0 RMSE 20.9Hz vs 参数化基线 22.8Hz。这一「三参数 + 存在概率」的四元组就是 §5.6 技巧控制里颤音轴的工程化形态。探针:条件曲线 vs 生成 F0 的 COR≥90%;likeliness 门控处不应出现伪波动。
(b)响度包络。除 variance adaptor 能量分支与 Seed-Music 的 intensity curve 条件外,ExpressiveSing 还提出 autoencoder 式latent energy bottleneck(功率谱压缩到 T×256 瓶颈再解码重建),证明能量通道单独建模可显著提升表现力。工程侧统一用 K-weighting/LUFS 归一化消除录音链路差异(§5.2)。
(c)气声度/闭合度——临床级成熟度量可直接拿来当标注工具。HNR = 10·log₁₀(谐波功率/噪声功率),Praat 口径下健康成人 15–20dB、<10dB 即显著气声;jitter<0.5%、shimmer≤3–5% 为正常范围。但 HNR 要求准周期信号且对录音噪声敏感;CPP/CPPS(倒谱峰突出度)在连续语音上更稳健、跨平台一致性更好,是当前临床首选——两者互补:HNR 更纯反映声门源质量(不受鼻化影响),CPP 同时携带声道信息。标注管线的正确姿势:双指标并行(HNR 定气声、CPPS 兜底质量),再经 WORLD 重分解取 aperiodicity/BAP 作为逐帧连续值,走「分解→改参数→重合成」闭环验证轴的单调性。产品对应:SynthV breathiness −1~1、ACE Breath/Air 推子即此轴的编辑语义。
(d)呼吸控制。TTS 侧已有完整方法论可迁移:帧级呼吸检测用「规则法种子标注 + Conformer 下/上采样 + 自训练伪标签」在 LibriTTS-R 上免人工完成(Interspeech 2024),把检测出的 breath mark 插入文本后训练,呼吸自然度 MOS 从 3.34→3.55,甚至能为训练数据中没有呼吸的歌手合成出呼吸声;语音中的停顿内成分统称 PINTS(silence/breath/click)。数据集有 BreathBase(5,070 个呼吸实例、多姿态多麦克风)。歌唱侧的增量需求:吸气风格分类(鼻/口/急促)、乐句级换气规划(呼吸位置受乐句结构与情绪驱动,比语音更规律)、以及「呼吸作为表现手段」的深度控制——这正是 ACE Studio 显式 Breath 参数的产品化方向。探针:呼吸事件位置 IoU≥0.7、强度档位单调。
(e)颤音分析与工具链。检测工具已开源化:VibratoScope(JOSS 2026,Python/MIT,extent=1200·log₂(f₀/f_mean) cents,附 sample entropy 不规则度量,GUI+批处理 CLI);此前生态有 MATLAB 的 VAT(Hilbert 流水线)、Praat 的 EML Vibrato Tools、商业 VoceVista Pro。典型数值:rate 5–7Hz(宽口径 3–10Hz)、extent 约 ±0.3 半音量级。Amazon UTACO(AS2S 架构)展示大模型能自主「决定在哪加颤音」,但不可控不可验证——恰是参数化轴存在的理由。
| L0 轴 | 提取/标注 | 模型注入 | 保真度探针 |
|---|---|---|---|
| F0 曲线 | FCPE 批处理 + RMVPE 抽检 | CWT 或 conv1d encoder → cross-attention | COR≥90%、RMAE≤30 cents |
| 响度包络 | RMS/LUFS 逐帧 | energy curve 条件 / latent bottleneck | 包络相关 ρ≥0.9 |
| 气声度 | HNR+CPPS 双指标 → WORLD aperiodicity 连续化 | aperiodicity 曲线条件或全局推子 FiLM | 5 档推子端点 HNR 差≥6dB 且单调 |
| 呼吸 | 自训练 Conformer 检测 + 强度回归 | breath token 序列 + 深度参数 | 事件 IoU≥0.7、风格可分辨 |
| 颤音 | Hilbert/VibratoScope 提 depth/rate/phase + likeliness 自动标注 | F0 encoder 隐式承载 + 显式四参数 head | 幅度误差 ±30%、频率 ±0.5Hz |
5.7.2 L1 音符·技巧层
(a)受控对照方法论。技巧标签的可信度完全取决于采集设计。GTSinger 用「同一旋律 × 有/无某技巧」对照矩阵 + 音素级人工标注获得干净监督;VocalSet 用 scales/arpeggios/long tones/excerpts 四情境覆盖 17 类技巧但无旋律上下文对照;Phonation Modes 数据集专录 pressed/flow/breathy/neutral 四种声门模式的持续元音(有生理对照价值但脱离音乐语境);KVT 走众包 tag 路线(70 个 vocal tag 仅 6 个技巧相关,粒度粗)。结论:分类器种子集必须受控录制,规模数据靠伪标——两级供给缺一不可。
(b)技巧识别现状。VocalSet 论文给出 CNN 在 10 类技巧上的分类与歌手识别基线,并观察到 trill↔vibrato 的预期混淆;GTSinger Tech-Recognition 成为当前标准基准。混淆对管理是伪标质量的关键:falsetto↔head voice(漏气与否)、mix↔belt(音量策略差异)、fry↔growl(真声带不规则 vs 室带失真)需要在标注规范里写成判例,低置信区间(softmax<0.9)不回填。
(c)技巧可控合成。GTSinger 配套四个 benchmark(technique-controllable SVS / technique recognition / style transfer / STS);StyleSinger、TCSinger(2) 把技巧纳入零样本风格迁移的五维之一。2026 年的 vibrato 表达控制工作进一步提出把 pitch 类技巧(vibrato/straight)与 timbre 类技巧(fry/breathy/belt)分开独立控制以提升正交性——这与 SynthV 把 vibrato envelope 单独设轴、ACE 把 Power 与 Breathiness 分开的行业直觉一致。探针:tagger 标签一致率 ≥80%(§5.6 已述)。
(d)与音色的解耦纠缠。技巧和音色天然相关(同一歌手的 mix 唱法本身就是其音色签名的一部分):ContentVec 用互信息目标抑制说话人信息、speaker augmentation 打乱音高-音色相关性、RVC 干脆承认泄漏并用检索混合「拉回」目标域分布。对可控系统的影响:技巧条件注入时要防止模型把「标签」当成「歌手指纹」的代理——消融实验须包含「同标签×跨音库」的组合测试。
(e)咬字行腔与戏腔的数据缺口。现存最接近的资源:一个聚焦中国戏曲的歌唱数据集(28 位歌手、70 余段录音,VocalSet 论文综述提及)与 M4Singer 内含的戏曲风格子集;全民K歌「AI 戏腔」证明产品需求真实。但受控对照意义上的戏腔语料为零——E3 自采清单里的最高优先级项。
5.7.3 L2 表演风格层
(a)情绪:从离散标签到 Russell 环状二维(valence–arousal)。MER 社区已完成基础设施铺设:DEAM(1,802 段,2Hz 连续 V-A,CC 许可)与 PMEmo(794 首 Billboard/iTunes 热门、457 名标注者、静态+2Hz 动态 V-A、同步 EDA 生理信号、副歌选段与 LRC 歌词) 是两大主干,辅以 EmoMusic、MTG-Jamendo emotion 子集等。精度现状:MERT 特征+和弦/调性特征的统一多任务框架在 PMEmo 上 valence R²=0.54、arousal R²=0.78;动态预测 CCC 仅 0.1–0.39。关键警示:Jukebox 表示的跨数据集实验显示 OOD 泛化接近失效(其他数据集训练→PMEmo 测试 avg R²≈0.04,域内 arousal 可达 0.72)——V-A 回归器只能做域内 reward/过滤器,不能当通用裁判;歌词侧可用句子级 V-A(LyEmoBERT 类)补充语义通道。歌唱相对纯音乐的优势:人声是最直接的情绪通道,V-A 与 §5.6 技巧轴(气声↔亲密、belt↔爆发)存在系统相关,两层联合建模优于独立建模。
(b)节奏 Feel。三个可量化分量:① swing ratio——长短视频音符时长比,Friberg & Sundström 经典研究确认其随速度变化(慢速比更大;一项 150bpm 实测约 2.66:1);② microtiming deviations (MTD)——音符相对网格的小偏差。学界曾长期争论 MTD 是否构成 swing 的本质(Keil 的 participatory discrepancies 理论);Datseris 等(Sci Reports 2019,160 人听测、量化/放大/反转三种操纵)发现 MTD 本身并非必需,swing ratio 的稳定性反而更重要;其后 Communications Physics 2022 进一步提出 downbeat delay(正拍延迟)才是 swing 的关键成分。对控制系统的启示:不要让模型学「随机抖动」,要学「稳定的拍位偏移分布」——pocket 度量 = onset 相对网格偏移的 μ/σ 统计,控制目标是平移 μ 而非增大 σ;③ rubato=乐句级 tempo 曲线,与 microtiming 分离提取(先 beat tracking 出网格,再做分句 tempo 平滑拟合)。另有 syncopation 与身体摆动的倒 U 关系(Witek 2014)提示 groove 密度也存在最优区间而非越大越好。
(c)音准性格。blue note/microtonal 偏移可统计为「F0 相对十二平均律的系统性偏差分布」(蓝调三音常压低数十音分;流行歌手三度倾向纯律方向——此类结论应按曲风分桶统计而非绝对值);drift(<0.5Hz 慢漂移)与 wow/vibrato(4–8Hz)用带通分离;修音污染检测(E0 实验)本质上是该分布的熵异常检测。
(d)Ad-lib 与结构。ad-lib 密度需要歌曲结构分割(verse/chorus/bridge 检测)提供位置先验(intro/outro/hook 后是高发区);转音复杂度复用 L1 melisma 指标。注入方式:全局 token + 插值(类比 LeVo 的偏好向量插值),或参考音频 style prompt(TCSinger 双模态编码器路线)。
5.7.4 L3 制作美学层
(a)自动混音研究谱系。十五年演进三条波次:规则/专家系统(De Man 的知识工程混音、最佳实践规则库)→ 经典 ML(特征回归混音参数)→ 深度学习时代:Wave-U-Net 鼓组混音(JAES 2021)、可微混音台(differentiable mixing console,效果器进计算图端到端反传)、FxNorm-AMIX(ISMIR 2022,与我们场景最同构)——针对「干声多轨稀缺」用 MSS 湿 stem 做效果归一化预处理,训出响度/EQ/声像/DRC/混响五个自动混音头,盲听中与专业混音在 Production Value 和 Excitement 上不可区分、Clarity 反而更高;后续 Diff-MSTC(CHI 2025)加入可控性与上下文感知、AiLive Mixer(2026)做到现场零延迟、还有 diffusion 修混音失衡的工作。对我们的意义:Sonata 数据全是「湿」成品歌,FxNorm 式归一化正是解锁 L3 监督的钥匙。
(b)效果链风格迁移。DeepAFx-ST(Steinmetz/Bryan/Reiss)把音频效果作为可微算子嵌入网络、自监督训练(无需配对数据),输入录音+参考录音即可预测 EQ/压限/混响的控制参数——输出是可解释的效果器参数而非黑盒波形,天然适合做 L3 的「制作风格轴」:给定参考歌曲,把其空间感/压缩特性迁移到生成人声上,且参数可回读进探针。Tone Transfer/DDSP 一脉提供了实时版思路。
(c)和声/Double。多声部人声数据稀缺(MedleyDB/MUSDB 只有少量多轨人声),可行路线按成本排序:pitch-shift 式 double(廉价但机械)、基于和声音程的受控生成(需 L1 音高控制成熟)、LM 涌现式(YuE 展示过阿卡贝拉和声,不可控)。这是四层中公开方法最薄弱的一环,建议列为研究空位。
(d)人声-伴奏平衡。流媒体响度目标约 −14 LUFS;sidechain ducking 与人声电平自动化可从专业混音统计学习;LeVo 的 HAM(人声-伴奏和谐)MOS 维度是该层的直接评测。探针:RT60 读数 ±20%、LUFS 差 ≤1LU、double 数量检测准确率。
5.7.5 层间协同与对实验设计的修订
- 解耦训练策略:每条轴独立 condition dropout(随机置空单轴防纠缠),课程顺序 L0→L1→L2→L3(先让模型学会忠实复刻曲线,再学标签演绎,最后学全局风格与成品感);每轮消融只开一条轴。
- E4 修订:气声度轴采用 HNR+CPPS 双指标验收(仅 HNR 在连续演唱段不稳);颤音轴升级为四参数(含 likeliness),门控行为写入探针。
- E5 修订:V-A 回归器限定域内使用(训练分布 = Sonata 试点集本身),OOD 警示写入风险表;swing 控制目标改为「拍位分布平移 + 方差稳定」,不奖励随机微 timing。
- E6 补充:L3 的效果参数(RT60/压缩量/响度差)全部可程序化计算,直接并入可验证奖励族——DeepAFx-ST 的参数化输出让「制作风格」也变成可验证目标。
- 新研究空位:① GRPO for singing(原判断不变);② 受控戏腔语料;③ 多声部人声生成的监督数据;④ 歌唱呼吸风格分类数据集。
6 · 数据工程全链路
歌声数据是整个领域最硬的瓶颈:SVS 需要「音频 + 乐谱 + 音素对齐」三重强标注,天然稀缺;技巧/情绪标注进一步抬高成本。本章按采集 → 挖掘分离 → 标注对齐 → 清洗筛选 → 构造组合五段展开,最后给出公开数据集大全。
6.1 采集(Collection)
- 录音棚协议:GTSinger 展示了当前最高标准的录制设计——20 位职业歌手 × 9 语种 × 四声部全覆盖;每首歌按「同一旋律 × 技巧对照」矩阵排布;同时录 16.16 小时配对语音(供 STS 任务);48kHz 高采样。关键经验:乐谱要「realistic」——音符时值规律化(非精细记谱)反而更贴近真实创作场景,这是 GTSinger 与 Opencpop 精细谱的路线分歧点。
- 内容覆盖设计:音素覆盖表、音域覆盖(四声部)、技巧覆盖矩阵、情绪脚本库、melisma 密度控制(ACE-KiSing 专门选了 27% melisma 乐句的歌单)。中文还需考虑儿化音/轻声在唱词中的弱化规律。
- 授权与法务前置:歌手授权书须明确「训练用途、合成物所有权、声音形象权」(呼应 ELVIS Act / 中国《民法典》声音权益与《标识办法》要求);商业 voicebank 还需约定转授权范围。GTSinger 采用 CC BY-NC-SA 4.0,ACE 系数据 CC-BY-NC——学术与商用边界必须在采集前锁定。
- 远程/众包采集:低成本路线是指导歌手自录(手机+监听耳机),代价是通道一致性差,需要更重的增强与质量过滤;适合音色微调类小数据(几分钟~几小时),不适合基座训练。
6.2 挖掘与分离(Mining & Source Separation)
In-the-wild 歌曲是规模化的唯一途径(YuE 万亿 token 预训练即依赖此类数据)。核心工具链:
| 模型/工具 | 要点 | 角色 |
|---|---|---|
| Mel-RoFormer / BS-RoFormer | 字节 SAMI;Band-Split/Mel-band 前端 + RoPE 层级 Transformer 掩码估计;SDX'23 冠军;MUSDB18HQ 人声 SDR ≈ 12 dB(Mel 版较 BS 版再 +0.5dB) | 当前人声分离 SOTA;audio-separator/UVR 的默认高质量模型 |
| Demucs v4(htdemucs) | Meta 时域/频域混合 U-Net | 4-stem 快速批量分离的经典选择 |
| MDX-Net 系列 | 频域 CNN,速度快显存低 | UVR5 内置;大批量预处理 |
| UVR5 / audio-separator | 图形化/命令行分离套件,聚合上述模型 + 后处理(去混响 MDX23C、去回声) | SVC 社区数据准备的事实标准 |
6.3 标注与对齐(Annotation & Alignment)
- 歌词转录:通用 ASR 在歌唱上错误率高(拖腔、装饰音破坏语音节奏);实践常用「人工歌词文本 + 对齐」替代逐句听写;近年歌声 ASR 专门模型逐步改善但仍是开放问题。
- 强制对齐:AutoLyrixAlign(NUS,MIREX 2019 冠军)提供复调音乐中歌词词级对齐;SVS 训练更常用 Montreal Forced Aligner 变体 + 音素级人工校验(Opencpop/GTSinger 均为人工精校);MFA 的声学模型需用歌唱数据重训,否则元音拖长处对齐漂移严重。
- F0 提取:
算法 原理 适用 pYIN/Harvest 经典启发式 干净独唱;Harvest 在 WORLD 工作流内常用 CREPE CNN 直接回归(ICASSP 2018) 精度高但极慢(RTF 0.48) RMVPE 深 U-Net+GRU 端到端,专为复调伴奏下的人声 F0 设计(2023) RVC/DiffSinger 社区标配 FCPE(2025) 深度可分离卷积上下文模型;精度持平 RMVPE 而 RTF 0.0062(快 5.3×,比 CREPE 快 77×) 实时变声与大规模批处理的当前最优解 - 音符切分与乐谱重建:从 F0 + onset 检测重建 MIDI(vocal melody transcription;Mel-RoFormer 微调版在该任务亦达 SOTA),用于给挖掘数据补乐谱监督。
- 技巧/情绪标注:受控对照录制(GTSinger 路线)> 专家逐音素标注 > 众包 tag(KVT 路线)> 分类器自动伪标(成本递减、噪声递增)。自动标注器本身可用 VocalSet/GTSinger 训练,形成「小种子集 → 自动标注 → 扩数据」的自举闭环。
6.4 清洗筛选(Filtering)
- 信号级:削波检测、SNR 估计、直流偏移、采样率统一(24k/44.1k/48k 分层)、静音切分(能量 VAD 或 singing-voice detection)。
- 内容级:ASR 回译一致性检查(唱词与文本不符则丢弃)、语言识别、重复片段去重(跨歌曲副歌重复会导致验证集泄漏)、翻唱版本归并。
- 质量打分:神经 MOS(UTMOS 迁移、SingMOS/SingMOS-Pro 歌唱专用)、CLAP 相似度(audio vs 歌词/风格描述)、F0 合理性(超出人声范围的 octave error 剔除)、分离残留度(instrumental stem 回灌相关度)。
- 合规级:版权指纹比对(呼应 UMG-Udio 和解中的 Content ID 义务)、艺人 opt-out 名单、水印溯源标记。
6.5 构造与组合(Construction & Mixing)
除直接采集外,三条已被验证的构造路线:
- 「合成 + 专家调参」自举(ACE-Opencpop 范式,Interspeech 2024):以 ACE Studio 合成 Opencpop 同款乐谱的 30 个虚拟歌手版本,由专业调教师修正 AI Pitch、vibrato 深度、呼吸与音节时长,再经音域合理性过滤,得到 128.9 小时 / 30 歌手的多歌手数据集(原版仅 5.2h 单人);实验证明其预训练显著优于 M4Singer 预训练迁移。这条路线把「数据生产成本」从录音棚转移到调参人力,且乐谱免费继承——human-in-the-loop 数据工作流的教科书案例。
- 伪标签自训练:用现有 SVS 给挖掘数据生成乐谱伪标(score-free distillation),或用 MSS 分离 stem 构造多轨训练样本(Seed-Music 明确使用 MSS 获得 stem-level 训练样例)。
- 增强合成:pitch-shift / formant-shift(扩音域与音色多样性,注意会破坏绝对音高先验需谨慎)、EQ/压缩模拟不同录音链路、房间脉冲响应加混响、codec 徊环(MP3/AAC 二次编码抗压缩失真)、速度微扰。SVC 社区还流行「说话数据预训练 + 歌唱微调」(cross-domain SVC,SVCC 证实有效但上限低于 in-domain)。
组合策略:多源数据的配比决定能力边界——经验上「录音棚强标数据定上限、挖掘数据保多样性、合成数据补规模」三层金字塔;训练时按数据置信度加权采样,并对合成/挖掘数据施加 dropout 式随机降权防止分布偏移。LeVo 消融显示指令对齐噪声(歌词抽取/结构识别错误)是开源系统与闭源的剩余差距主因之一,印证「数据管线噪声 > 模型架构」的判断。
6.6 公开数据集大全
| 数据集 | 年份 | 语言 | 时长(h) | 歌手数 | 乐谱 | 特殊标注 | 许可 |
|---|---|---|---|---|---|---|---|
| NUS-48E | 2013 | EN | 1.9 | 12 | ✗ | 说唱配对 | 研究限定 |
| PJS | 2017 | JP | 1.4 | 1 | ✓ | 音素级 | 研究 |
| NHSS | 2019 | EN/KO | 4.8(歌) | 10 | ✗ | 说唱配对;SVCC23 底座 | 研究限定 |
| JVS-MuSiC | 2020 | JP | 2.3 | 100 | ✗ | 每歌手仅 ~0.02h | CC |
| Kiritan / Ofuton-P 等 JP 系 | 2021–22 | JP | ≈1–2 各 | 1 各 | ✓ | UTAU 生态 | 研究限定 |
| KiSing-v1 | 2021 | CN | 0.7 | 1 | ✓ | — | CC-NC |
| OpenSinger | 2021 | CN | 50 | 66 | ✗ | 挖掘型 | CC-NC |
| Opencpop | 2022 | CN | 5.2 | 1 | ✓ 精细 | 人工音素对齐;DiffSinger 标准基准 | CC-NC-ND |
| PopCS | 2022 | CN | 5.9 | 1 | ✗(F0 代替) | 长曲连续建模 | CC-NC |
| M4Singer | 2022 | CN | 29.8 | 20 | ✓ | 10 种风格(美声/民族/流行/戏曲等) | CC-NC |
| SingStyle111 | 2023 | CN/EN/IT | 12.8 | 8 | ✓ | 风格标注 | 受限 |
| VocalSet | 2018 | EN | 10.1 | 20 | ✗ | 17 种声乐技巧×5 元音×4 情境;技巧分类基线 | 研究 |
| Phonation Modes | 2017 | EN | — | 4 | ✗ | breathy/pressed/flow/neutral 声门模式 | 研究 |
| KVT | 2022 | KO | 18.85 | 114 | ✗ | 70 个 vocal tags(含 6 个技巧类)众包 | 研究 |
| GTSinger | 2024 | 9 语种 | 80.59 | 20 | ✓ realistic | 6 技巧受控对照 + 音素级 + 全局风格 + 16.16h 配对语音 | CC BY-NC-SA |
| ACE-Opencpop | 2024 | CN | 128.9 | 30 | ✓ 继承 | 合成+专家调参 | CC-NC |
| ACE-KiSing | 2024 | CN/EN | 32.5 | 34 | ✓ | 27% melisma 乐句 | CC-NC |
| MUSDB18(-HQ) | 2017/19 | EN 多 | ~21 | 150 曲 | ✗ | 分离基准 stems | 受限/NC |
| DALI | 2018 | 多语种 | 大 | — | ✗ | 歌词-音频时间对齐(挖掘数据对齐监督) | 研究申请 |
| CtrSVDD | 2024 | CN/JP 混合底座 | 47.6(clip) | 多 | — | 14 种 SVS/SVC 伪造系统的 deepfake 检测基准 | 研究 |
| Emilia(对照) | 2024 | 101 语种 | 101k(语音) | — | — | 语音侧大规模流水线范式参考(非歌唱) | CC BY-NC / Apache |
趋势解读:① 规模竞赛已从「小时数」转向「受控维度」(技巧/情绪/配对语音);② 中文资源最丰富(产业驱动),日语 UTAU 生态贡献了大量单歌手精品;③ 许可普遍 NC,「可商用的合规歌唱数据」仍是巨大空白,也是厂商的核心壁垒。
7 · 训练方法:预训练 → SFT → 偏好优化 / RL
7.1 预训练目标
| 范式 | 损失 | 备注 |
|---|---|---|
| 回归声学模型 | L1/L2(mel) + 辅助 pitch/duration/energy NLL | 过平滑根源;必须靠 GAN/vocoder/扩散补救 |
| GAN 声码器 | 对抗 + 特征匹配(HiFi-GAN 系、NSF-HiFiGAN 歌唱专用源滤波分支、BigVGAN) | vocoder 与 acoustic 联训(VISinger/VITS 系)或两段式均可 |
| 扩散 | 噪声预测 ε-MSE;浅扩散变体只去噪到先验交点 | DiffSinger 核心;推理步数与质量的权衡由 scheduler 决定 |
| Flow Matching | L_FM = E‖v_θ(x_t,t,c) − (x_0 − z)‖²,线性概率路径 ODE | ACE-Step:FM + REPA 语义对齐损失(DiT 中间层 vs MERT/mHuBERT 余弦),显著改善咬字与音乐连贯性——「表征对齐当正则」是值得抄的通用技巧 |
| AR token LM | codec token 的交叉熵(可分层:semantic 先行、acoustic 并行/交错) | track-decoupled(YuE)、parallel 双轨(LeVo,优于 interleaved 长曲表现)、delay pattern 等排布是关键超参 |
| Masked generative | 掩码 token 迭代并行预测 | TTS 侧 MaskGCT 已验证;歌唱侧应用尚少,是潜在空白点 |
7.2 微调 / SFT
- 歌手微调:目标歌手少量干声(0.5–5h)继续训练多歌手基座。SVC 社区标准流程(预处理 → ContentVec/HuBERT 特征 → 训练数小时 → 聚类/索引);SVCC 证实 pretrain-adapt 两段式显著优于从零训练。
- LoRA / Adapter:YuE 官方 LoRA 微调、ACE-Step 示范的 LoRA 定制风格/音色——把「音色资产」做成几十 MB 可分发文件成为可能。
- 指令微调:Seed-Music 区分 data FT(提升 musicality)与 instruction FT(提升可控性/可解释性/交互性);LeVo 用半自动管线把「歌词+描述+参考」→ 高质量歌曲构造成指令数据。
- 课程设计:常见做法是短乐句 → 整句 → 整曲;技巧维度上先直声后 vibrato 再 melisma(ACE-KiSing 显示 melisma 是主观质量瓶颈,宜单独强化)。
7.3 偏好优化与 RL(当前最活跃的方向之一)
已验证的公开工作:
- SpeechAlign(NeurIPS 2024):codec-LM 的迭代偏好优化框架——用 SFT 模型自采样生成候选,按 MOS/客观分构造 golden vs synthetic 的偏好 codec 数据集,依次验证 RLHF-PPO、DPO(可迭代 3 轮持续提升 WER↓ 相似度↑)、BoN、CoH;结论:RLHF 泛化最好,DPO 迭代性价比最高且第 3 轮仍有增益。该框架可直接平移到歌声 codec-LM。
- Seed-Music:官方技术报告明确三段训练的最后一段为 RL 后训练对齐人类偏好(细节未公开)。
- Mureka O1:RL 环境 + 验证纠错式奖励函数(音乐质量、风格一致性)+ 策略优化器(梯度压缩、探索/利用平衡)训练 MusiCoT 推理。
- LeVo multi-preference alignment:六维偏好(整体/旋律吸引力/人器和谐/结构清晰度/音质/歌词贴合)半自动构造偏好对做后训练,并支持偏好向量插值在推理期调节属性平衡——把 RM 从单一标量升级为可操控空间。
- 唱词正确率:ASR 回转歌词 vs 输入歌词的 CER/PER(LeVo/Mureka 都用作客观指标);
- 旋律保真度:生成 F0(RMVPE 提取)与输入乐谱的 COR/RPA/chroma 对齐(CQT/CENS 对齐正是 SVCC 分析中与主观相关性最高的客观族);
- 节拍对齐:onset 网格偏移;音域可行性:F0 分布落在歌手音库范围内;
- 技巧保真度:GTSinger 技巧识别器对生成结果的标签一致率。
7.4 表示学习与解耦辅助任务
- SSL 内容特征:HuBERT/WavLM/ContentVec 是 SVC 的事实内容编码器;ContentVec 通过互信息目标抑制说话人信息;MR-HuBERT、多语 HuBERT 扩展跨语言能力(CtrSVDD 的伪造系统即系统对比了这些编码器)。
- 说话人解耦:speaker augmentation(pitch-shift 打乱音高-音色相关性)、AdaIN/FiLM 注入、互信息最小化、梯度反转;零样本 SVS 的相似度上限基本由解耦质量决定。
- 音乐语义对齐:CLAP/MERT 对齐既服务文本控制又服务检索式数据挖掘(Mureka MusiCoT 直接建在 CLAP 表示上)。
8 · 模型架构方案选型
8.1 声码器演进线
WaveNet(2016) → Parallel WaveGAN → HiFi-GAN(2020) → NSF-HiFiGAN(加入谐波源滤波分支,F0 作为显式条件注入,歌唱场景标配)→ BigVGAN / kNN-vocoder(泛化)→ iSTFTNet / Vocos(去掉上采样、频域逆变换头,RTF 数量级下降,实时变声首选)→ DDSP 类解析合成(最轻量,CPU 实时)。选择逻辑:离线品质看 NSF-HiFiGAN/BigVGAN,在线延迟看 Vocos/DDSP。SingGAN(ACM MM 2022)证明歌唱专用 GAN 声码器可在 2080Ti 上达 50× 实时。
8.2 条件与结构组件清单
| 组件 | 主流实现 | 经验要点 |
|---|---|---|
| 音素前端 | G2P + IPA;中文需处理儿化/轻声/多音字(唱词语境) | 跨语言合成(SynthV cross-lingual)依赖共享音素表 + 语言嵌入 |
| F0 条件器 | CWT 多尺度分解 / 连续值 embedding + 换气符(unvoiced 标记) | ACE Studio 文档明确区分 voiced/unvoiced pitch 曲线——工程细节直接决定咬字干净度 |
| 时长建模 | 显式 predictor(回归 + 高斯 NLL)/ AR 内隐式 | 编辑需求强 → 显式;整曲生成 → 内隐式 + 结构 token |
| 风格注入 | 全局 speaker/style embedding(FiLM)+ 局部 reference attention | TCSinger 式双模态 style encoder 是零样本 SOTA 配方 |
| 骨干网络 | Transformer/Conformer(AR 或非自回归);WaveNet/RoFormer 时域卷积;DiT(RoPE+qk-norm) | DiTSinger 证明 SVS 也吃 scaling law;线性注意力 DiT(ACE-Step 改自 Sana)解决长序列算力 |
| Tokenizer | EnCodec/DAC/自研(低帧率优先:ACE-Step latent ≈10.77Hz;LeVo Music Codec RTF 0.09) | 帧率 × 码率 × 重建保真的三角权衡决定 LM 系上下文长度预算 |
| 流式化 | 因果 encoder + chunked decoder + lookahead 截断;滑窗 + SOLA 拼接(DDSP-SVC GUI) | 算法延迟预算:lookahead + chunk ≈ 80–300ms;StreamVC 走端侧全因果路线 |
8.3 三套推荐配方
A. 专业制作引擎(对标 SynthV/ACE)
乐谱前端 → 音素/时长/F0 variance 分支 → 条件扩散或 FM mel 解码 → NSF-HiFiGAN
+ 全参数曲线编辑层(AI Pitch 初稿 + 用户覆写)
关键指标:MOS≥4.3、逐音符可控、本地渲染 RTF<0.3
B. 开源整曲生成(对标 YuE/LeVo/ACE-Step)
海量挖掘歌曲 → MSS 分离伪 stem → codec/LM 预训练(track-decoupled 或 DCAE+DiT-FM)
→ 指令微调 → 多维偏好后训练(DPO/GRPO + 可验证奖励)
关键指标:PER/CER↓、人器和谐 MOS、30–60s 内出 3 分钟曲
C. 实时变声/K歌(对标 RVC realtime/seed-vc-stream)
流式 F0(FCPE)+ 因果内容特征(ContentVec-lite)→ 小型 flow/reflow 或 iSTFT 解码
目标延迟 ≤120ms @ 单卡消费级 GPU;DDSP 兜底 CPU 场景
9 · 评测体系与基准
9.1 客观指标
| 维度 | 指标 | 说明 |
|---|---|---|
| 音高 | F0 RMSE、Semitone Acc.、RPA/RCA/COR、VUV error | mir_eval 实现;COR 需乐谱参照 |
| 频谱 | MCD(mel cepstral distortion) | 传统主指标,与 MOS 相关性弱,仅作 sanity check |
| 咬字/歌词 | PER / CER / WER(ASR 回转) | 整曲生成的核心指标;LeVo PER 7.2% 最优 |
| 音色相似 | SECS / ECAPA / RawNet3 余弦相似度 | SVCC 分析:speaker embedding 与主观相似度相关性最高 |
| 旋律对齐 | CQT / CENS chroma alignment | SVCC2025 分析中与主观分数最相关的 dependent 指标族 |
| 分布质量 | FAD、MuQ/MuQ-A、Audiobox-Aesthetic(CE/CU/PQ)、PC | LeVo 采用的现代组合;FAD 对小样本敏感需报告置信区间 |
| 神经 MOS | UTMOS(语音迁移)、SingMOS / SingMOS-Pro(歌唱专用) | SingMOS 与主观自然度相关性最高;UTMOS 跨域泛化尚可但偏乐观 |
9.2 主观评测
- MOS(自然度 1–5)、CMOS(对比)、SMOS(音色相似)、XAB/动态偏好测试(风格相似度);LeVo 定义了六维 MOS(OVL/MEL/HAM/STR/AQ/LYC)成为整曲生成的事实模板。
- Sun 声纹评测的坑:歌唱样本方差大,需固定伴奏底、随机化顺序、足够听评人数(>25)并报告 95% CI。
9.3 挑战赛与基准
| 基准 | 内容 | 关键结论 |
|---|---|---|
| VCC 系列 → SVCC 2023 | NHSS 子集;in-domain / cross-domain SVC 两任务;26 支队伍大规模听测 | 顶级系统自然度 ≈ GT(~3.9),但相似度无一达到目标歌手水平;cross-domain 全面更难;UTMOS 迁移可用 |
| SVCC 2025 | 新增 singing style 转换任务 + 专属数据集;发布 extensive analysis(arXiv 2509.15629) | ARLM+Diffusion 组合最强;风格建模仍是短板;客观指标 SRCC 上限 ~0.6,主观仍是金标准;SingMOS 相关性第一 |
| GTSinger benchmarks | 技巧可控 SVS / 技巧识别 / 风格迁移 / STS 四件套 | 技巧控制领域唯一受控基准 |
| SoulX-Singer-Eval(2026-02) | 零样本 SVS 评测套件:美感、信号质量、发音准确率、说话人相似、旋律精度五维 | 配套 SoulX-Singer 模型与评测数据集开源,反映产业界开始自建 SVS eval |
| CtrSVDD | 受控歌声 deepfake 检测基准(14 种伪造系统 × 多语种真声) | 安全侧配套;SVC/SVS 滥用检测的起点 |
| MIREX 歌词对齐 | AutoLyrixAlign 等 word-level 对齐年度评测 | 数据管线上游质量保障 |
10 · 性能与训练 / 推理优化
10.1 已公开的速度基准
| 系统/组件 | 速度 | 备注 |
|---|---|---|
| ACE-Step v1(3.5B) | A100 上 4 分钟歌曲 ≈ 20s(比 LLM 基线快 15×) | DCAE 低帧率 latent + 线性 DiT 少步 FM 采样 |
| DiffRhythm | ≈8× 实时全曲生成 | latent diffusion 直出整曲 |
| LeVo Music Codec | 解码 RTF 0.0902(MuCodec 0.6778 的 1/7) | latent 直映音频省去中间处理 |
| SingGAN | 50× 实时 @2080Ti | 歌唱专用 GAN 声码器 |
| FCPE F0 提取 | RTF 0.0062(RMVPE 5.3×、CREPE 77× 快) | 实时链路的关键组件 |
| DDSP-SVC realtime GUI | 消费级 GPU/CPU 可实时 | 滑窗 + SOLA 拼接 + 上下文参考逼近离线音质 |
| w-okada voice-changer | MMVC/so-vits/DDSP/RVC 统一实时壳,GPU ~100ms 级 | 实时 VC 生态入口 |
10.2 训练侧优化
- 混合精度 bf16 + DeepSpeed ZeRO-2/3(ACE-Step 公开配置);梯度累积补偿长序列 batch 限制。
- 分段训练:声学模型与 vocoder 分开预训练再联调;LM 系先训 codec 再冻结构训 LM,最后联合微调。
- 课程与采样:按时长分桶减少 padding;多源数据加权采样(见 6.5);EMA 权重稳定 GAN 训练。
- 数据生产基建:分离/F0/对齐三步都是可并行 CPU/GPU 批任务,适合 K8s 队列化流水线(分离模型显存需求高时降 segment size)。这与算力平台作业编排(ACK/ACR 类基础设施)直接相关——数据管线吞吐往往才是训练迭代的真实瓶颈。
10.3 推理侧优化
- 少步采样:DPM-Solver++/UniPC 把扩散压到 5–20 步;FM 的 ODE 天然少步友好;rectified flow/reflow(DDSP-SVC 6.x)一步化增强分支。
- 蒸馏:一致性蒸馏、对抗蒸馏(Vocos 式频域头替代上采样栈);声码器蒸馏是 RTF 收益最大的单点优化。
- 导出与量化:ONNX 导出是 OpenUtau/DiffSinger voicebank 分发标准;bf16→int8 在 DiT/LM 上通常损失可控;CoreML/NPU 移动端部署以 Vocos+小型 SVC 为可行组合。
- 流式架构:因果化 encoder、限制 lookahead、chunked crossfade;延迟预算 = lookahead(16–480 样本) + chunk(512–1024) + 计算,实测 80–300ms 区间;StreamVC 目标端侧 <70ms。
- 服务工程:批量请求合并、KV cache 复用(LM 系)、结果缓存(相同 prompt 命中)、水印注入放在导出钩子(合规第 11.5 节)。
11 · 产品与公司版图
11.1 专业歌声制作工具(SVS 引擎)
| 产品 / 公司 | 定位与技术 | 控制能力亮点 | 商业模式 |
|---|---|---|---|
| Synthesizer V Studio 2 Pro Dreamtonics(东京) | 本地推理的 AI 歌声合成标杆;2025-02 发布 2 Pro,持续迭代(2.2.1 @2026-03);Live Rendering 实时波形预览 | Vocal Modes:每个音库自带多组唱法模式(如 Liam: Bright/Heavy/Rounded/Whispery/Soft/Hoarse;Mai 2: Breathy/Downer/Emotional/Powerful/Rap/Sweet)且可混合加权;动态 chest/belt/breathy 模式;AI Retakes、逐音符 pitch/timbre 编辑;跨语言合成 6 语种 | 一次性买断 $89 + 音库分售 |
| ACE Studio 2.0 时域科技 Timedomain(北京→LA) | 云端起家(v1 需联网渲染)、2.0(2025-12)转向 all-in-one AI 音乐工作室;140+ AI 音源、8 语种;自研 Verse25 合成引擎 | 六参数自动化(Breath/Air/Falsetto/Tension/Energy/Formant)→ 新引擎 Power/Soft/Breathy/Chest 四轴 + breath noise;Vibrato 四手柄工具;Voice Blending 音色混合;Choir Mode 和声群唱;Vocal-to-MIDI 哼唱转谱;Stem Splitter;用户上传样本训练自定义音源(voice clone) | $398/$528 买断(此前订阅制 $149/年);开放 API 与数据合作(ACE-Opencpop 即其产物) |
| CeVIO AI / VOCALOID6 / Piapro Studio Voisona / Yamaha / Crypton | 传统歌声合成阵营:CeVIO AI 情感量参数细腻;VOCALOID6 靠 VOCALOID:AI 追赶;Crypton 以初音未来 IP + Piapro Studio NEO 生态立足 | 参数化调教成熟但 AI 化程度落后于 SynthV/ACE | 买断 + IP 授权(演唱会/游戏联动是主要变现) |
| X Studio(小冰 × 网易云音乐,2023) | 平台级联合产品,面向音乐人免费的 AI 歌手创作软件(小冰框架源于 XiaoiceSing 技术线) | 中文虚拟歌手音源 + DAW 式工作流 | 免费引流 + 平台内容生态 |
11.2 消费级整曲生成(Text-to-Song)
| 产品 | 状态(截至 2026-08) | 人声相关亮点 |
|---|---|---|
| Suno | v5(2025-09)→ v5.5(2026 上半年);UMG 诉讼坚持 fair use 抗辩,Warner 已和解(2025-11)转为授权合作,Sony 仍在诉讼;SJ 听证排期 2026 年中 | 评测普遍认为其人声最自然(vibrato、换气、乐句处理);4 分钟曲长、stem 导出(Premier 档)、Personas 音色复用、自定义模型训练(v5.5) |
| Udio | 2025-10-29 与 UMG 和解后关闭全部下载/stem 导出,转为流媒体围墙花园;与 UMG 共建授权平台预计 2026 上线;Sony 仍诉 | vocal quality 口碑好但曲长约 2 分钟;当前定位「试验沙盒」 |
| Mureka(Mureka O1/V6) 昆仑万维 | 全球首批开放 API 的 AI 音乐平台;100+ 国家用户;API + 微调双开放 | MusiCoT 结构化推理提升段落精准度;以歌曲为 prompt、音色克隆两大特色功能;10 语种 |
| Eleven Music ElevenLabs | 2025-08-05 发布(Kobalt/Merlin 授权背书);2026-04 独立 iOS App + Spotify 式社区/Remix;2026-05 升级为带授权 remix 模型的创作+流媒体平台(4000+ 独立艺人入驻) | 依托语音合成底座的人声表现力(breath/expression);4 语种人声;分段结构编辑;商业授权条款清晰是其核心卖点 |
| Google Lyria | Lyria → Lyria 2 → Lyria 3(进入 Gemini 免费可用);Music AI Sandbox 面向专业音乐人;YouTube Dream Track 短视频配乐集成 | RealTime 模式支持交互式 DJ 式控制;企业合规路径清晰 |
| 其他 | MiniMax Music(国内 API 强势)、Tencent 混元/天琴方向、快手可灵音频线、Riffusion 转型、Stable Audio(器乐为主)、Beatoven/Soundraw/AIVA(BGM 向无人声) | — |
11.3 音色克隆 / AI 翻唱 / 实时变声
- Jammable(原 Voicify.AI):最大的 AI 翻唱 UGC 平台(社区模型市场),版权灰色地带的代表。
- Kits.AI:面向音乐人的合规克隆/官方音色分成平台;官方 API 曾被 ACE 博文列为 RVC 类代表。
- Musicfy / Covers.ai / weights.com等:轻量翻唱与 voice model 分享。
- voice-swap.ai(DJ Fresh):艺术家官方授权的 stem swap 平台——「授权翻唱」合规样板。
- 实时变声:Voicemod、Supertone SHIFT(HYBE 系)、w-okada voice-changer(开源,承载四大 SVC 模型)、MMVC。K 歌修音场景(全民 K 歌 AI 歌声/戏腔)是中国特有的大规模落地。
- 反制侧:CtrSVDD 检测基准、各家 Content ID 与水印溯源(ElevenLabs/Suno 均内置生成检测与过滤)。
11.4 中国市场版图
| 玩家 | 动作 |
|---|---|
| 昆仑万维 | Mureka V1(SkyMusic 2024-04) → V6/O1(2025-03)SOTA 自称 + API 商业化;把 AI 音乐列为集团核心赛道 |
| 腾讯系 | TME 天琴实验室(2020 成立;虚拟人「小琴」中英粤三语演唱/口型/动作驱动;Music XR Maker 歌舞生成);全民 K 歌多维评分 + AI 歌声/戏腔翻唱;TME Studio(分离/MIR/辅助写词/智能曲谱);Tencent AI Lab LeVo 开源;曾推官方授权全 AI 歌手「AI 力宏」(与宏声文化) |
| 网易系 | 网易云音乐:X Studio(×小冰,免费 AI 歌手创作软件)+ 网易天音(2022-01 上线的一站式词曲编唱工具) |
| 字节 | Seed-Music(豆包系能力底座);SAMI 的 Mel-RoFormer 成为全球数据管线标配;汽水音乐分发场景 |
| 阿里 | Tongyi CosyVoice(语音侧强,歌唱能力有限);ACE-Step 联合出品方之一 StepFun(阶跃星辰)严格说是独立公司 |
| 时域科技 | ACE Studio:中国唯一打入全球专业制作市场的 SVS 引擎;数据合作(ACE-Opencpop/KiSing)反哺学术 |
| 虚拟歌手 IP 经济 | 洛天依/Vsinger(上海禾念)、星尘、五维介质系等:SynthV/DiffSinger 引擎 + 同人创作生态 + 演出变现;OpenUtau+DiffSinger 社区音源极大降低了入行门槛 |
11.5 版权与合规格局(产品设计硬约束)
| 司法域 | 关键规则 | 工程含义 |
|---|---|---|
| 美国 | Tennessee ELVIS Act(2024 生效):首个明确保护「声音形象(voice likeness)」的州法;RIAA v. Suno/Udio(2024-06 起)诉讼分裂:Suno 打 fair use、Udio 转向许可;UMG–Udio 和解(2025-10)披露模板:每次生成 $0.002–0.005 许可费 + Content ID 相似筛查 + 训练数据/日志审计权 + 覆盖未来模型版本;Warner 与 Suno/Udio 双双和解(2025-11 前后);Sony 拒绝和解继续诉讼(庭审预计 2026 下半年);Suno SJ 听证 2026-07 前后是 fair use 关键节点 | 「训练数据审计留痕」「输出相似度指纹筛查」「按次计费的授权账本」将成为平台标配组件 |
| 中国 | 三步走监管:《互联网信息服务深度合成管理规定》(2023-01-10 施行,声音合成属高危项需显著标识)→《生成式人工智能服务管理暂行办法》(2023-08-15)→《人工智能生成合成内容标识办法》+ 强制国标 GB 45438—2025(2025-09-01 施行):显式标识(音频开头/结尾语音提示或界面提示)+ 隐式标识(元数据五要素:AI 属性、服务者编码、内容编号、传播者编码、传播编号),禁止删除篡改标识;北京互联网法院「AI 声音第一案」(殷某案,2024-04 判决)确认自然人声音权益及于 AI 化使用 | 导出链路必须内嵌水印/元数据写入;用户协议声明标识规范;输入端实名与音色授权校验;日志留存 ≥6 个月 |
| 欧盟 | AI Act Art.50 深度合成披露义务 + DSM TDM opt-out | 训练数据 opt-out 清单机器可读化 |
| 行业自律 | Kobalt/Merlin×ElevenLabs、UMG 各类授权、Grimes elf.tech 分成克隆、Holly Herndon holly+、艺术家官方 voice bank(voice-swap 等) | 「授权音库 + 分成」是唯一可持续的克隆商业化路径 |
11.6 专题对比:「精细可控研究系统」vs DiffSinger / Synthesizer V 等 DAW 类工具
本报告 §5 与实验设计提出的「16 维精细可控歌声系统」(大规模挖掘数据 + 受控技巧标注 + 连续参数轴 + 可验证奖励后训练)经常被拿来和 DiffSinger、Synthesizer V 这类工具比较。二者其实不在同一个产品层:DAW 类工具卖的是「编辑器 + 音库」,人用 GUI 逐音符调教;精细可控系统做的是「控制平面本身」——一套人和 AI Agent 都能程序化驱动的机器可读控制空间。下表先把主流工具放到同一坐标系里。
| 体系 | 形态 | 控制粒度 | 技巧如何表达 | 自动化接口 | 数据策略 | 典型用户 |
|---|---|---|---|---|---|---|
| 精细可控研究系统(§5 十六维 + E 系列) | 数据管线 + 模型 + RL 后训练 + API 服务 | L0 逐帧连续曲线 / L1 音符级技巧标签 / L2 乐句-歌曲级风格全局量 / L3 制作层 | 一等公民:GTSinger 六类 + 扩展类的显式标签空间,受控对照数据监督,跨音库可迁移,可作为 reward | 原生 API/server 化(为 Agent 设计);控制即结构化输入 | 284TB 级挖掘 + 分离 + 自举伪标 + 少量录音棚受控对照 | 研究者、AI 音乐平台、Agent 应用开发者 |
| Synthesizer V Studio 2 Pro | 本地推理编辑器 + 商业音库(买断 $89 + 音库分售) | 音符级 + NoteGroup 级 Automation 曲线 | Vocal Modes:每个音库出厂自带固定模式集(如 Breathy/Belt/Chest…),可混合加权;模式同时影响音色+咬字+音高曲线细节。无跨音库统一taxonomy | Pro 版 Lua/JS 脚本 API:Automation 已暴露 8 个标准参数——pitchDelta(±1200c)、vibratoEnv、loudness(-48~12dB)、tension、breathiness、voicing、gender、vocalMode_*;社区已出现 mcp-svstudio 把它接进 LLM |
每音库棚录数小时专录 + 厂商内部增强 | 职业制作人、P 主、虚拟歌手创作者 |
| DiffSinger + OpenUtau(开源生态) | 开源引擎(ONNX)+ 免费 DAW 式编辑器 + 社区音库分发 | 音符级;曲线仅 pitch / DYN(音量) / GENC(性别共振峰) 三类 + variance 分支(时长/F0/能量预测器) | 无技巧概念:vibrato、气声等全靠调教师手绘曲线或音库训练数据的风格烙印;OpenUtau 用「Expressions」机制替代 UTAU flags,社区工具 Expressive 已能从真人歌声提取 Dynamics/Pitch Deviation/Tension 曲线回填工程——本质是在给「缺技巧轴」打补丁 | USTX 文件格式 + 插件/phonemizer API;无官方模型推理 API(自己起 ONNX session 即可,社区常这么干) | 任何人录 1–10h 自训音库(教程/QQ群/B站生态成熟);质量方差大 | 同人创作者、UTAU 迁移用户、学生与极客、免费商用规避者 |
| ACE Studio 2.0 | AI 音乐工作站(云端起家→2.0 本地化倾向),140+ 音源 | MIDI/歌词级 + 六参数自动化(Breath/Air/Falsetto/Tension/Energy/Formant);新 Verse25 引擎 Power/Soft/Breathy/Chest 四轴 + breath noise | 连续推子最接近 L0 思想的商业产品;Blend Voices / Choir Mode 做「音色空间插值」;但不暴露技巧标签,不可自定义 taxonomy | 有 API 与数据合作先例(ACE-Opencpop 即其产物);编辑器内自动化 | 厂商棚录音库 + 用户上传样本克隆自定义音源 | 半专业音乐人、内容创作者、广告/游戏音频 |
| VOCALOID6 / CeVIO AI / Piapro | 传统商业编辑器 + IP 生态 | 音符级参数面板(VEL/DYN/BRE/BRI/GEN/PIT…) | 参数语义与 SynthV 类似但 AI 底座老化;价值在初音未来等 IP 与演出变现 | VOCALOID Job Plugin(MIDI 事件模型) | 厂商棚录 | IP 粉丝、怀旧工作流持有者 |
| RVC / so-vits / DDSP-SVC 实时系 | 转换器而非合成器(需源演唱) | 无音符级控制——继承源演唱的一切表现力,只换 timbre | 技巧=源歌手的技巧(这是优点也是天花板);检索增强让输出贴近目标歌手唱法分布 | w-okada voice-changer 等实时壳;模型文件即接口 | 目标歌手几分钟~几小时干声 | 翻唱 UP、直播变声、demo 快速试唱 |
| Suno / Udio / Mureka / Eleven Music | 消费级整曲生成(prompt 进、成品出) | prompt 级(Mureka 有段落级重生成);无逐音符编辑 | 隐式:模型从数据分布里「猜」你要的技巧;涌现但不可控不可验证 | API 生成 + stem 导出(Suno Premier);无编辑接口 | 海量授权/爬取整曲端到端训练 | 普通消费者、短视频创作者、灵感速记 |
三个本质区别
① 技巧的「载体」不同 —— 这是分水岭。DAW 工具里,技巧要么被烧死在音库里(SynthV 的 Vocal Modes 是每个 bank 出厂固定的离散集合,换个 bank 集合就变了;DiffSinger 干脆没有技巧轴,mix/belt 全靠调教师手绘 pitch+tension 曲线硬模拟),要么是引擎级黑盒参数。精细可控系统里技巧是显式标签空间:受控对照数据(GTSinger 式「同旋律×有无技巧」)提供干净监督 → 分类器可全量伪标 → 标签既当合成条件又当 RL 奖励,且跨音库/跨语言可迁移。「让任何音库都会戏腔」在 DAW 范式下等于重新录一个音库,在本范式下是一份标注数据。
② 控制界面的服务对象不同。DAW 的控制平面为「坐在钢琴窗前的人」设计:鼠标画曲线、拖推子、听一秒改一秒。它的自动化能力(SynthV Pro 脚本、VOCALOID Job Plugin)是编辑器的附属品——脚本跑在编辑器宿主进程里,批处理几十轨就到舒适区边缘。精细可控系统的控制平面为「程序」设计:16 维全部结构化(曲线数组/标签序列/全局向量),原生支持批量生成、A/B 重渲染、Agent 决策循环。值得注意的是行业已在自发收敛到这个方向——mcp-svstudio 已经把 SynthV 的脚本 API 包成 MCP server 让 LLM 直接创建人声轨,这恰恰说明「Agent 需要机器可读控制平面」是真实需求,只是 DAW 架构让它始终隔着一层编辑器。
③ 质量的来源不同。DAW 工具的音质上限 = 音库录制质量 × 引擎水平,改进靠「重新录更好的音库」;精细可控系统的质量来源 = 数据规模多样性 + 偏好后训练(E6),改进靠「更多数据 + 更好的奖励」。前者边际成本线性(每音库几万到几十万),后者边际成本趋近于算力。这也解释了为什么 SynthV/ACE 的音库按个售卖,而 Suno 敢按月订阅——商业模式由数据策略决定。
一个耐人寻味的印证:控制轴向的同构性
把 SynthV 脚本 API 暴露的 8 条标准 Automation 曲线和本方案 L0 层并排放:
| SynthV Automation(2022 起逐步加入) | 本方案 L0/L1 轴 | 对应声乐变量 |
|---|---|---|
Pitch Deviation ±1200 cents | #1 音高 F0 曲线 | F0 微调/滑音/portamento |
Vibrato Envelope 0–2× | #5 颤音三参数(幅度轴) | vibrato 幅度包络 |
Loudness −48~12 dB | #2 响度包络 | 乐句动态/messa di voce |
Tension −1~1(Tense↔Relaxed) | #8 发声质感(pressed↔flow) | 声带纵向张力/闭合力度 |
Breathiness −1~1(Breathy↔Clean) | #3 气声度连续轴 | 声门闭合度/HNR |
Voicing 0–1(Voiced↔Unvoiced) | #4 呼吸/气口相关 | 浊音化程度(气口、耳语段) |
Gender −1~1 | #9 音色的形变分量 | 共振峰缩放(声道长度因子) |
vocalMode_* 每音库若干条 | #6 技巧标签的连续化近似 | mix/falsetto/belt… 的音库内预设 |
Dreamtonics 用四年时间把编辑器参数收敛到这 8 条轴,ACE Studio 的六推子与之高度重叠——商业产品已经独立验证了「少数正交连续轴可以承载大部分演唱表达」这一假设。本方案的不同只在于:把这些轴从「编辑器的后处理语义」前移为「声学模型的训练条件」,并补上商业产品没有的三块——跨音库统一的技巧标签(L1)、乐句级表演风格(L2)、混音美学(L3),以及用 RL 让模型学会「轴拨到位、声音就到位」而不是靠人工调轴。
场景矩阵:什么任务用什么工具
| 场景 | 首选 | 为什么 |
|---|---|---|
| 单曲级专业制作(demo 唱样、和声、虚拟歌手作品) | SynthV 2 Pro / ACE Studio | 开箱音质最高、GUI 调教成熟、音库授权清晰 |
| 同人创作 / 免费翻唱 / 低预算实验 | DiffSinger + OpenUtau | 零成本、音库海量、社区教程完善;接受质量方差 |
| 翻唱换人 / 直播实时变声 / K歌修音 | RVC 系 + w-okada | 保留真人演唱表现力只换 timbre;延迟可压进 100ms 级 |
| 30 秒出完整小样 / 灵感速记 | Suno / Mureka / Eleven Music | 唯一不需要任何音乐技能的工作流 |
| 影视游戏批量人声生产(NPC 歌唱、多语言版本、广告 jingle 变体) | 精细可控系统(API 化) 或 ACE/SynthV 脚本批处理 | 需要程序化驱动 + 一致性约束 + 版权合规账本;DAW 手工流在此场景成本失控 |
| AI Agent 自主编曲演唱(生成→自评→修正闭环) | 精细可控系统(原生设计目标) | Agent 需要:结构化控制输入、可验证奖励自评、毫秒级重渲染;mcp-svstudio 是过渡态方案 |
| 声乐教学 / 演唱分析可视化 | 精细可控系统 + GTSinger 类标注工具链 | 技巧标签+连续轴天然构成「可解释的教学语言」(这段用了 60% mix + 颤音幅度不足) |
| 老录音修复 / 逝者声音重建 | SVC 重灌 + SVS 补写缺失段落 | 两段管线互补(§4.3 callout) |
12 · 趋势判断与机会点
- RL 数据生产基础设施:歌唱后训练需要「采样 → 打分 → 偏好对构造」的高吞吐流水线,与 avalanche/agentic-rl 的 fail-to-pass 式验证思想同构——可验证奖励(唱词正确率、F0 乐谱对齐)天然适配 GRPO 批量验证。
- 评测代理:SingMOS/SoulX-Singer-Eval/GTSinger 技巧识别器可作为 reward model 的起点;SVCC 分析给出的「客观-主观相关性表」是设计 reward 权重的直接依据。
- Human-in-the-loop 标注工作流:ACE-Opencpop 证明「AI 初稿 + 专家修正」比纯录制便宜一个数量级,与本区 human-in-the-loop-data-workflows-study 主题直接衔接。
- 多模态 Agent 场景:语音 Agent 若具备可控歌唱能力(情绪化应答、品牌音色 jingle、K 歌互动),将成为 moss-work 类产品的差异化能力;实时 SVC 的延迟工程是前置条件。
13 · 参考文献与链接
论文与基准
- DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism (AAAI 2022) — arXiv:2105.02446 · code · openvpi 维护版
- GTSinger (NeurIPS 2024 Spotlight) — arXiv:2409.13832 · data/code
- Singing Voice Data Scaling-up: ACE-Opencpop & ACE-KiSing (Interspeech 2024) — arXiv:2401.17619
- M4Singer (NeurIPS 2022) — site · Opencpop — GitHub
- VocalSet (ISMIR 2018) — Zenodo · paper
- TCSinger (EMNLP 2024) — ACL Anthology · StyleSinger (AAAI 2024) · AlignSTS
- The Singing Voice Conversion Challenge 2023 — arXiv:2306.14422;SVCC 2025 Extensive Analysis — arXiv:2509.15629;SingMOS-Pro — arXiv:2510.01812
- SpeechAlign (NeurIPS 2024) — arXiv:2404.05600
- Seed-Music (ByteDance, 2024) — arXiv:2409.09214 · 官网
- YuE — arXiv:2503.08638 · GitHub;SongGen (ICML 2025) — GitHub
- LeVo — arXiv:2506.07520 · GitHub
- ACE-Step — arXiv:2506.00045 · GitHub
- BS-RoFormer / Mel-RoFormer — arXiv:2309.02612 / 2310.01809;RMVPE — arXiv:2306.15412;FCPE — arXiv:2509.15140
- AutoLyrixAlign — GitHub;CtrSVDD — paper
- SoulX-Singer-Eval — GitHub(2026-02)
开源项目与工具链
- RVC — Retrieval-based-Voice-Conversion-WebUI;so-vits-svc — svc-develop-team;DDSP-SVC — yxlllc/DDSP-SVC;seed-vc;w-okada voice-changer;OpenUtau — stakira/OpenUtau
- UVR5 / audio-separator(默认 Mel-RoFormer);Music-Source-Separation-Training(ZFTurbo)
产品与行业
- Dreamtonics Synthesizer V Studio 2 Pro — 官网 · Vocal Modes 手册
- ACE Studio 2.0 发布公告 — acestudio.ai;Sound on Sound 评测(2024 / 2026-02)— 链接;Pitch 编辑文档 — docs;SVS vs RVC 官方对比 — 博客
- Suno/Udio 诉讼状态追踪(2026)— AI Vortex · AlaTirok;Suno vs Udio 实测评测(2026-06)— Rinzara;Warner×Suno 授权 — The Verge
- Eleven Music 发布 — ElevenLabs · MBW(2026-05)
- Mureka O1/V6 发布 — 昆仑万维(36氪转载) · MusiCoT 主页 MusiCoT.github.io
- 中国合规:《人工智能生成合成内容标识办法》— 网信办原文 · 普华永道合规解码;ELVIS Act — Tennessee 州议会;殷某案等中国 AIGC 判例梳理见公开案例集
- 中国市场:天琴实验室 — 介绍;TME Studio;网易天音 — 官网
- §5.7 四层体系补充:颤音四参数建模 ExpressiveSing — arXiv:2211.00996 · Bonada & Blaauw Hybrid Neural-Parametric F0(ICASSP 2020);VibratoScope — JOSS 2026;呼吸自训练检测 — arXiv:2402.00288 · BreathBase;HNR/CPPS 临床口径 — PhonaLab 指南;情绪数据集 — PMEmo · DEAM · MER 数据集汇总;swing/microtiming — Datseris et al. Sci Rep 2019 · Friberg & Sundström 2002 · Downbeat delays(Comm. Phys. 2022);自动混音与效果链迁移 — FxNorm-AMIX(ISMIR 2022) · DeepAFx-ST · AiLive Mixer(arXiv:2603.15995)
- §11.6 补充:SynthV 脚本 API 与 Automation 参数定义 — 官方 Scripting Manual · 2 Pro 手册 · svstudio-scripts;LLM×SynthV 桥 — mcp-svstudio(MCP server);DiffSinger/OpenUtau 参数面与音库打包 — opensynth wiki · diffsinger.com 导航;真人表情曲线迁移工具 — Expressive
附录 · 中英术语对照表
| 中文 | English | 一句话释义 |
|---|---|---|
| 真声/胸声 | modal voice / chest voice | 声带全振动的主声区,厚实 |
| 假声 | falsetto | 边缘振动轻飘高声区,常带气感 |
| 头声 | head voice | 高声区的明亮共鸣策略 |
| 混声 | mixed voice (mix) | 真假声肌肉配比连续混合,换声点核心技术 |
| 哨音 | whistle register | C6 以上极端声区 |
| 咽音 | pharyngeal voice | 咽腔收窄产生的金属芯共鸣 |
| 气声 | breathy voice | 声门不完全闭合带气流噪声的唱法 |
| 闭合/声门内收 | vocal fold closure / adduction | 声带靠拢程度——所有音色的底层连续变量 |
| 颤音 | vibrato | F0 周期调制(幅度/频率/相位三参数) |
| 直声 | straight tone | 无 vibrato 平直长音 |
| 滑音 | glissando / portamento | 音高连续滑动 |
| 转音/花腔 | melisma / riff & runs | 单音节跨多音符演唱 |
| 气泡音 | vocal fry | <50Hz 不规则低频振动 |
| 怒音/嘶吼 | growl / distortion | 室带振动叠加的失真音色 |
| 强声 | belt | 高音区胸声主导高强度唱法 |
| 换声点 | passaggio | 声区间过渡区域 |
| 歌声合成 | Singing Voice Synthesis (SVS) | 乐谱 → 歌声 |
| 歌声转换 | Singing Voice Conversion (SVC) | 换音色保演唱 |
| 说转唱 | Speech-to-Singing (STS) | 说话音频 + 旋律 → 歌声 |
| 谐波噪声比 | HNR (Harmonics-to-Noise Ratio) | 气声程度的声学代理 |
| 共振峰 | formant | 声道滤波峰,决定音色/元音 |
| 导歌/主歌谱 | lead sheet | 旋律+和弦+歌词的符号化乐谱(Seed-Music token 化对象) |
| 强制对齐 | forced alignment | 文本-音频时间戳自动标注 |
| 信失比 | SDR (Signal-to-Distortion Ratio) | 源分离质量指标(Mel-RoFormer 人声 ≈12dB) |
| 实时因子 | RTF (Real-Time Factor) | 处理时长/音频时长,<1 即快于实时 |
报告完 · 生成于 2026-08-24 · 由 opencode deep research 流程产出:16 轮定向检索 + 论文/官方文档交叉核验。事实性陈述均给出处;闭源系统内部架构(Suno/Udio 等)为业界推测,已明确标注。如需补充某一维度(例如某公司深度拆解、某数据集逐字段审计),可在 research/singing-voice-study/ 下继续扩展专题。