作者您好,
感谢您分享 FCPE 的论文和代码。
论文第 3.1 节提到,为了减少人工标注带来的误差,您使用 DDSP 对 THCHS30 测试集进行了重合成,并构建了 THCHS30-Synth 数据集。我希望复现类似的数据构建流程,因此想请教以下问题:
-
请问重合成时使用的是哪一种 DDSP 实现、模型权重和配置?重合成 M4Singer、VCTK 训练数据时是否也使用了相同的流程?
-
DDSP 所需的 F0、响度以及清浊音等条件信息是如何获得的?例如,F0 是通过某种基频提取算法从原始音频中提取的,还是来自数据集原有标注?是否进行了平滑或人工修正?
-
在 THCHS30-Synth 上计算 RPA 时,使用的参考 F0 是输入 DDSP 合成器的 F0 控制轨迹,还是从重合成音频中重新提取的 F0?
-
请问您是否评估过输入 DDSP 的目标 F0 与重合成音频实际呈现的 F0 之间的偏差?
-
后续是否有计划公开 THCHS30-Synth 数据集,或者重合成所使用的代码、配置和数据处理脚本?
我主要想了解,DDSP 重合成音频是否可以作为细粒度 F0 评测中的高精度 ground truth。
感谢您的时间与帮助!
作者您好,
感谢您分享 FCPE 的论文和代码。
论文第 3.1 节提到,为了减少人工标注带来的误差,您使用 DDSP 对 THCHS30 测试集进行了重合成,并构建了 THCHS30-Synth 数据集。我希望复现类似的数据构建流程,因此想请教以下问题:
请问重合成时使用的是哪一种 DDSP 实现、模型权重和配置?重合成 M4Singer、VCTK 训练数据时是否也使用了相同的流程?
DDSP 所需的 F0、响度以及清浊音等条件信息是如何获得的?例如,F0 是通过某种基频提取算法从原始音频中提取的,还是来自数据集原有标注?是否进行了平滑或人工修正?
在 THCHS30-Synth 上计算 RPA 时,使用的参考 F0 是输入 DDSP 合成器的 F0 控制轨迹,还是从重合成音频中重新提取的 F0?
请问您是否评估过输入 DDSP 的目标 F0 与重合成音频实际呈现的 F0 之间的偏差?
后续是否有计划公开 THCHS30-Synth 数据集,或者重合成所使用的代码、配置和数据处理脚本?
我主要想了解,DDSP 重合成音频是否可以作为细粒度 F0 评测中的高精度 ground truth。
感谢您的时间与帮助!