Skip to content

关于 THCHS30-Synth 重合成方法及基频标注误差的问题 #24

Description

@Yuemei0

作者您好,

感谢您分享 FCPE 的论文和代码。

论文第 3.1 节提到,为了减少人工标注带来的误差,您使用 DDSP 对 THCHS30 测试集进行了重合成,并构建了 THCHS30-Synth 数据集。我希望复现类似的数据构建流程,因此想请教以下问题:

  1. 请问重合成时使用的是哪一种 DDSP 实现、模型权重和配置?重合成 M4Singer、VCTK 训练数据时是否也使用了相同的流程?

  2. DDSP 所需的 F0、响度以及清浊音等条件信息是如何获得的?例如,F0 是通过某种基频提取算法从原始音频中提取的,还是来自数据集原有标注?是否进行了平滑或人工修正?

  3. 在 THCHS30-Synth 上计算 RPA 时,使用的参考 F0 是输入 DDSP 合成器的 F0 控制轨迹,还是从重合成音频中重新提取的 F0?

  4. 请问您是否评估过输入 DDSP 的目标 F0 与重合成音频实际呈现的 F0 之间的偏差?

  5. 后续是否有计划公开 THCHS30-Synth 数据集,或者重合成所使用的代码、配置和数据处理脚本?

我主要想了解,DDSP 重合成音频是否可以作为细粒度 F0 评测中的高精度 ground truth。

感谢您的时间与帮助!

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions