输入的音频可能存在用户的语气词,在推理时会大概率出现尾音很长的情况  导致一个字念很长时间。大部分情况会导致不可用; 另外发现,当temperature设置的很低时,例如0.3,基本不会生成stop_token,生成的音频几乎都是拉长的尾音;我不确定这两个是不是同一个问题导致的。
输入的音频可能存在用户的语气词,在推理时会大概率出现尾音很长的情况
导致一个字念很长时间。大部分情况会导致不可用;
另外发现,当temperature设置的很低时,例如0.3,基本不会生成stop_token,生成的音频几乎都是拉长的尾音;我不确定这两个是不是同一个问题导致的。