跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

21 条精选近 30 天 5 条共收录 37 条

更新

精选归档 · 第 2 页

3月12日周五第 21–21 条
  1. Hugging Face Blog63

    使用 Hugging Face Transformers 微调 Wav2Vec2 实现英文语音识别

    Hugging Face 官方发布了使用 Transformers 库微调预训练 Wav2Vec2 模型实现英文自动语音识别的端到端教程。该方案基于 Connectionist Temporal Classification(CTC)算法且不依赖外部语言模型,在仅 5 小时训练数据的 Timit 数据集上微调取得了 22.1% 的测试词错误率(WER)。

    推荐理由:教程展示了无需外接语言模型的端到端语音识别微调全流程,读者可以直接迁移到自定义英文音频数据集。