猎鹰 ASR 简介
Hugging Face Blog 发布了这条动态,详情请查看官方发布。

来自 Hugging Face Blog 的官方动态,版本与适用范围以发布方说明为准。
Hugging Face Blog · 查看官方发布中文机器翻译 · 原文附后
正文 · 来源原文
阿拉伯语 WER:20.92% · 参数:1.6B · 阿联酋语 WER(TII 评估):22.73%
我们正在推出 Falcon-ASR,这是我们的 16 亿参数阿拉伯语语音识别模型,特别关注阿联酋方言。它由阿布扎比技术创新研究所 (TII) 开发,还支持英语、法语、西班牙语和葡萄牙语。
在我们的评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均单词错误率为 20.92%,而我们使用的排行榜快照中的最佳公布结果为 23.17%。在我们的阿联酋内部评估中,它在我们比较的系统中记录了最低的单词和字符错误率。
我们还支持转录的单词级时间戳,将每个转录的单词与其在音频中的位置链接起来。
阿拉伯语语音因地区、说话者和环境而异。处理正式新闻广播的模型可能仍然难以处理阿联酋语对话或通过电话线录制的语音。阿拉伯语方言的转录资源也比现代标准阿拉伯语 (MSA) 少,这使得培训和评估更加困难。
我们用阿联酋语、MSA、其他海湾和阿拉伯方言以及英语对 Falcon-ASR 进行了培训。我们的目标是转录人们在日常言语中使用的单词,包括方言形式和语言之间的变化。
由 ELM 研究中心维护的开放通用阿拉伯语 ASR 排行榜根据六个测试集的等权平均 WER 对系统进行排名。它还报告字符错误率 (CER)。这两个指标的值越低越好。我们的 Falcon-ASR 评估遵循此协议。
WER = 字错误率; CER = 字符错误率。值越低表示性能越好。
我们使用排行榜的固定清单在相同的六个基准上评估了 Falcon-ASR。竞争对手的数据是 2026 年 9 月 30 日公布的排行榜平均值。Falcon-ASR 的平均 WER 比该快照中公布的最佳结果高 2.25 个百分点。
公共评估数据已包括阿联酋:卡萨布兰卡有阿联酋子集。我们通过对其他阿联酋和海湾地区语音的内部评估来补充该报道,使用保留的录音和人工验证的转录本来评估阿联酋公共子集之外的转录准确性。
在我们的阿联酋内部评估中,Falcon-ASR 实现了 22.73% WER 和 10.19% CER:
在此处比较的系统中,Falcon-ASR 的 WER 和 CER 最低。它的 WER 比第二好的 Qwen3-Omni 低 4.07 个百分点。结果表明,本次评估在单词和字符级别的转录准确性均有所提高。
我们包括背景噪音、重叠语音、音乐、房间混响和电话效果,以及速度和音调的变化。我们对阿联酋录音进行了同样的处理,将模型暴露在会议、通话和其他日常录音中可能遇到的一系列条件下。
Falcon-ASR 还可以使用相同的模型权重来转录英语。在我们对 Hugging Face Open ASR Leaderboard 使用的 7 个公共英语测试集的评估中,它的平均 WER 为 5.74%。
该模型还支持法语、西班牙语和葡萄牙语。所有五种语言都使用相同的权重,不需要语言标志。输出是所讲语言的文字记录。
Falcon-ASR 建立在我们的 Falcon3-Audio 工作之上。 Falcon3-Audio 的架构和训练方法在具有公共数据数据高效单阶段训练的竞争性音频语言模型中进行了描述。
我们的 Hugging Face 演示空间可让您尝试 Falcon-ASR 并探索其转录功能。 API 访问和本机应用程序已规划。我们邀请您使用自己的录音来尝试演示。
查看英文原文
Introducing Falcon ASR
Hugging Face Blog 发布了这条动态,详情请查看官方发布。
正文 · 来源原文
Arabic WER: 20.92% · Parameters: 1.6B · Emirati WER (TII evaluation): 22.73%
We’re introducing Falcon-ASR, our 1.6 billion parameter speech recognition model for Arabic, with a particular focus on the Emirati dialect. Developed at the Technology Innovation Institute (TII) in Abu Dhabi, it also supports English, French, Spanish and Portuguese.
In our evaluation, Falcon-ASR achieved an average word error rate of 20.92% across six Arabic test sets, compared with the best published result of 23.17% in the leaderboard snapshot we used. On our internal Emirati evaluation, it recorded the lowest word and character error rates among the systems we compared.
We also support word-level timestamps for transcriptions, linking each transcribed word to its position in the audio.
Arabic speech varies by region, speaker and setting. A model that handles a formal news broadcast may still struggle with a conversation in Emirati or with speech recorded over a phone line. Dialectal Arabic also has fewer transcribed resources than Modern Standard Arabic (MSA), which makes training and evaluation harder.
We trained Falcon-ASR on Emirati, MSA, other Gulf and Arabic dialects, and English. Our aim is to transcribe the words people use in everyday speech, including dialectal forms and changes between languages.
