新模型 2026-09-23

科大讯飞发布 Spark-ASR-2.0 语音识别大模型

科大讯飞发布 Spark-ASR-2.0 语音识别大模型

一句话说清:科大讯飞(专门做语音起家的公司)发了新一代语音识别模型 Spark-ASR-2.0,方言、吵闹环境也听得清,而且已经悄悄进讯飞输入法了。

发生了什么

9 月 23 日,科大讯飞正式发布新一代语音识别大模型 Spark-ASR-2.0。官方说它在“词错误率”上比上一代明显更低,尤其在方言、高噪音、小音量这三个难啃的场景上,表现优于当前业界最好水平。关键是它不只是“听准字”,还让输出文字更流畅、更通顺——从“一字不差”迈向“流畅成文”。而且效果大升级的同时,整体推理成本只比上一代多 10%。9 月 24 日起它先在讯飞输入法灰度上线,并通过讯飞开放平台向开发者和企业开放 API,后续还会落到讯飞 AI 眼镜、智能办公本、讯飞听见等产品。

对我有什么用

  • 用讯飞输入法语音转文字更准了:开会纪录、发微信、写备忘录,方言也能识别。
  • 做短视频、播客、字幕的人:语音转写质量上去,后期省事。
  • 开发者:开放平台能调 API,做带语音的应用(如语音备忘录、客服转写)成本不高。

我可以怎么做

  1. 手机装“讯飞输入法”,把语音输入打开,过两天如果更准了,就是它上线了(灰度推送,人人时间略不同)。
  2. 想批量转写:打开讯飞开放平台(www.xfyun.cn),找“语音听写 / Spark-ASR”相关接口申请试用。
  3. 企业用量大:看平台“星辰 MaaS”里有没有对应免费档(站内免费额度页有讲)。

温馨提醒

  • 灰度上线意味着不是所有人立刻都有,没感觉到变化就等几天或更新到最新版。
  • 语音识别再强也有翻车时候,重要合同、病历别只靠它,人工核对一遍更稳。
  • 免费额度和速率限制以讯飞开放平台当期页面为准,量大了要按量付费。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发