← 返回信息流

MarkTechPost新闻

Superwhisper 发布 S1-mini:462 MB 开源权重文本规范化模型,将原始 ASR 转录转为干净书面文本

marktechpost.com作者:Michal Sutter模型开源AI评分:70/100

Superwhisper 发布了 S1 系列模型,其中 S1-mini 是 0.6B 参数的开源文本规范化模型,用于将 ASR 原始转录转换为干净书面文本,去除填充词、修正自我纠正、添加标点等。该模型基于 Qwen3-0.6B 微调,仅支持英文,以 Apache 2.0 许可发布,Q4_K_M GGUF 文件仅 462 MB,可在笔记本电脑 CPU 上运行。官方报告在 7,519 个案例上达到 94.8% 的 token 准确率。

Superwhisper 发布了 S1 模型系列:S1-Voice、S1-Language 和 S1-mini。S1-Voice 是一款云端语音转文本模型,S1-Language 是一款用于文本清理和格式化的云端指令遵循模型。在应用之外最引人关注的是 S1-mini,它已在 Hugging Face 上以开放权重发布。S1-mini 是一个 0.6B 参数的文本规范化器,既不是转录器,也不是聊天模型。它位于自动语音识别(ASR)之后,将原始转录文本改写为干净的书面文本:去除填充词,将自我修正解析为说话者最终确定的表述,应用标点和大小写,并将口语化的数字、日期、货币和电子邮件地址转换为书面形式。它基于 Qwen/Qwen3-0.6B 微调而来,v1 版本仅支持英语,完全由置于转录文本上方的三轴控制行来引导。Superwhisper 报告称,在包含 7,519 个案例的预留测试集上,其词元准确率达到 94.8%,该结果是在量化版本上使用贪心解码测得的。

它可以部署吗?

可以,但仅限于 S1-mini。S1-mini 已在 Hugging Face 上以 Apache 2.0 许可证加命名条款发布。S1-Voice 和 S1-Language 是 Superwhisper 托管的服务,因此只能使用,不能自行托管。

  • 公司规模:任何规模均可。Q4_K_M GGUF 版本是一个 462 MB 的文件,可在笔记本电脑 CPU 上运行。独立开发者可以将其集成到桌面应用中。企业可以将其部署在 VPC 之后,确保音频转录文本不会离开网络。
  • 行业:医疗保健和临床文档、法律、金融服务、客户支持、开发者工具、无障碍和实时字幕。
  • 应用场景:听写应用、会议记录工具、实时字幕、语音驱动编辑器、语音到 CRM 录入,以及任何将原始 ASR 输出转换为可供人阅读文本的流水线。

S1-mini 的功能

S1-mini 是一个文本规范化器,不是转录器,也不是聊天模型。它位于自动语音识别之后:

它会移除填充词,将错误开头和自我修正解析为说话者最终确定的表述,应用标点和大小写,并将口语化的数字、日期、时间、货币和电子邮件地址转换为书面形式。说“support at superwhisper dot com”,你会得到 [email protected]。

该模型基于 Qwen/Qwen3-0.6B 微调。它拥有 5.96 亿个独立参数(0.44B 非嵌入参数)、28 层、16 个查询头和 8 个键/值头(使用 GQA),权重为 BF16。Hub 侧边栏显示 0.8B,是因为共享的嵌入层被存储了两次;模型卡片明确解释了这一差异。v1 版本仅支持英语,推荐输入约为 1,000 个词元。

控制行是唯一的交互界面

[Styling: <value>] [Structure: <value>] [Context: <value>]
<raw transcript>

Styling 接受 casual、semi-casual、semi-formal 或 formal。Structure 接受 prose 或 lists。Context 接受 general 或 email。三个轴相互独立,所有组合都经过训练。如果传入这些集合之外的值,或改写系统提示词,输出可能会降质或乱码。请注意一个值得了解的细微差异:Superwhisper 应用提供了一个五档语气滑块,增加了“balanced”预设,而开放权重版本只记录了四个经过训练的 Styling 值。

该模型在设计上也有限制。它不会添加你没有说过的内容,不会纠正事实,不会软化脏话,也不会改写方言。仅包含填充词的输入会返回空字符串,集成方应将此视为有效结果。

两个会破坏大多数集成的设置

首先,必须设置 enable_thinking=False。聊天模板是 Qwen3 的,未做修改,而 Qwen3 默认开启思考模式。S1-mini 在训练时关闭了思考,因此助手回复必须以空块开头。如果省略此标志,通常完全得不到可用输出。

其次,使用贪心解码。generation_config.json 自带 do_sample: false。GGUF 版本仍带有 Qwen3 继承的 temp = 0.6、top_p = 0.95 和 top_k = 20 元数据,因此每次请求都必须显式传入 temperature 0。在 llama.cpp 中,使用 --jinja 配合 --chat-template-kwargs '{"enable_thinking":false}',而不是使用 --reasoning-budget 0,后者会降低输出质量。

已报告的评估结果

Superwhisper 在包含 7,519 个案例、跨越 104 份转录文本的预留测试集上评估了 S1-mini。词元准确率为 94.8%,是在 Q4_K_M 版本上使用贪心解码测得的,文本编辑错误率为 11.6%。对于电子邮件格式的文本,问候语识别准确率为 99.3%,签名识别准确率为 97.9%。在输出结构(列表与段落)匹配上,准确率为 97.6%;在生成精确电子邮件地址方面,准确率为 92%。不到 1% 的生成结果出现循环或截断,当不应转录任何内容时,模型在 98.6% 的情况下能正确拒绝输出。这些是供应商在内部测试集上报告的数字,并非第三方结果。

两个云端模型

S1-Voice是托管的语音转文本模型。Superwhisper报告称,其转录速度比说话时间快46倍,大多数口述内容在您停止说话后0.32秒内即可完成转录。在包括会议音频和财报电话会议在内的八个数据集中,其平均词错误率为6.8%,在LibriSpeech上降至2.2%。Superwhisper表示,6.8%的平均错误率是其测试的15个模型中最低的,并且S1-Voice在其综合指标上得分为83分(满分100分),而WisprFlow为76分。

S1-Language是托管的指令遵循模型,用于清理、格式化和摘要,它出现在模型选择器中,与Anthropic、OpenAI和Groq的模型并列。推荐的默认配置是Cohere Transcribe加上离线版S1-mini,或者云端S1-Voice加上S1-Language。

交互式演示

下面的嵌入组件让您可以切换每个控制行轴并观察输出变化。每对输入/输出都逐字取自模型卡。

关键要点

  • S1-mini是一个0.6B参数的开源权重文本规范化器,用于ASR输出,不是转录器或聊天模型。
  • Q4_K_M GGUF格式文件大小为462 MB,可在笔记本电脑CPU上运行,因此设备端部署是切实可行的。
  • 固定的系统提示词加上三轴控制行是唯一的控制机制。
  • enable_thinking=False和temperature 0是强制性的;大多数集成错误都源于这两项设置。

需要与我们合作推广您的GitHub仓库、Hugging Face页面、产品发布或网络研讨会等?请联系我们

Michal Sutter是一位数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。凭借在统计分析、机器学习和数据工程方面的扎实基础,Michal擅长将复杂数据集转化为可操作的见解。

阅读原文