HyperAIHyperAI

Command Palette

Search for a command to run...

16.9MB开源语音识别模型Whistle发布

近日,Cactus Compute团队正式发布Whistle,一款仅重16.9MB的开源端侧语音识别模型。该模型专为移动端、可穿戴设备、物联网及微控制器等边缘场景设计,完全依赖CPU运行且无需额外依赖库。Whistle原生支持七种语言,可在本地处理长达30秒的音频,实现首字延迟低至11毫秒的实时转录。 技术架构方面,Whistle深度整合于Cactus Compute的Needle推理引擎中,共享单一C++二进制文件即可同时运行语音识别与文本生成任务。其编码器与解码器采用轻量级注意力机制,在实现高精度转录与词级时间戳对齐的同时,直接输出语音嵌入向量以驱动本地工具调用。基准测试表明,该模型在LibriSpeech与SPGISpeech等数据集上的表现优于体积庞大的Whisper Base,且体积缩减近九成。 目前,Whistle引擎已预编译支持十七种操作系统与硬件架构,涵盖主流移动端、车载系统及浏览器环境,并提供标准化编程接口。伴随权重开源与API的发布,Whistle显著降低了纯离线语音交互的部署门槛,为资源受限的终端设备提供了高效、隐私安全的本地化音频处理解决方案。

相关链接