HyperAIHyperAI

Command Palette

Search for a command to run...

16.9MB音声認識モデル「Whistle」を公開

Cactus-Computeは、エッジデバイス向けに最適化されたオープンソース音声認識モデルWhistleを公開した。同モデルは単一ファイルサイズ16.9MBに収まり、CPUのみで動作する依存関係のない設計となっており、既存の軽量テキスト処理エンジンNeedleと同じC++インフラストラクチャを共有する。これにより、1つのバイナリで音声認識とツール呼び出しをシームレスに実行可能となった。 Whistleは英語、ドイツ語、フランス語、スペイン語、イタリア語、オランダ語、ポーランド語の7言語に対応し、最大30秒の音声を1パスで処理できる。言語の自動検出機能に加え、単語単位の開始・終了時刻と確率値、フレームごとの音声埋め込み出力を提供する。全処理はデバイス内で行われ、オーディオデータが外部に送信されることはない。 アーキテクチャ面では、Needleとエンコーダー部分を共有し、効率的なクロスアテンション機構とビームサーチを採用した。10秒オーディオの処理において初トークン生成を約11msで達成し、LibriSpeech、SPGISpeech、Earnings-22、FLEURSなどの主要ベンチマークでWhisper Baseモデルを上回る精度を記録している。キーワードバイアシング機能にはAho-Corasickアルゴリズムを採用し、ユーザー指定の語句を認識過程で優先的にスコアリングできる。 開発環境はmacOS、Linux、Android、iOS、watchOS、Windows on ARM、RISC-V、MIPS、ブラウザ、WASIを含む17のターゲットプラットフォームにプリビルトされたC++ APIを提供する。環境変数の読み取りを排除し、コンパイルデフォルトと明示的なフラグのみで挙動を制御する設計は、組み込み機器や自動車、スマートホームデバイスなどの制約が厳しい環境への導入に適している。モデルウェイトはHugging Faceで公開され、エンジンおよびソースコードはGitHub上のCactus-Computeリポジトリで入手可能だ。 本リリースにより、メモリと計算資源が限られるエッジ環境でも高精度な音声認識が実装可能となり、リアルタイム音声アシスタントやオフライン会話記録などのアプリケーション展開が促進される。技術コミュニティからは、軽量アーキテクチャと広範なクロスプラットフォーム対応が、次世代AIエッジコンピューティングの標準実装候補として注目されている。

関連リンク