Whistle transkribiert Sprache in 16,9 MB
Cactus-Compute hat mit Whistle ein Open-Source-Spracherkennungsmodell veröffentlicht, das sich durch eine Speicherkonfiguration von nur 16,9 Megabyte auszeichnet. Das System ist primär für ressourcenbeschränkte Edge-Geräte wie Mobiltelefone, Wearables, Robotik, Smart-Home-Hardware, Automotive-Systeme und Mikrocontroller entwickelt. Whistle führt die gesamte Inferenz lokal auf der CPU durch, benötigt keinerlei externe Laufzeitumgebungen und verarbeitet Audiodaten bis zu einer Länge von 30 Sekunden in einem einzigen Durchlauf. Die Architektur folgt einem Encoder-Decoder-Design, das konzeptionell eng mit dem früheren Needle-Modell verzahnt ist. Der Encoder nutzt acht Simple-Attention-Blöcke mit einer Monarch-Hadamard-MLP-Alternative zu herkömmlichen Feed-Forward-Netzen. Der Decoder employs ladderte Attention-Schichten und eine gated cross-attention-Mechanik, die Encoder-Projektionen zwischenspeichert, um den Suchprozess zu beschleunigen. Das Modell transkribiert sieben Sprachen: Englisch, Deutsch, Französisch, Spanisch, Italienisch, Niederländisch und Polnisch. Neben der reinen Textausgabe generiert es präzise Wortzeitstempel mit Wahrscheinlichkeitswerten sowie Frame-basierte Sprachembeddings. Eine automatische Spracherkennung wird direkt als Token in den Textstrom integriert. Unabhängige Benchmarks belegen, dass Whistle auf Datensätzen wie LibriSpeech, SPGISpeech, Earnings-22 und dem FLEURS-Durchschnitt die Genauigkeit von Whisper Base und Moonshine Tiny v2 übertrifft. Gleichzeitig reduziert sich das Modellvolumen von über 145 Megabyte auf unter 17 Megabyte bei nahezu paralleler Latenz. Die Zeit bis zum ersten Token beträgt durchschnittlich elf Millisekunden auf Apple-M4-Prozessoren und skaliert linear zur Audioeingabe. Eine vorgeschaltete Pegelüberwachung verhindert unnötige Rechenzyklen bei Stille. Zur Steuerung des Beam-Such-Laufs mit fünf Verzweigungen kommt ein Aho-Corasick-Automat zum Einsatz, der das gewichtete Hervorheben definierter Schlüsselwörter während der Decodierung erlaubt. Die Integration wird durch eine einzelne, plattformunabhängige C++-Engine ermöglicht, die sowohl Whistle als auch Needle in einer Binärdatei hostet. Die standardisierte API übergibt Audio-Streams direkt an Tool-Aufrufe und liefert Transkript, erkannte Sprache, Latenzzeit sowie Decodiergeschwindigkeit als strukturiertes JSON zurück. Laufzeitparameter wie die Sprachvorgabe, Schlüsselwörter oder die aktive Decodiertiefe sind explizit konfigurierbar. Das Framework unterstützt siebzehn Zielarchitekturen, darunter macOS, Linux, Android, iOS, Windows ARM, RISC-V, MIPS sowie WebAssembly und WASI. Die Modellgewichte stehen über Hugging Face bereit, während die Engine und der Quellcode unter Cactus-Compute/needle3 auf GitHub veröffentlicht wurden. Die ausschließliche Lokalverarbeitung garantiert, dass Audiomaterial das Endgerät niemals verlässt, was die Lösung insbesondere für datenschutzkritische Anwendungsfälle und reine Offline-Szenarien relevant macht.
