Whistle : modèle de reconnaissance vocale de 16,9 Mo
Cactus-Compute a rendu public Whistle, un modèle de reconnaissance vocale open source conçu pour fonctionner directement sur les terminaux, sans dépendances externes. Pesant 16,9 mégaoctets, le système s'exécute sur processeur central et partage son architecture avec le moteur Needle. Cette intégration commune permet de combiner transcription et exécution de commandes dans un seul fichier exécutable. Whistle traite jusqu'à trente secondes d'audio mono en une seule passe et identifie automatiquement sept langues : anglais, allemand, français, espagnol, italien, néerlandais et polonais. Au-delà du texte généré, le logiciel fournit l'horodatage précis de chaque unité lexicale et produit des représentations vectorielles exploitables par d'autres algorithmes. L'ensemble du processus s'effectue localement, assurant une confidentialité totale puisque les données sonores ne quittent jamais l'appareil. Techniquement, le modèle repose sur un encodeur et un décodeur optimisés pour la latence minimale. Un moteur de recherche par faisceaux et un filtrage par mots-clés améliorent la précision lors de la génération. Les évaluations sur plusieurs corpus publics, dont LibriSpeech, SPGISpeech et FLEURS, placent Whistle devant les références Whisper base et Moonshine tiny v2 pour la fiabilité, tout en consommant dix fois moins de mémoire vive. Sur une puce Apple M4 Pro, la première réponse apparaît en onze millisecondes pour dix secondes d'enregistrement. La compatibilité reste un point fort. Le moteur supporte une quinzaine de plateformes, incluant les systèmes desktop et mobiles, les navigateurs web et les microcontrôleurs embarqués. Les développeurs peuvent intégrer le modèle via une interface de programmation standard ou l'exécuter directement en ligne de commande. Les paramètres et le code source sont disponibles publiquement sur Hugging Face et GitHub, permettant une compilation adaptée à chaque architecture matérielle. Ce lancement répond à la demande croissante d'intelligence artificielle légère et autonome. En réduisant drastiquement l'empreinte logicielle tout en maintenant une précision compétitive, Whistle facilite le déploiement d'assistants vocaux rapides, résilients et entièrement privés sur des infrastructures aux ressources limitées.
