HyperAIHyperAI

Command Palette

Search for a command to run...

Du Développement De Code À l'exécution Automatisée, Muse-Glimmer-30B Rend Les Agents Locaux Plus Puissants ; Qwen3.8-27B-FP8 Publié, Repoussant Les Limites De l'inférence Efficace Avec 27 Milliards De paramètres.

Featured Image

Muse-Glimmer-30B, développé par Meta Superintelligence Labs, est un modèle de langage causal à 30 milliards de paramètres conçu pour les tâches basées sur des agents.En intégrant la distillation Muse Spark et une conception d'encodeur perceptif dédiée, le modèle Muse-Glimmer-30B regroupe l'inférence multi-étapes, l'appel d'outils, la compréhension multimodale et la récupération de tâches au sein d'un seul modèle. Ce dernier peut exécuter localement des tâches de longue durée sans dépendre d'une infrastructure cloud ni d'une connexion réseau, et affiche d'excellentes performances sur des benchmarks tels que DeepSearch QA, MCP-Atlas et SWE-Bench. De plus, le Muse-Glimmer-30B prend en charge la saisie de texte et d'images entrelacées, peut interpréter des informations complexes comme des captures d'écran, des graphiques et des documents, et propose des fonctionnalités optimisées d'appel d'outils pour les frameworks d'agents intelligents. Il offre ainsi de nouvelles solutions pour les assistants IA locaux, les agents intelligents basés sur du code et les applications multimodales.

Le site web d'HyperAI propose désormais « Muse-Glimmer-30B : un modèle de langage visuel multimodal ». Essayez-le !

Utilisation en ligne :https://go.hyper.ai/iuoeS

Aperçu rapide des mises à jour du site web officiel d'hyper.ai du 14 au 20 août :

* Jeux de données publics de haute qualité : 3

* Une sélection de tutoriels de haute qualité : 18

* Analyse d'un article de la communauté : 1 article

* Entrées d'encyclopédie populaire : 5

Visitez le site officiel :hyper.ai

Ensembles de données publiques sélectionnés

1. Ensemble de données de portraits MatrAIx Persona 1M

MatrAIx Persona 1M est un jeu de données de personas publié par MatrAIx, conçu pour fournir des données de personas précises et diversifiées pour des applications telles que la génération de données synthétiques, la modélisation de foules, le dialogue personnalisé, la simulation et l'évaluation. Ce jeu de données contient 999 847 personas, dont 599 847 sont issus de données réelles et 400 000 sont des composites entièrement basés sur des graphes acycliques dirigés (DAG). Chaque persona est décrit par 1 290 attributs catégoriels, couvrant des dimensions telles que les données démographiques, la langue, la profession, les compétences, la personnalité, les valeurs, les intérêts, le comportement, la santé et les caractéristiques du développeur. Les données des personnes de moins de 18 ans ont été supprimées.

Utilisation en ligne :https://go.hyper.ai/e4BKj

2. Ensemble de données de séquences d'images temporelles au niveau du véhicule

Le jeu de données « Séquences temporelles d'images de véhicules » est conçu pour fournir des données standardisées destinées à la recherche sur la reconnaissance des comportements de conduite dangereux (freinage agressif, insertion forcée, freinage brusque et zigzag) et la classification temporelle des vidéos de véhicules. Il soutient principalement la recherche dans les domaines des systèmes de transport intelligents, des systèmes avancés d'aide à la conduite (ADAS) et de l'apprentissage en présence de classes déséquilibrées. Ce jeu de données contient 434 séquences temporelles d'images de véhicules, couvrant à la fois les comportements de conduite normaux et dangereux. Il est organisé en 94 groupes de vidéos sources étiquetées en interne, chaque séquence correspondant à un véhicule suivi et étant accompagnée d'un fichier de métadonnées décrivant le comportement observé.

Utilisation en ligne :https://go.hyper.ai/e5TRV

3. Ensemble de données de détection de cibles de trafic routier bimodal

Le jeu de données Dual-modal Roadside Traffic est un ensemble de données de détection de cibles pour le trafic routier bimodal. Il collecte des données de trafic routier à l'aide de caméras RGB et événementielles spatialement calibrées et temporellement synchronisées, afin de fournir un support de données standardisé pour la fusion multimodale RGB et événementielle, la perception par caméra événementielle et une compréhension robuste des scènes de trafic, même dans des conditions d'éclairage et de mouvement difficiles. L'ensemble de données comprend des données alignées et des données brutes. Chaque échantillon des données alignées contient trois modalités : des images RGB spatialement et temporellement correspondantes, des représentations d'événements et des annotations de cibles. Il est ensuite divisé en ensembles d'entraînement, de validation et de test.

Utilisation en ligne :https://go.hyper.ai/bby5e

Tutoriels publics sélectionnés

1. Muse-Glimmer-30B : un modèle de langage visuel multimodal

Muse-Glimmer-30B est un modèle d'agent local à 30 milliards de paramètres, développé par Meta Superintelligence Lab. Basé sur la distillation de Muse Spark et doté d'un encodeur perceptif dédié, il intègre l'inférence multi-étapes, l'invocation d'outils, la compréhension multimodale et la récupération de tâches. Ce modèle peut exécuter des tâches d'agent complexes sur du matériel grand public sans dépendre des services cloud et prend en charge la compréhension d'informations multimodales telles que les captures d'écran, les documents et les graphiques, offrant ainsi de nouvelles possibilités pour les assistants IA locaux, le développement de code et l'automatisation.

Exécutez en ligne :https://go.hyper.ai/iuoeS

Page de démonstration

2. Datamol : Simplifie les procédures de traitement moléculaire

Datamol est une bibliothèque de traitement moléculaire open source développée par l'équipe Hadrien Mary/Valence Discovery. Basée sur RDKit, elle vise à simplifier les flux de travail en chimioinformatique. Cet outil fournit une API Python concise et intuitive, encapsule les opérations moléculaires courantes et prend en charge le calcul parallèle automatisé, le traitement efficace des fichiers et le traitement de données moléculaires à grande échelle. Datamol peut être largement utilisé dans des contextes tels que le criblage virtuel, la découverte de médicaments, le nettoyage de données moléculaires, l'analyse chimioinformatique et la visualisation.

Exécutez en ligne :https://go.hyper.ai/jf67y

3. L'IA pour les débutants : une série de tutoriels d'introduction à l'intelligence artificielle

Microsoft AI pour débutants est un cours d'apprentissage systématique de l'intelligence artificielle destiné aux débutants. D'une durée de 12 semaines et comprenant 24 leçons, il couvre un système de connaissances complet, de l'IA symbolique traditionnelle à l'apprentissage profond moderne. Ce cours combine des exemples pratiques et des quiz avec Jupyter Notebook, et aborde des domaines clés tels que les réseaux de neurones, la vision par ordinateur, le traitement automatique du langage naturel et l'apprentissage par renforcement. Il fournit également du code exécutable basé sur PyTorch et TensorFlow. Ce cours convient à l'auto-apprentissage de l'IA, au soutien pédagogique universitaire et à la formation technique en entreprise.

Exécutez en ligne :https://go.hyper.ai/Ms9so

4. Introduction au prétraitement de texte

Ce tutoriel présente de manière systématique le flux de travail de prétraitement de texte en TALN, en abordant les techniques clés, du nettoyage du texte brut à la standardisation. Le cours se concentre sur la réduction du bruit textuel et l'amélioration de la qualité des données d'entrée du modèle, en expliquant en détail 17 méthodes couramment utilisées, telles que la conversion de casse, la suppression de la ponctuation et des mots vides, la racinisation, la lemmatisation, le traitement des émojis et des URL, le nettoyage HTML, la conversion du langage de messagerie instantanée et la correction orthographique. Il aide ainsi les apprenants à concevoir des flux de travail de traitement de données textuelles de meilleure qualité.

Exécutez en ligne :https://go.hyper.ai/SfMvS

5. Représentation de la parole et exploration des données

Ce tutoriel s'appuie sur le cas pratique du défi de reconnaissance vocale TensorFlow, publié par DavidS sur Kaggle, et utilise le jeu de données Speech Commands v0.01 pour l'analyse de la reconnaissance vocale. Le cours se concentre sur les tâches de classification de la parole, en présentant des méthodes allant des formes d'onde brutes et des spectrogrammes à la visualisation des coefficients MFCC. Il aborde des processus tels que la détection des silences, le découpage audio, le sous-échantillonnage, l'extraction de caractéristiques et l'analyse statistique de la distribution des données. Il constitue une excellente introduction à la reconnaissance des commandes vocales, à l'ingénierie des caractéristiques audio et à l'analyse exploratoire des données vocales.

Exécutez en ligne :https://go.hyper.ai/ndnf9

6. Réévaluation des candidats recommandés selon les règles RAPIDS et les règles manuelles

Le modèle Candidate ReRank est une solution de système de recommandation développée par Chris Deotte, grand maître Kaggle, en novembre 2022. Il s'appuie sur les données de la compétition OTTO Recommender System et combine le calcul accéléré par GPU de la matrice de cooccurrence avec une stratégie de réordonnancement manuelle basée sur des règles. Grâce à RAPIDS cuDF, il génère efficacement des caractéristiques d'association du comportement utilisateur sur GPU et conçoit des règles de classement basées sur l'historique des actions (clics, ajouts au panier, achats, etc.) afin de proposer des recommandations de produits pertinentes. Cette solution est idéale pour les recommandations e-commerce, les systèmes de recommandation conversationnels et l'analyse de données comportementales à grande échelle.

Exécutez en ligne :https://go.hyper.ai/fAIYz

7. Introduction à la détection d'événements sonores : Modèle pré-entraîné AudioSet basé sur les réseaux de neurones artificiels périodiques (PANN)

Ce tutoriel présente les concepts fondamentaux et les méthodes pratiques de la détection d'événements sonores (SED). Contrairement à la classification sonore, qui se limite à déterminer la catégorie audio, la SED permet d'identifier les événements sonores et de localiser précisément leur début et leur fin. Ce cours s'appuie sur des réseaux de neurones audio pré-entraînés (PANN) et utilise un modèle CNN14 entraîné sur un vaste ensemble de données audio issues d'AudioSet pour réaliser la prédiction sonore à l'échelle de la trame et la détection d'étiquettes faibles. Il trouve des applications dans des domaines tels que la surveillance du bruit urbain, la détection d'anomalies industrielles, l'analyse bioacoustique et la reconnaissance sonore pour les maisons intelligentes.

Exécutez en ligne :https://go.hyper.ai/HOoPr

8. Tutoriel XGBoost Starter : Prédiction des défauts de paiement des cartes de crédit

La solution de prédiction de défaut de paiement de cartes de crédit AMEX Default Prediction s'appuie sur le notebook XGBoost Starter de Chris Deotte, utilisateur de Kaggle, et a obtenu un score de validation croisée (CV) de 0,792 et un score de validation croisée (LB) de 0,793 lors de la compétition. Cette solution repose sur l'ingénierie des caractéristiques, l'entraînement du modèle et la prédiction. Elle génère des caractéristiques statistiques en agrégeant les données historiques des utilisateurs, exploite l'entraînement accéléré par GPU et la validation croisée à cinq plis de XGBoost pour améliorer l'efficacité, et combine les métriques d'évaluation propriétaires d'AMEX afin d'optimiser les performances du modèle. Cette méthode est applicable aux tâches de prédiction d'apprentissage automatique telles que le contrôle des risques financiers et l'évaluation du crédit.

Exécutez en ligne :https://go.hyper.ai/Jkrtu

9. Introduction à la vision par ordinateur : des principes des CNN à la classification pratique d’images

Intro-Computervision est un projet open source de vision par ordinateur créé par Cezanne Camacho et distribué sous licence MIT. Il explique de manière systématique les principes des réseaux de neurones convolutifs (CNN) aux débutants en apprentissage profond. Le projet utilise des visualisations pour illustrer comment des opérations telles que la convolution et le pooling extraient les caractéristiques d'une image, et propose un exercice de classification d'images utilisant le jeu de données FashionMNIST comme exemple. Le contenu couvre l'intégralité du processus, du chargement des données à l'évaluation des performances, en passant par l'entraînement du modèle, ce qui le rend idéal pour l'apprentissage de la vision par ordinateur, l'enseignement et comme introduction à la détection d'objets et à la segmentation d'images.

Exécutez en ligne :https://go.hyper.ai/rRCrg

10. Prédiction du risque de cancer du sein : une série de tutoriels pratiques sur l’apprentissage automatique

Le projet de prédiction du risque de cancer du sein est un outil de diagnostic par apprentissage automatique basé sur le jeu de données Wisconsin Breast Cancer Diagnostic, issu du dépôt d'apprentissage automatique de l'UCI et développé par Jean Njoroge. Ce projet atteint une précision diagnostique supérieure à 981 % (TP3T) grâce à la comparaison de différents algorithmes de classification et à l'optimisation des hyperparamètres par GridSearchCV. Il couvre l'ensemble du processus, du chargement des données à l'optimisation, en passant par l'analyse exploratoire, la construction du modèle, son évaluation et son optimisation. À partir de 30 caractéristiques extraites d'images de noyaux cellulaires, il prédit le risque de cancer du sein et constitue une référence pour l'analyse des données médicales et la pratique de l'apprentissage automatique.

Exécutez en ligne :https://go.hyper.ai/fE5ti

11. Puzzles TileLang : Apprenez la programmation du noyau GPU avec 10 puzzles

TileLang est un langage de programmation dédié (DSL) haute performance pour les noyaux GPU, développé par l'équipe Tile-AI. Il vise à faciliter l'accès au développement de noyaux GPU. Les puzzles TileLang guident les apprenants à travers 10 exercices de difficulté croissante, partant des opérations de copie de base pour aboutir à la maîtrise progressive de méthodes modernes de programmation de noyaux GPU telles que GEMM et FlashAttention. Grâce au décorateur `@tilelang.jit` et aux opérateurs avancés comme `T.copy`, `T.gemm` et `T.Parallel`, TileLang simplifie la gestion des threads et de la mémoire, ce qui le rend idéal pour les débutants en programmation GPU et en calcul haute performance.

Exécutez en ligne :https://go.hyper.ai/1UJuc

12. Entraîner YOLOv8 à l'aide de données personnalisées

YOLOv8, publié par Ultralytics en janvier 2023, est un modèle de vision unifié prenant en charge quatre tâches : la détection d'objets, la segmentation d'instances, l'estimation de pose et la classification d'images. Ce modèle utilise l'API Python d'Ultralytics et l'interface de ligne de commande YOLO pour unifier les processus d'entraînement, de validation, d'inférence et d'exportation, ce qui le rend plus facile à utiliser. Son architecture intègre un module dorsal C2f, une tête de détection découplée sans ancrage et arrête l'augmentation de données Mosaic à la fin de l'entraînement, améliorant ainsi les performances sur les tâches de vision tout en maintenant une inférence efficace.

Exécutez en ligne :https://go.hyper.ai/k5x7O

13. NVIDIA NemotronLabs VoiceChat 11B : Modèle de dialogue vocal duplex intégral en temps réel de bout en bout

NVIDIA NemotronLabs VoiceChat est un modèle vocal duplex intégral de bout en bout doté de 11 milliards de paramètres. Son architecture unifiée permet une compréhension et une génération de la parole en temps réel avec une latence de réponse minimale d'environ 450 millisecondes. Ce modèle prend en charge les interruptions naturelles, les dialogues à tour de rôle et l'appel de fonctions vocales, surpassant ainsi les limitations des flux de travail ASR+LLM+TTS traditionnels. Il peut être utilisé dans des scénarios interactifs en temps réel, tels que les assistants intelligents et les agents vocaux.

Exécutez en ligne :https://go.hyper.ai/hW6ZK

Page de démonstration

14. Qwen3.8-27B-FP8 : Modèle de langage visuel natif

Qwen3.8-27B-FP8 est un modèle phare compact de la série Qwen3.8, développé par l'équipe Alibaba Cloud Tongyi Qianwen. Basé sur l'architecture Qwen3.5, il intègre des capacités de traitement du langage visuel natives et une échelle de paramètres de 27 milliards. Grâce à la quantification fine du FP8, ce modèle offre des performances proches de la version BF16 tout en réduisant considérablement l'utilisation de la mémoire GPU, ce qui le rend idéal pour les déploiements multi-GPU. Il prend en charge les contextes ultra-longs, la compréhension multimodale, le contrôle flexible des inférences et les appels d'outils, et peut être utilisé pour le développement de code, le traitement de tâches professionnelles, l'analyse de la recherche scientifique et les flux de travail complexes d'agents.

Exécutez en ligne :https://go.hyper.ai/2c0bx

15. Détection de fraude IEEE-CIS : Analyse exploratoire complète des données (EDA)

Le concours IEEE-CIS de détection de fraude est une compétition Kaggle classique dans le domaine du contrôle des risques financiers, axée sur la détection de la fraude aux transactions en ligne. Cette tâche exige de gérer un grand nombre de variables explicatives, des déséquilibres importants entre les classes et des données de séries temporelles au sein d'ensembles de données massifs dépassant 7 Go, et d'évaluer la capacité de classement du modèle à l'aide de la métrique AUC-ROC. Les méthodes peuvent être appliquées à des scénarios d'entreprise réels tels que la sécurité des paiements et le contrôle des risques, et constituent une étude de cas classique pour l'apprentissage de la classification de données déséquilibrées et l'analyse de données financières.

Exécutez en ligne :https://go.hyper.ai/KDfkP

16. MiniMax Music 3 : Un modèle de génération musicale basé sur les paroles et les descriptions musicales

MiniMax Music 3, lancé par l'équipe MiniMax en août 2026, est un modèle de génération musicale textuelle capable de créer automatiquement des morceaux complets d'une durée maximale de 5 minutes à partir de paroles et de descriptions musicales. Ce modèle utilise une architecture de génération multicomposante, combinant la modélisation structurelle à longue portée Qwen3-8B, le Flow Matching Transformer et le vocodeur Flow-VAE pour obtenir des voix expressives, des arrangements dynamiques et une qualité audio stable sur la durée. Prenant en charge une sortie stéréo 32 kHz, il peut être largement utilisé dans la création de chansons, la génération de musique de fond et la recherche musicale par intelligence artificielle.

Exécutez en ligne :https://go.hyper.ai/U52vp

Page de démonstration

17. Prévision météorologique LSTM : prévision de séries temporelles basée sur l’ensemble de données climatiques de Jena

Ce tutoriel, issu de la communauté DigitalOcean et rédigé par Adil Lheureux, présente la construction d'un modèle de prévision météorologique basé sur les réseaux LSTM (Long Short-Term Memory). À partir de données météorologiques historiques de Jena, en Allemagne, il prédit les variations de température des six prochaines heures en utilisant six variables : température, pression atmosphérique, humidité, pression de vapeur, vitesse du vent et densité de l'air, d'après les données des 72 dernières heures (432 enregistrements). Cette étude de cas constitue une excellente introduction à la prévision de séries temporelles et peut être appliquée à la prévision météorologique à court terme, à l'analyse de données météorologiques et à d'autres contextes.

Exécutez en ligne :https://go.hyper.ai/ONbnQ

18. Tutoriel d'introduction aux réseaux neuronaux à graphes géométriques

Les réseaux de neurones graphiques géométriques (GNN) constituent une voie importante dans le domaine de l'apprentissage profond géométrique. Ils visent à améliorer la capacité des modèles à comprendre les relations spatiales en concevant des structures de réseau qui exploitent la symétrie et l'invariance inhérentes aux données. Ce tutoriel s'appuie sur le projet geometric-gnn-dojo de Chaitanya K. Joshi et al. à l'Université de Cambridge. Il utilise PyTorch Geometric (PyG) pour la vérification de l'invariance et de l'isovariance, et combine des informations géométriques telles que les coordonnées moléculaires 3D et les distances afin de construire un réseau de neurones graphiques performant. Cette méthode peut être appliquée à des domaines tels que la prédiction des propriétés moléculaires, le développement de médicaments, l'analyse de la structure des matériaux et la modélisation de nuages de points 3D.

Exécutez en ligne :https://go.hyper.ai/r9stc

Interprétation des articles communautaires

1. L'efficacité de l'analyse a été améliorée de plus de 200 fois ! Le Laboratoire national d'Argonne propose DONUT, une méthode d'analyse par diffraction de nanofaisceau non supervisée et basée sur l'apprentissage, qui extrait avec précision les caractéristiques des matériaux.

DONUT (Diffraction with Optics for Nanobeam by Unsupervised Training) est un réseau neuronal de détection physique non supervisé, proposé par une équipe du Laboratoire national d'Argonne (Département de l'Énergie des États-Unis), pour l'analyse rapide des données de microscopie de diffraction des rayons X à balayage (SXDM). Cette méthode ne nécessite ni données étiquetées ni modèles pré-entraînés et permet de séparer automatiquement la relation de couplage entre la forme du faisceau et les informations locales du réseau cristallin, surmontant ainsi les limitations des méthodes d'ajustement traditionnelles, telles que leur coût de calcul élevé et leur dépendance au prétraitement. Les expériences montrent que DONUT peut extraire avec précision des caractéristiques structurales à l'échelle nanométrique, avec une efficacité d'analyse plus de 200 fois supérieure aux méthodes traditionnelles, offrant ainsi une nouvelle solution intelligente pour la caractérisation de la structure des matériaux.

Exécutez en ligne :https://go.hyper.ai/I00f5

Articles populaires de l'encyclopédie

1. Reconnaissance optique de caractères (OCR)

2. Modèle d'action mondial WAM

3. Télédétection

4. Glitch Token (terme utilisé pour décrire un terme lié aux bugs)

5. Modèle de transformation pré-entraîné génératif (GPT)

Voici des centaines de termes liés à l'IA compilés pour vous aider à comprendre « l'intelligence artificielle » ici :

https://go.hyper.ai/wiki

Voici tout le contenu de la sélection de l’éditeur de cette semaine. Si vous avez des ressources que vous souhaitez inclure sur le site officiel hyper.ai, vous êtes également invités à laisser un message ou à soumettre un article pour nous le dire !

À la semaine prochaine !