Command Palette
Search for a command to run...
MiniCPM-RobotManip, Avec Ses 1,5 Milliard De Paramètres, Est Officiellement Disponible En Open Source ; NVIDIA Publie Le Modèle Modal Complet Cosmos3-Edge, Prenant En Charge Le Texte, Les Images, Les Vidéos Et Les Séquences De mouvement.

Dans le domaine de l'intelligence incarnée, permettre aux robots de percevoir, de comprendre et d'agir est essentiel pour propulser les agents intelligents dans le monde réel. La série MiniCPM-Robot de MiniCPM explore deux tâches fondamentales : la manipulation robotique et le suivi de cibles.MiniCPM-RobotManip est un modèle d'action visuel-langage ne comportant que 1,5 milliard de paramètres. Basé sur l'architecture visuelle-langage MiniCPM-V 4.6 et associé à une tête d'action diffuse, il assure une correspondance de bout en bout entre l'observation visuelle, les commandes linguistiques et les actions du robot.MiniCPM-RobotTrack se concentre sur le suivi de cibles, offrant des capacités de suivi visuel en temps réel avec 990 millions de paramètres. Grâce à une architecture légère, une mémoire de contexte en flux continu et une technologie de compression visuelle efficace, la série MiniCPM-Robot démontre son potentiel pour une inférence efficace dans des scénarios robotiques réels, à l'aide de modèles à petite échelle.
Le site web d'HyperAI propose désormais « MiniCPM-Robot : des modèles intelligents incarnés pour le monde réel », alors venez l'essayer !
Utilisation en ligne :https://go.hyper.ai/0VsYI
Aperçu rapide des mises à jour du site web officiel d'hyper.ai du 25 au 30 juillet :
* Jeux de données publics de haute qualité : 9
* Sélection de tutoriels de haute qualité : 8
* Analyse des articles de la communauté : 2 articles
* Entrées d'encyclopédie populaire : 5
Visitez le site officiel :hyper.ai
Ensembles de données publiques sélectionnés
1.Jeu de données de graphes de dépendances : théorème mathématique Math-Graph
Math-Graph est un ensemble de données de graphes de dépendance de théorèmes mathématiques, publié en 2026 par le Laboratoire d'intelligence artificielle mathématique de l'Université de Washington. Il construit un graphe de dépendance de théorèmes mathématiques au niveau de chaque énoncé. L'article associé s'intitule « TheoremGraph : Bridging Formal and Informal Mathematics » (Le lien entre mathématiques formelles et informelles).
Cet ensemble de données contient 47 952 paires d'énoncés mathématiques formels et informels, intégrant les deux types de connaissances mathématiques dans un graphe de dépendances cohérent qui couvre à la fois les mathématiques formelles et informelles. Il comprend les métadonnées des articles, les énoncés mathématiques (formels/informels), les arêtes de dépendance et les descriptions en langage naturel générées par LLM.
Exécutez en ligne :https://go.hyper.ai/bwVQf
2.Nemotron-SFT-Math-v4 Jeu de données SFT pour l'inférence mathématique
Nemotron-SFT-Math-v4 est un jeu de données de raisonnement mathématique publié par NVIDIA en mai 2026. L'article associé, intitulé « Nemotron-Math : Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision », vise à résoudre les problèmes de qualité inégale, de trajectoires de raisonnement non standardisées, de faible précision et de scénarios limités rencontrés dans les jeux de données mathématiques traditionnels. Il améliore efficacement le raisonnement structuré, le raisonnement multi-trajectoires et les capacités de vérification des réponses du modèle. Il est largement utilisé pour l'optimisation de modèles de raisonnement mathématique à grande échelle, l'analyse des trajectoires de raisonnement, le développement d'algorithmes de vérification des réponses, la construction de systèmes de raisonnement à contexte long et l'évaluation de la robustesse du raisonnement des modèles.
Cet ensemble de données contient 545 431 exemples d'entraînement, dont 285 516 exemples de raisonnement COT et 259 915 exemples de raisonnement TIR. Il couvre des scénarios mathématiques issus de compétitions et de recherches universitaires en algèbre, géométrie, théorie des nombres, combinatoire, etc. Les données sont annotées à l'aide d'une méthode hybride manuelle et automatisée et comprennent des champs standardisés tels qu'un numéro unique, le texte de la question, le dialogue à plusieurs tours, la réponse standard, la source et le protocole.
Exécutez en ligne :https://go.hyper.ai/Kv9E4
3.Ensemble de données de référence multimodal MathNet pour l'inférence mathématique
MathNet est un ensemble de données de raisonnement mathématique multilingue et multimodal à grande échelle, publié en 2026 par une équipe du MIT en collaboration avec l'Université des sciences et technologies du roi Abdallah et d'autres institutions. L'article associé s'intitule « MathNet : un banc d'essai multimodal mondial pour le raisonnement et la recherche mathématiques ».Il vise à évaluer et à améliorer les capacités des grands modèles dans les tâches de raisonnement mathématique et de recherche structurée de niveau olympique, et est largement utilisé dans l'évaluation du raisonnement mathématique, la recherche RAG et la formation en IA multimodale.
Ce jeu de données, version v0, contient 27 817 problèmes mathématiques de niveau expert et leurs solutions standard. Il couvre les problèmes officiels de concours de mathématiques de 58 pays et régions, en 17 langues, dont 5 148 problèmes illustrés avec un total de 7 541 illustrations géométriques et graphiques. Le jeu de données couvre l'algèbre, la géométrie, la théorie des nombres, la combinatoire, le calcul différentiel et intégral, les probabilités et les statistiques, ainsi que d'autres systèmes de connaissances mathématiques des Olympiades. Il prend en charge trois tâches de référence : la résolution de problèmes mathématiques, la recherche sémantique mathématique (identification de problèmes structurellement équivalents et similaires) et la résolution de problèmes d'amélioration de la recherche.
Exécutez en ligne :https://go.hyper.ai/AWKaV

4Ensemble de données d'inférence mathématique Nemotron-Math-v2
Nemotron-Math-v2 est un ensemble de données de raisonnement mathématique publié par NVIDIA Corporation en 2025. Les recherches associées s'intitulent « Nemotron-Math : Distillation efficace du raisonnement mathématique à long contexte à partir d'une supervision multimodale ». Il est principalement utilisé pour entraîner des modèles de langage à effectuer un raisonnement mathématique structuré, pour étudier les différences entre le raisonnement assisté par des outils et le raisonnement en langage naturel, et pour construire des systèmes de raisonnement à long contexte ou à chemins multiples.
Cet ensemble de données contient environ 347 000 problèmes mathématiques de haute qualité et 7 millions de trajectoires d'inférence générées par des modèles. Chaque problème est résolu selon six configurations : profondeur d'inférence élevée, moyenne et faible, avec ou sans Python TIR. Les réponses sont validées par un pipeline utilisant un LLM comme arbitre.
Exécutez en ligne :https://go.hyper.ai/rYdfW
5. Jeu de données synthétiques d'inférence générale CHIMERA
CHIMERA est un ensemble de données de raisonnement synthétique conçu spécifiquement pour l'entraînement au raisonnement. L'article associé s'intitule CHIMERA : Données synthétiques compactes pour le raisonnement LLM généralisable.
Cet ensemble de données couvre un large éventail de disciplines STEM et propose des parcours de raisonnement logique (Long Chain Thinking - CoT). Il comprend 9 225 questions réparties dans 8 disciplines (mathématiques, informatique, chimie, physique, littérature, histoire, biologie et phonétique). Tous les exemples sont générés par un modèle de langage à grande échelle (LLM) et validés automatiquement, sans annotation manuelle.
Exécutez en ligne :https://go.hyper.ai/JskxG
6. Ensemble de données pour le problème d'inférence Open-RL
OpenRL est un ensemble de données de problèmes de raisonnement multidomaines publié par Turing en 2026. Il contient des problèmes de raisonnement STEM indépendants, vérifiables et explicites en physique, mathématiques, biologie et chimie. Chaque problème requiert un raisonnement en plusieurs étapes, implique des opérations symboliques et/ou des calculs numériques, et possède une réponse finale objectivement vérifiable.
Cet ensemble de données convient au réglage fin de l'apprentissage par renforcement, à la modélisation des récompenses, à l'entraînement supervisé par les résultats et à l'évaluation comparative de l'inférence vérifiable.Chaque problème nécessite plusieurs étapes de raisonnement et implique des opérations symboliques et des calculs numériques, avec une réponse finale vérifiable.
Exécutez en ligne :https://go.hyper.ai/WYDck
7. Ensemble de données d'inférence par étapes GPT-5.4
Le jeu de données de raisonnement pas à pas GPT-5.4 est un jeu de données synthétique haute densité conçu pour la modélisation du raisonnement à longue chaîne (CoT) et les tâches complexes de résolution de problèmes. Ce jeu de données repose sur un flux de travail « Maître-Architecte », utilisant Gemini 3 Flash pour générer des indices complexes, puis combinant ces indices avec le noyau de raisonnement GPT-5.4 pour réaliser le raisonnement multi-étapes et générer les résultats.
Cet ensemble de données contient environ 1 500 exemples de haut niveau, couvrant des domaines très complexes tels que les mathématiques, la programmation et la médecine. La difficulté des tâches est uniformément répartie entre les niveaux « Grand Maître » et « Doctorat ». Les exemples incluent des processus de raisonnement complets en plusieurs étapes et des solutions finales vérifiées, ce qui les rend adaptés aux scénarios impliquant des dérivations logiques complexes et l’évaluation de capacités de raisonnement exceptionnelles.
Exécutez en ligne :https://go.hyper.ai/CeBEp
8.Ensemble de données d'enseignement et d'entraînement préalables Sutra 10B
Sutra 10B Pretraining est un jeu de données pédagogique de haute qualité destiné au préentraînement de grands modèles de langage. Généré par le framework Sutra, il crée du contenu éducatif structuré et optimise le préentraînement des modèles de langage. Il s'agit du plus grand jeu de données de la série Sutra, conçu pour démontrer comment des jeux de données denses et bien organisés peuvent offrir des performances de préentraînement optimales pour les petits modèles de langage.
Cet ensemble de données contient 10 193 029 enregistrements d'enseignement, soit plus de 10 milliards d'éléments, couvrant neuf grands domaines : interdisciplinarité, technologie, sciences, sciences sociales, mathématiques, compétences de vie, arts et créativité, lettres et littératures, et philosophie et éthique. Les données suivent un modèle pédagogique éprouvé, avec 10 niveaux de difficulté, du niveau débutant au niveau avancé, témoignant d'une hiérarchie claire et d'une organisation systématique.
Exécutez en ligne :https://go.hyper.ai/skT3q
9. Ensemble de données d'inférence visuelle VisCoR-55K
VisCoR-55K est un jeu de données de raisonnement visuel de haute qualité, publié en 2026 par l'Université des sciences et technologies de Huazhong en collaboration avec Alibaba Cloud. Ce jeu de données contient environ 55 000 exemples de raisonnement visuel, chacun générant un processus de raisonnement correspondant à partir d'exemples contrastés.Un ensemble de données de raisonnement visuel de haute qualité couvrant cinq catégories : général, raisonnement, mathématique, graphique et OCR.L'objectif est de promouvoir la recherche sur les modèles de langage visuel pour un raisonnement visuel fiable et robuste.
Exécutez en ligne :https://go.hyper.ai/kIlWk
Tutoriels publics sélectionnés
1. MiniCPM-Robot : un modèle d’intelligence incarnée pour le monde réel
MiniCPM-Robot est une famille de modèles d'intelligence incarnée d'OpenBMB pour la perception, la prise de décision et l'action dans le monde réel. La version initiale comprend deux modèles : MiniCPM-RobotManip, un modèle VLA général pour la manipulation robotique, et MiniCPM-RobotTrack, un modèle de contour pour le suivi de cibles incarné.
Exécutez en ligne :https://go.hyper.ai/0VsYI

2. Diamond-1.0 : Modèle autorégressif de restauration de la parole
Diamond est un modèle de restauration de la parole développé par nineninesix.ai en juillet 2026. Il utilise une architecture seq2seq autorégressive pour restaurer un son dégradé (encodage à faible débit binaire, bruit de fond, écrêtage, bande étroite) à une qualité vocale proche de celle d'un studio à 44,1 kHz.
Exécutez en ligne :https://go.hyper.ai/OHZ6o

3. Nanbeige4.2-3B : Modèle d’agent intelligent compact
Nanbeige4.2-3B est un modèle d'agent compact développé par Nanbeige en juillet 2026, basé sur Nanbeige4.2-3B-Base. Ce modèle utilise une architecture de transformateur en boucle, réutilisant les couches de transformateur pour augmenter sa capacité sans augmenter le nombre de paramètres. Avec seulement 3 milliards de paramètres non intégrés (sur un total de 4 milliards), il surpasse des modèles plus volumineux tels que Qwen3.5-9B et Gemma4-12B lors de tests de performance d'agents.
Exécutez en ligne :https://go.hyper.ai/KI1QR

4. Fara 1.5-27B : Ordinateurs multimodaux utilisant des agents intelligents
Fara1.5-27B est un agent informatique multimodal publié par Microsoft Research AI Frontiers en mai 2026. Son innovation majeure réside dans une architecture de perception basée uniquement sur la vision : il observe le navigateur par le biais de captures d’écran et réalise des tâches de bout en bout grâce à des appels d’outils structurés (clic, saisie, défilement, recherche sur le Web, etc.) sans accéder au DOM. Ce modèle est basé sur Qwen3.5-27B et affiné sous supervision, avec des données d’entraînement générées par le processus multi-agents FaraGen1.5.
Exécutez en ligne :https://go.hyper.ai/9AwuJ

5. NVIDIA Cosmos3-Edge : Modèle d'inférence entièrement modale
Cosmos3-Edge est un modèle de base de monde multimodal à 4 milliards de paramètres publié par l'équipe NVIDIA en juillet 2026. Son innovation et sa caractéristique principales sont l'adoption d'une architecture Transformer hybride (MoT), qui intègre un Transformer autorégressif et un Transformer de diffusion dans un cadre unifié pour gérer respectivement la génération de texte et la génération multimodale telle que des images/vidéos/actions.
Exécutez en ligne :https://go.hyper.ai/yB4bz

6. Mage-Flow : un modèle fondamental pour la génération et l’édition efficaces d’images en résolution native
Mage-Flow est un modèle de base compact de génération et d'édition d'images 4B publié par Microsoft en juillet 2026. Grâce à une co-optimisation soigneusement conçue du tokenizer, de l'architecture et du système, il atteint une qualité comparable à celle de modèles plus grands (Qwen-Image 20B, FLUX.2 32B) à une échelle de paramètres de 4B, tout en maintenant une vitesse d'inférence plus rapide et une empreinte mémoire plus faible.
Exécutez en ligne :https://go.hyper.ai/3cw36

7. LingBot-World-V2 : Génération d’images en vidéos avec des mondes infinis et des interactions diverses
LingBot-World-V2 est un modèle de génération d'images en vidéos, développé par l'équipe Robbyant et sorti en juillet 2026. Ce modèle permet des interactions d'une durée infinie grâce à un pré-entraînement causal, tout en conservant une qualité de sortie stable. Il prend également en charge la génération vidéo en temps réel à 60 images par seconde en 720p et offre diverses fonctionnalités interactives telles que l'attaque, le tir à l'arc et le lancement de sorts. De plus, LingBot-World-V2 est le premier à intégrer un système d'agents intelligents dans le modèle du monde, permettant une compréhension plus fine des scènes et une génération d'interactions plus performante grâce à des agents de planification comportementale et de synthèse environnementale.
Exécutez en ligne :https://go.hyper.ai/wecWC

8. MOSS-Transcribe-Diarize : Transcription audio multilocuteur de bout en bout et séparation des locuteurs
MOSS-Transcribe-Diarize est un modèle de compréhension audio multilocuteur de bout en bout publié par l'équipe MOSI.AI (OpenMOSS) en juillet 2026. Avec une seule inférence, le modèle peut simultanément effectuer la transcription de la parole et la séparation des locuteurs, produisant un texte structuré avec des horodatages et des étiquettes de locuteur anonymes (telles que [S01], [S02]).
Exécutez en ligne :https://go.hyper.ai/TElI9

💡Nous avons également créé un groupe d'échange de tutoriels Stable Diffusion. Bienvenue aux amis pour scanner le code QR et commenter [tutoriel SD] pour rejoindre le groupe pour discuter de divers problèmes techniques et partager les résultats de l'application ~

Interprétation des articles communautaires
1. Le laboratoire national d'Argonne aux États-Unis a proposé ChemGraph, qui utilise 13 tests de référence pour évaluer la valeur des agents dans le domaine de la chimie computationnelle.
Le Laboratoire national d'Argonne a lancé ChemGraph, un agent intelligent basé sur la technologie LLM et conçu spécifiquement pour automatiser les flux de travail de simulation moléculaire en chimie computationnelle. Des tests de performance montrent que les grands modèles, tels que GPT-4o, offrent des performances stables pour les tâches complexes ; cependant, en décomposant stratégiquement ces tâches, des modèles plus petits (comme GPT-4o-mini) peuvent également améliorer significativement les performances, atteignant voire surpassant celles des modèles plus grands. Cette recherche propose une nouvelle approche pour l'automatisation à faible coût de l'IA dans la recherche scientifique.
Voir le rapport complet :https://go.hyper.ai/Cgo56
2. En s'appuyant sur l'inférence de modèles à grande échelle et l'utilisation de l'outil MCP, des scientifiques spécialisés en IA et en rayons X de l'université de Stanford ont réalisé de manière autonome l'alignement de la diffraction d'un monocristal à une source de rayonnement synchrotron.
Une équipe de recherche de l'Université de Stanford et du Laboratoire national de l'accélérateur SLAC a développé un système d'intelligence artificielle pour la diffraction des rayons X et l'a déployé sur une ligne de faisceau réelle de la source de rayonnement synchrotron de Stanford. L'équipe a d'abord testé le système sur une ligne de faisceau virtuelle avant de l'installer sur l'équipement réel. Pour ce faire, elle a utilisé la résolution d'une matrice d'orientation monocristalline afin de vérifier si l'IA pouvait mener à bien de manière autonome plusieurs étapes expérimentales et gérer les écarts imprévus en environnement réel.
Voir le rapport complet :https://go.hyper.ai/jF9qk
Articles populaires de l'encyclopédie
1. Boucle homme-machine (HITL)
2. Reconnaissance vocale automatique (ASR)
3. Reconnaissance optique de caractères (OCR)
4. Modèle d'action mondial WAM
5. Le cadre d'apprentissage par renforcement axé sur la pensée (GTR)
Voici des centaines de termes liés à l'IA compilés pour vous aider à comprendre « l'intelligence artificielle » ici :
Date limite d'août pour le sommet
Voici tout le contenu de la sélection de l’éditeur de cette semaine. Si vous avez des ressources que vous souhaitez inclure sur le site officiel hyper.ai, vous êtes également invités à laisser un message ou à soumettre un article pour nous le dire !
À la semaine prochaine !








