HyperAIHyperAI

Command Palette

Search for a command to run...

Tableaux texte/LaTeX/HTML En Une Seule Étape ! OvisOCR2 Assure Une Analyse Intelligente De Bout En Bout Des Documents ; Plus De 14 000 Annotations D’éléments Et Des Dizaines De Milliers De Commandes Linguistiques ! Voxel51 Publie Le Jeu De Données SceneFun3D D’interactions micro-dynamiques Pour Les Scènes d’intérieur.

OvisOCR2, lancé en juillet 2026 par ATH-MaaS, Alibaba et d'autres équipes, est un modèle compact d'analyse syntaxique de documents de bout en bout, ne comportant que 0,8 milliard de paramètres (environ 1,7 Go). Basé sur Qwen3.5-0.8B, ce modèle convertit directement les images de documents en un format Markdown structuré qui préserve l'ordre de lecture naturel et analyse avec précision le texte, les formules, les tableaux et les zones visibles.Avec son moteur de données hybride innovant et son schéma d'entraînement multi-étapes (SFT, RL et OPD), OvisOCR2 a obtenu un score de 96,58 dans le benchmark OmniDocBench v1.6, devenant ainsi le premier modèle de bout en bout à surpasser les méthodes pipelinées traditionnelles.Elle atteint un équilibre parfait entre des coûts de déploiement extrêmement bas et des performances exceptionnelles.

Le site web d'HyperAI présente désormais le « OvisOCR2 : Modèle d'analyse de documents de bout en bout de 0,8 milliard », alors essayez-le !

Utilisation en ligne :https://go.hyper.ai/1qOnc

Bienvenue sur notre site web officiel pour plus d'informations :

https://hyper.ai

Aperçu rapide des mises à jour du site web officiel d'hyper.ai du 18 au 24 juillet :

* Jeux de données publics de haute qualité : 9

* Une sélection de tutoriels de haute qualité : 9

* Analyse d'un article de la communauté : 1 article

* Entrées d'encyclopédie populaire : 5

Principales conférences avec des dates limites en août : 6

Visitez le site officiel :hyper.ai

Ensembles de données publiques sélectionnés

1. Ensemble de données SceneFun3D sur l'interaction des fonctions de scène 3D

SceneFun3D est un jeu de données d'interaction fonctionnelle de scènes 3D publié par Voxel51 en 2024. Il vise à une compréhension fine des petits éléments interactifs, notamment leur localisation, l'inférence de fonctions gibsoniennes, l'estimation des paramètres de mouvement et la description de tâches en langage naturel. Ce jeu de données comprend 710 scènes d'intérieur réelles en haute résolution, contenant 14 867 annotations d'éléments d'interaction fonctionnelle, 9 catégories de fonctions, 14 279 paramètres de mouvement et plus de 10 913 instructions de tâches en langage naturel.

Utilisation en ligne :https://go.hyper.ai/g81mC

2. Corpus de récitation sanskrite de Vāgdhenu

Vāgdhenu est un corpus d'enregistrements de chants sanskrits interprétés par une seule personne, principalement destiné à l'entraînement à la synthèse vocale sanskrite, à la recherche en prosodie et aux applications d'accessibilité linguistique. L'ensemble de données contient 1 467 segments, pour une durée audio totale d'environ 5,3 heures, au format WAV mono 24 kHz. Il comprend deux sous-ensembles indépendants, style_a et style_b, couvrant un grand nombre de versets différents.

Utilisation en ligne :https://go.hyper.ai/D7Q6H

3. Jeu de données de graphe de dépendance mathématique Math-Graph

Math-Graph, publié en 2026 par le Laboratoire d'intelligence artificielle mathématique de l'Université de Washington, est un ensemble de données de graphes de dépendance de théorèmes mathématiques. Il construit un graphe de dépendance au niveau des énoncés de théorèmes mathématiques. Cet ensemble contient 47 952 paires d'énoncés mathématiques formels et informels, intégrant ces deux types de connaissances mathématiques dans un graphe de dépendance cohérent. Il couvre les mathématiques formelles et informelles, incluant les métadonnées des articles, les énoncés mathématiques, les arêtes de dépendance et les descriptions en langage naturel générées par LLM.

Utilisation en ligne :https://go.hyper.ai/CtIDb

4. Ensemble de données sur les trajectoires d'interaction des agents GLM-5.2

GLM-5.2 Agent est un ensemble de données de trajectoires d'interaction d'agents brutes pour les modèles GLM-5.2, généré par TeichAI à l'aide de Teich. Il vise à fournir des enregistrements de session standardisés et analysables pour l'entraînement et la conception de modèles d'agents, facilitant ainsi leur ajustement ultérieur et améliorant les capacités d'invocation d'outils.

Utilisation en ligne :https://go.hyper.ai/itLRp

5. Ensemble de données de référence EVA-Bench pour agents vocaux de bout en bout

EVA-Bench, développé par ServiceNow, est un jeu de données de référence pour l'évaluation complète des agents vocaux. Il permet d'évaluer leurs capacités d'exécution des tâches et l'expérience interactive qu'ils offrent. Ce jeu de données comprend 213 scénarios couvrant trois domaines d'activité : la gestion du service client dans le secteur aérien, les services de ressources humaines dans le secteur de la santé et la gestion des services informatiques d'entreprise. Il permet une évaluation exhaustive des interactions vocales à plusieurs tours de parole, de l'invocation d'outils, de l'exécution des tâches et de la robustesse des scénarios vocaux.

Utilisation en ligne :https://go.hyper.ai/51B4l

6. Ensemble de données Metacognition-Bench

Metacognition-Bench, développé par ginigen-ai, est un jeu de données de référence pour évaluer les capacités métacognitives des grands modèles de langage. Son objectif est de mesurer la capacité métacognitive fonctionnelle du modèle à détecter et à corriger ses propres erreurs de raisonnement, plutôt que de simplement évaluer la précision de la réponse finale. Ce jeu de données contient 300 questions pièges métacognitives couvrant 121 domaines, dont les mathématiques, la physique, la biologie, le droit, la médecine, l'économie, les statistiques, l'éthique et l'informatique. Il englobe huit types de comportements métacognitifs : autocorrection, échappement aux pièges, détection de transformations, résolution de conflits, découverte incrémentale, gestion de contraintes multiples, panel d'experts et prise de décision en situation d'incertitude.

Utilisation en ligne :https://go.hyper.ai/8qdca

7. SVG Benchmark : un ensemble de données de référence pour la génération d’images fixes.

SVG Benchmark est un jeu de données d'évaluation à grande échelle pour la génération d'images statiques, publié par Rapida en 2025. Il vise à comparer la capacité de 30 modèles de langage de pointe à générer des SVG statiques à partir de consignes textuelles, grâce à une évaluation humaine. Le jeu de données est constitué selon un format de comparaison par paires et comprend 500 consignes en anglais issues de jeux de données rédigés par des humains ou accessibles au public, 188 754 exemples d'images à comparer et 1 355 161 réponses de préférence recueillies par vote humain.

Utilisation en ligne :https://go.hyper.ai/13Rn2

8. Jeu de données de référence pour la conformité des sorties structurées IFStruct v1.0

IFStruct v1.0 est un jeu de données de référence pour la conformité des sorties structurées, publié par Liquid AI en 2026. Il vise à évaluer systématiquement la capacité des grands modèles de langage à générer des sorties structurées conformes à un schéma spécifié. Ce jeu de données contient 2 000 mots d'invite, chacun exigeant du modèle la génération de plusieurs instances à partir d'un modèle cible. Les mots d'invite sont présentés sous différentes formes : dialogue naturel, instructions de chemin explicites, schéma JSON brut, exigences relatives aux blocs de code et absence de texte supplémentaire, le tout accompagné de spécifications de validation de schéma sous-jacentes strictes.

Utilisation en ligne :https://go.hyper.ai/3NUcg

9. Jeu de données de référence EdgeBench pour l'apprentissage en conditions réelles des agents intelligents

EdgeBench est un jeu de données de référence pour l'apprentissage en conditions réelles destiné aux agents intelligents. Publié par ByteDance Seed en 2026, il vise à évaluer la capacité des agents d'IA autonomes à apprendre à partir d'environnements réels. Ce jeu de données comprend 134 tâches réelles, dont 51 sont open source, et couvre six catégories de compétences : calcul scientifique et apprentissage automatique, ingénierie des systèmes et des logiciels, optimisation, raisonnement sur les connaissances, raisonnement formel et théorie des jeux.

Utilisation en ligne :https://go.hyper.ai/FqmX7

Tutoriels publics sélectionnés

1. OvisOCR2 : Modèle d’analyse syntaxique de documents de bout en bout de 0,8 milliard de caractères

Publié par l'équipe ATH-MaaS en juillet 2026, le modèle OvisOCR2 est un modèle compact de 0,8 milliard de documents permettant le traitement de bout en bout. Ce modèle est construit par post-entraînement sur Qwen3.5-0.8B, utilisant un moteur de données soigneusement conçu (combinant données réelles et synthétiques) et une stratégie d'entraînement multi-étapes intégrant SFT, RL et OPD.

Exécutez en ligne :https://go.hyper.ai/1qOnc

Page de démonstration

2. Extraction de texte et analyse des sentiments des tweets de RoBERTa

Le modèle RoBERTa a été publié par l'équipe d'IA de Facebook en juillet 2019. Ses principales innovations et fonctionnalités comprennent l'introduction d'une stratégie de masquage dynamique, un entraînement par lots plus importants et davantage de données d'entraînement en plus de BERT, ce qui améliore considérablement les performances de référence en NLP.

Exécutez en ligne :https://go.hyper.ai/8iZIz

3. Tutoriel pratique sur l'apprentissage automatique (handson-ml2)

Voici un recueil complet de tutoriels pratiques sur l'apprentissage automatique, couvrant tous les aspects, des bases à l'apprentissage profond. Ce tutoriel est basé sur l'ouvrage de référence d'Aurélien Géron, « Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow » (2e édition). 

Exécutez en ligne :https://go.hyper.ai/jEyUh

4. Tutoriel sur les fondamentaux de l'apprentissage profond avec Keras — Classification du cancer du sein

Ce tutoriel est tiré du projet d'introduction à l'apprentissage profond de Paras Jindal, publié sur Kaggle en juillet 2026. Il utilise l'API Keras Sequential pour construire un modèle de réseau neuronal afin d'effectuer une classification binaire des données de caractéristiques des cellules cancéreuses du sein bénignes et malignes.

Exécutez en ligne :https://go.hyper.ai/s1X9X

Résumé et comparaison des modèles

5. Moteur de recommandation (Moteur de recommandation d'achats groupés)

Le moteur de recommandation d'achats associés est un système de recommandation basé sur le notebook Kaggle de Chris Deotte, « Recommend Items Purchased Together », publié en février 2022. Son innovation principale réside dans la construction d'une matrice d'achats associés à partir de l'analyse des données de transactions historiques, afin de recommander des articles fréquemment achetés ensemble. Ce système intègre trois stratégies : la fréquence d'achat historique, les habitudes d'achats associés et une sélection d'articles populaires. Cet algorithme a obtenu un score MAP@12 de 0,021 lors du concours de recommandations de mode personnalisées de H&M.

Exécutez en ligne :https://go.hyper.ai/fiegd

6. Solutions de science des données Titanic : Apprendre le Machine Learning à partir de zéro

Titanic – Machine Learning from Disaster est l'une des compétitions d'initiation les plus classiques sur la plateforme Kaggle. Le but est de prédire si les passagers auraient survécu au naufrage du Titanic à partir de leurs informations personnelles (classe de cabine, sexe, âge, composition familiale, etc.).

Exécutez en ligne :https://go.hyper.ai/gGUJO

Analyse des données

7. Classification des tweets relatifs aux catastrophes : Utilisation de BERT pour la classification de texte en traitement automatique du langage naturel

Ce tutoriel, basé sur le Notebook classique de xhlulu sur Kaggle, montre comment effectuer une classification binaire de tweets relatifs aux catastrophes à l'aide de BERT. À travers un projet complet de traitement automatique du langage naturel (TALN), ce tutoriel vous guide dans la construction d'un pipeline de classification de texte BERT : chargement des données → tokenisation et encodage → construction du modèle → entraînement et ajustement → inférence et prédiction. Vous apprendrez à appliquer un modèle BERT pré-entraîné à des tâches de classification binaire personnalisées et comprendrez les principes sous-jacents aux choix de conception clés, tels que le token [CLS] et la couche de sortie sigmoïde.

Exécutez en ligne :https://go.hyper.ai/ENFgs

8. Ternary-Bonsai-27B : 7,2 Go Quantification ternaire Inférence 27B

Ternary Bonsai 27B est un modèle de langage de grande taille, basé sur l'inférence et développé par l'équipe Prism ML en juillet 2026. Il repose sur Qwen3.6-27B avec une quantification ternaire de bout en bout. Ce modèle utilise un mécanisme d'attention hybride (attention linéaire d'environ 75% / attention complète d'environ 25%), prend en charge des contextes ultra-longs jusqu'à 262 000 jetons et ne nécessite qu'environ 14,7 Go de mémoire maximale pour un contexte de 100 000 jetons. Il intègre une couche d'accélération de décodage spéculatif DSpark, permettant un gain de vitesse de décodage sans perte de 1,34x.

Exécutez en ligne :https://go.hyper.ai/OfSLw

Page de démonstration

9. Prédiction de mouvement Lyft : prédiction de la trajectoire des véhicules autonomes basée sur ResNeXt50 FPN

Lyft Motion Prediction est une compétition Kaggle organisée par Lyft en 2020. La tâche consiste à prédire la trajectoire de mouvement d'un agent (véhicule, piéton, etc.) dans les 5 prochaines secondes (50 pas de temps, 10 Hz) sur la base d'informations contextuelles dans un scénario de conduite autonome.

Exécutez en ligne :https://go.hyper.ai/vJYkN

Page de démonstration

💡Nous avons également créé un groupe d'échange de tutoriels Stable Diffusion. Bienvenue aux amis pour scanner le code QR et commenter [tutoriel SD] pour rejoindre le groupe pour discuter de divers problèmes techniques et partager les résultats de l'application ~

Interprétation des articles communautaires

1. S’appuyant sur un entraînement réalisé avec plus de 10 000 échantillons de tumeurs, la Harvard Medical School et d’autres ont proposé COMPASS, un modèle de base pancancéreux, qui surpasse en moyenne 22 méthodes existantes.

Une équipe de recherche de la Harvard Medical School, de Roche Pharmaceuticals et de l'Université du Zhejiang a proposé COMPASS, un modèle de référence pancancéreux. Ce modèle a été entraîné sur 10 184 échantillons tumoraux provenant de 33 types de cancer et évalué dans 16 cohortes cliniques couvrant 7 types de cancer et 6 inhibiteurs de points de contrôle immunitaire. Les résultats montrent que COMPASS surpasse en moyenne 22 méthodes existantes, améliorant la précision des prédictions de 8,51 points TP3T en moyenne sur l'ensemble des cohortes.

Voir le rapport complet :https://go.hyper.ai/FyRsC

Articles populaires de l'encyclopédie

1. Compétences

2. Modèle d'action mondial WAM

3. Loi d'échelle

4. Images par seconde

5. Reconnaissance vocale automatique

Voici des centaines de termes liés à l'IA compilés pour vous aider à comprendre « l'intelligence artificielle » ici :

https://go.hyper.ai/wiki