HyperAIHyperAI

Command Palette

Search for a command to run...

Text-/LaTeX-/HTML-Tabellen in Einem Schritt! OvisOCR2 Ermöglicht Intelligentes End-to-End-Dokumentparsing; Über 14.000 Elementannotationen, Zehntausende Von Sprachbefehlen! Voxel51 Veröffentlicht Den SceneFun3D-Datensatz Für Mikrointeraktionen in Innenräumen.

OvisOCR2, im Juli 2026 von ATH-MaaS, Alibaba und weiteren Teams veröffentlicht, ist ein kompaktes End-to-End-Dokumentenanalysemodell mit nur 0,8 Milliarden Parametern (ca. 1,7 GB). Basierend auf Qwen3.5-0.8B kann dieses Modell Dokumentbilder direkt in ein strukturiertes Markdown-Format konvertieren, das die natürliche Lesereihenfolge beibehält, und Text, Formeln, Tabellen und sichtbare Bereiche präzise analysieren.Mit seiner innovativen hybriden Daten-Engine und dem mehrstufigen (SFT, RL und OPD) Trainingsschema erreichte OvisOCR2 im OmniDocBench v1.6 Benchmark einen Wert von 96,58 und ist damit das erste End-to-End-Modell, das herkömmliche Pipeline-Methoden übertrifft.Es schafft ein perfektes Gleichgewicht zwischen extrem niedrigen Bereitstellungskosten und herausragender Leistung.

Auf der HyperAI-Website ist jetzt das „OvisOCR2: 0.8B End-to-End Document Parsing Model“ zu finden – probieren Sie es doch einmal aus!

Online-Nutzung:https://go.hyper.ai/1qOnc

Besuchen Sie unsere offizielle Website für weitere Informationen:

https://hyper.ai

Ein kurzer Überblick über die Aktualisierungen der offiziellen Website von hyper.ai vom 18. Juli bis zum 24. Juli:

* Hochwertige öffentliche Datensätze: 9

* Eine Auswahl hochwertiger Tutorials: 9

* Analyse von Community-Artikeln: 1 Artikel

* Beliebte Enzyklopädieeinträge: 5

Top-Konferenzen mit Anmeldefristen im August: 6

Besuchen Sie die offizielle Website:hyper.ai

Ausgewählte öffentliche Datensätze

1. SceneFun3D 3D Szenenfunktions-Interaktionsdatensatz

SceneFun3D ist ein 2024 von Voxel51 veröffentlichter Datensatz für funktionale Interaktionen in 3D-Szenen. Er konzentriert sich auf das detaillierte Verständnis kleinster interaktiver Elemente und umfasst deren Lokalisierung, Gibson-Funktionsinferenz, Bewegungsparameter-Schätzung und Aufgabenbeschreibung in natürlicher Sprache. Der Datensatz enthält 710 hochauflösende, reale Innenraumszenen mit 14.867 Annotationen funktionaler Interaktionselemente, 9 Funktionskategorien, 14.279 Bewegungsparametern und über 10.913 Aufgabenanweisungen in natürlicher Sprache.

Online-Nutzung:https://go.hyper.ai/g81mC

2. Vāgdhenu Sanskrit Recitation Corpus Dataset

Vāgdhenu ist ein Korpus von Sanskrit-Gesängen einzelner Personen, der primär für das Training der Sanskrit-Sprachsynthese, die Prosodieforschung und Anwendungen zur barrierefreien Sprachgestaltung entwickelt wurde. Der Datensatz umfasst 1467 Segmente mit einer Gesamtlaufzeit von ca. 5,3 Stunden im 24-kHz-Mono-WAV-Format. Er enthält zwei unabhängige Teilmengen, style_a und style_b, die eine Vielzahl verschiedener Verse abdecken.

Online-Nutzung:https://go.hyper.ai/D7Q6H

3. Math-Graph: Datensatz zur Abhängigkeit mathematischer Theoreme

Math-Graph, 2026 vom Labor für Mathematische Künstliche Intelligenz der Universität Washington veröffentlicht, ist ein Datensatz mathematischer Theorem-Abhängigkeitsgraphen, der einen Abhängigkeitsgraphen mathematischer Theoreme auf Aussageebene erstellt. Dieser Datensatz enthält 47.952 zusammengehörige Paare informeller und formaler mathematischer Aussagen und integriert diese beiden Arten mathematischen Wissens in einen kohärenten Abhängigkeitsgraphen. Er umfasst sowohl informelle als auch formale Mathematik und beinhaltet Metadaten von wissenschaftlichen Artikeln, mathematische Aussagen, Abhängigkeitskanten und LLM-generierte natürlichsprachliche Beschreibungen.

Online-Nutzung:https://go.hyper.ai/CtIDb

4. GLM-5.2 Agenteninteraktionstrajektorien-Datensatz

GLM-5.2 Agent ist ein Datensatz mit Rohdaten von Agenteninteraktionsverläufen für GLM-5.2-Modelle, der von TeichAI mithilfe von Teich generiert wurde. Er dient der Bereitstellung standardisierter, auswertbarer Sitzungsaufzeichnungen für das Training und die Entwicklung von Agentenmodellen und unterstützt die anschließende Feinabstimmung sowie erweiterte Werkzeugaufruffunktionen.

Online-Nutzung:https://go.hyper.ai/itLRp

5. EVA-Bench End-to-End-Sprachagenten-Benchmark-Datensatz

EVA-Bench, veröffentlicht von ServiceNow, ist ein umfassender Benchmark-Datensatz zur Evaluierung von Sprachagenten. Er dient der Bewertung der Aufgabenerledigungsfähigkeiten und der interaktiven Benutzererfahrung von Sprachagenten. Der Datensatz umfasst 213 Szenarien aus drei Unternehmensbereichen: Kundenservice-Management in der Luftfahrt, Personalwesen im Gesundheitswesen und IT-Servicemanagement. Er ermöglicht die umfassende Evaluierung von mehrstufiger Sprachinteraktion, Tool-Aufruf, Aufgabenerledigung und der Robustheit von Sprachszenarien.

Online-Nutzung:https://go.hyper.ai/51B4l

6. Metacognition-Bench-Datensatz

Metacognition-Bench, veröffentlicht von ginigen-ai, ist ein Benchmark-Datensatz zur Messung der metakognitiven Fähigkeiten großer Sprachmodelle. Er zielt darauf ab, die funktionale metakognitive Fähigkeit des Modells zu messen, eigene Denkfehler zu erkennen und zu korrigieren, anstatt lediglich die Genauigkeit der endgültigen Antwort zu bewerten. Der Datensatz enthält 300 metakognitive Fallenfragen aus 121 Fachgebieten, darunter Mathematik, Physik, Biologie, Jura, Medizin, Wirtschaftswissenschaften, Statistik, Ethik und Informatik. Er umfasst acht Arten metakognitiver Verhaltensweisen: Selbstkorrektur, Vermeidung von Fallen, Transformationserkennung, Konfliktlösung, inkrementelles Lernen, Umgang mit mehreren Nebenbedingungen, Expertenbefragung und Entscheidungsfindung unter Unsicherheit.

Online-Nutzung:https://go.hyper.ai/8qdca

7. SVG Benchmark: Ein Benchmark-Datensatz für die Generierung von Standbildern.

SVG Benchmark ist ein umfangreicher Datensatz zur Evaluierung der Generierung statischer Bilder durch Sprachmodelle, der 2025 von Rapida veröffentlicht wurde. Ziel ist es, die Fähigkeit von 30 hochmodernen Sprachmodellen zur Generierung statischer SVGs anhand von Texteingaben durch menschliche Bewertung zu vergleichen. Der Datensatz ist in Form von paarweisen Vergleichen aufgebaut und enthält 500 englische Eingabeaufforderungen aus von Menschen erstellten oder öffentlich verfügbaren Datensätzen, 188.754 Bildvergleichsbeispiele und 1.355.161 Präferenzantworten basierend auf menschlichen Bewertungen.

Online-Nutzung:https://go.hyper.ai/13Rn2

8. IFStruct v1.0 Benchmark-Datensatz zur Einhaltung der Vorgaben für strukturierte Ausgaben

IFStruct v1.0 ist ein Benchmark-Datensatz zur Überprüfung der Konformität mit strukturierten Ausgaben, der 2026 von Liquid AI veröffentlicht wurde. Er dient der systematischen Evaluierung der Fähigkeit großer Sprachmodelle, strukturierte Ausgaben gemäß einem vorgegebenen Schema zu generieren. Der Datensatz enthält 2.000 Eingabewörter, für die das Modell jeweils mehrere Instanzen basierend auf einem Zielmuster generieren soll. Die Eingabewörter werden in verschiedenen Stilen präsentiert, darunter natürlicher Dialog, explizite Pfadanweisungen, rohes JSON-Schema, Codeblock-Anforderungen und ohne zusätzlichen Text. Allen Formaten sind strenge Validierungsspezifikationen des zugrunde liegenden Schemas beigefügt.

Online-Nutzung:https://go.hyper.ai/3NUcg

9. EdgeBench Real-World Learning Benchmark Dataset für intelligente Agenten

EdgeBench ist ein von ByteDance Seed im Jahr 2026 veröffentlichter Benchmark-Datensatz für intelligente Agenten, der reale Lernumgebungen untersucht. Ziel ist die Bewertung der Fähigkeit autonomer KI-Agenten, aus realen Umgebungen zu lernen. Der Datensatz umfasst 134 reale Aufgaben, von denen 51 Open Source sind. Sie decken sechs Fähigkeitskategorien ab: wissenschaftliches Rechnen und maschinelles Lernen, System- und Softwareentwicklung, Optimierung, Wissensbasiertes Schließen, formales Schließen und Spieltheorie.

Online-Nutzung:https://go.hyper.ai/FqmX7

Ausgewählte öffentliche Tutorials

1. OvisOCR2: 0,8-Mbit/s-End-Dokumentenanalysemodell

Das im Juli 2026 vom ATH-MaaS-Team veröffentlichte OvisOCR2-Modell ist ein kompaktes, 0,8 Milliarden Byte großes End-to-End-Dokumentenanalysemodell. Es basiert auf dem Post-Training mit Qwen3.5-0.8B und verwendet eine sorgfältig entwickelte Daten-Engine (die reale und synthetische Daten kombiniert) sowie eine mehrstufige Trainingsstrategie, die SFT, RL und OPD integriert.

Online ausführen:https://go.hyper.ai/1qOnc

Demoseite

2. RoBERTa Tweet Sentiment Text Extraction

Das RoBERTa-Modell wurde im Juli 2019 vom Facebook AI-Team veröffentlicht. Zu seinen wichtigsten Innovationen und Funktionen gehören die Einführung einer dynamischen Maskierungsstrategie, das Training mit größeren Batches und die Verwendung von mehr Trainingsdaten zusätzlich zu BERT, was die Leistung in NLP-Benchmarks deutlich verbessert.

Online ausführen:https://go.hyper.ai/8iZIz

3. handson-ml2 Machine Learning in Practice Tutorial

Dies ist eine umfassende Sammlung praktischer Tutorials zum maschinellen Lernen, die von den Grundlagen bis hin zum Deep Learning alles abdeckt. Dieses Tutorial basiert auf Aurélien Gérons Standardwerk „Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow“ (2. Auflage). 

Online ausführen:https://go.hyper.ai/jEyUh

4. Keras Deep Learning Grundlagen-Tutorial – Brustkrebsklassifizierung

Dieses Tutorial basiert auf Paras Jindals einführendem Deep-Learning-Projekt, das im Juli 2026 auf Kaggle veröffentlicht wurde. Es verwendet die Keras Sequential API, um ein neuronales Netzwerkmodell zu erstellen, das eine binäre Klassifizierung von Merkmalsdaten gutartiger und bösartiger Brustkrebszellen durchführt.

Online ausführen:https://go.hyper.ai/s1X9X

Modellübersicht und Vergleich

5. Empfehlungs-Engine (Empfehlungs-Engine für kollektive Einkäufe)

Die Empfehlungs-Engine für gemeinsame Käufe basiert auf Chris Deottes Kaggle-Notebook „Recommend Items Purchased Together“ (veröffentlicht im Februar 2022). Ihre Kerninnovation besteht in der Erstellung einer Matrix für gemeinsame Käufe durch die Analyse historischer Transaktionsdaten. So werden häufig gemeinsam gekaufte Artikel empfohlen, wobei drei Strategien integriert werden: die bisherige Kaufhäufigkeit, das Muster gemeinsamer Käufe und eine Auswahl beliebter Artikel. Dieser Algorithmus erzielte im H&M-Wettbewerb für personalisierte Modeempfehlungen einen MAP@12-Wert von 0,021.

Online ausführen:https://go.hyper.ai/fiegd

6. Titanic Data Science Solutions: Maschinelles Lernen von Grund auf lernen

„Titanic – Machine Learning from Disaster“ ist einer der bekanntesten Einführungswettbewerbe auf der Kaggle-Plattform. Die Aufgabe besteht darin, anhand persönlicher Daten (Kabinenklasse, Geschlecht, Alter, Familiengröße usw.) vorherzusagen, ob Passagiere den Untergang der Titanic überlebt hätten.

Online ausführen:https://go.hyper.ai/gGUJO

Datenanalyse

7. Klassifizierung von Katastrophen-Tweets: Einsatz von BERT für die NLP-Textklassifizierung

Dieses Tutorial, basierend auf xhlulus klassischem Notebook auf Kaggle, zeigt, wie man mit BERT Tweets zum Thema Katastrophen binär klassifiziert. Anhand eines vollständigen NLP-Projekts führt es Sie Schritt für Schritt durch den Aufbau einer BERT-Textklassifizierungspipeline: Daten laden → Tokenisierung → Modellerstellung → Training und Feinabstimmung → Inferenz und Vorhersage. Sie lernen, wie Sie vortrainierte BERT-Modelle für benutzerdefinierte binäre Klassifizierungsaufgaben einsetzen und verstehen die Prinzipien hinter wichtigen Designentscheidungen wie dem [CLS]-Token und der Sigmoid-Ausgabeschicht.

Online ausführen:https://go.hyper.ai/ENFgs

8. Ternary-Bonsai-27B: 7,2 GB Ternäre Quantisierungsinferenz 27B

Ternary Bonsai 27B ist ein inferenzbasiertes, großes Sprachmodell, das im Juli 2026 vom Prism ML-Team entwickelt wurde. Es basiert auf Qwen3.6-27B mit durchgängiger ternärer Quantisierung. Das Modell verwendet einen hybriden Aufmerksamkeitsmechanismus (~75% lineare Aufmerksamkeit / ~25% vollständige Aufmerksamkeit), unterstützt extrem lange Kontexte von bis zu 262.000 Token und benötigt in einem Kontext von 100.000 Token maximal nur ~14,7 GB Speicherplatz. Es bietet eine DSpark-Schicht zur spekulativen Dekodierungsbeschleunigung und erreicht eine verlustfreie Dekodierungsbeschleunigung um den Faktor 1,34.

Online ausführen:https://go.hyper.ai/OfSLw

Demoseite

9. Lyft-Bewegungsvorhersage: Vorhersage der Trajektorie autonomer Fahrzeuge basierend auf ResNeXt50 FPN

Lyft Motion Prediction ist ein Kaggle-Wettbewerb, der 2020 von Lyft veranstaltet wurde. Die Aufgabe besteht darin, die Bewegungstrajektorie eines Akteurs (Fahrzeug, Fußgänger usw.) in den nächsten 5 Sekunden (50 Zeitschritte, 10 Hz) auf der Grundlage von Kontextinformationen in einem autonomen Fahrszenario vorherzusagen.

Online ausführen:https://go.hyper.ai/vJYkN

Demoseite

💡Wir haben außerdem eine Austauschgruppe für Tutorials zur stabilen Diffusion eingerichtet. Willkommen, Freunde, scannen Sie den QR-Code und kommentieren Sie [SD-Tutorial], um der Gruppe beizutreten, verschiedene technische Probleme zu besprechen und Anwendungsergebnisse auszutauschen~

Interpretation von Gemeinschaftsartikeln

1. Auf der Grundlage des Trainings mit über 10.000 Tumorproben schlugen die Harvard Medical School und andere COMPASS vor, ein grundlegendes Pan-Cancer-Modell, das im Durchschnitt 22 bestehende Methoden übertrifft.

Ein Forschungsteam der Harvard Medical School, von Roche Pharmaceuticals und der Zhejiang-Universität hat mit COMPASS ein umfassendes Basismodell für verschiedene Krebsarten entwickelt. Dieses Modell wurde anhand von 10.184 Tumorproben aus 33 Krebsarten trainiert und in 16 klinischen Kohorten mit sieben Krebsarten und sechs Immun-Checkpoint-Inhibitoren evaluiert. Die Ergebnisse zeigen, dass COMPASS im Durchschnitt 22 bestehende Methoden übertrifft und die Vorhersagegenauigkeit über verschiedene Kohorten hinweg um durchschnittlich 8,51 TP3T verbessert.

Den vollständigen Bericht ansehen:https://go.hyper.ai/FyRsC

Beliebte Enzyklopädieartikel

1. Fähigkeiten

2. Weltaktionsmodell (WAM)

3. Skalierungsgesetz

4. Bilder pro Sekunde

5. Automatische Spracherkennung

Hier sind Hunderte von KI-bezogenen Begriffen zusammengestellt, die Ihnen helfen sollen, „künstliche Intelligenz“ zu verstehen:

https://go.hyper.ai/wiki