Command Palette
Search for a command to run...
MiniCPM-RobotManip Mit Seinen 1,5 Milliarden Parametern Ist Offiziell Open Source; NVIDIA Veröffentlicht Das Vollmodale Modell Cosmos3-Edge, Das Text, Bilder, Videos Und Bewegungssequenzen abdeckt.

Im Bereich der verkörperten Intelligenz ist die Befähigung von Robotern zur Wahrnehmung, zum Verständnis und zum Handeln der Schlüssel zur Etablierung intelligenter Agenten in der realen Welt. Die MiniCPM-Roboter-Serie von MiniCPM untersucht zwei Kernaufgaben: Robotermanipulation und Zielverfolgung.MiniCPM-RobotManip ist ein visuell-sprachliches Aktionsmodell mit nur 1,5 Milliarden Parametern. Basierend auf dem visuell-sprachlichen Grundgerüst MiniCPM-V 4.6 und kombiniert mit einem diffusen Aktionskopf, ermöglicht es die durchgängige Abbildung von visueller Beobachtung und Sprachbefehlen auf Roboteraktionen.MiniCPM-RobotTrack konzentriert sich auf die Verfolgung von Objekten und erreicht visuelle Echtzeit-Kantenverfolgung mit nur 0,9 Milliarden Parametern. Dank seiner schlanken Architektur, des Streaming-Kontextspeichers und der effizienten visuellen Komprimierungstechnologie demonstriert die MiniCPM-Robot-Serie das Potenzial für effiziente Inferenz in realen Roboterszenarien mithilfe von Modellen im kleinen Maßstab.
Auf der HyperAI-Website wird jetzt „MiniCPM-Robot: Verkörperte Intelligenzmodelle für die reale Welt“ vorgestellt – schauen Sie doch mal vorbei!
Online-Nutzung:https://go.hyper.ai/0VsYI
Ein kurzer Überblick über die Aktualisierungen der offiziellen Website von hyper.ai vom 25. Juli bis zum 30. Juli:
* Hochwertige öffentliche Datensätze: 9
* Hochwertige Tutorial-Auswahl: 8
* Analyse von Community-Artikeln: 2 Artikel
* Beliebte Enzyklopädieeinträge: 5
Besuchen Sie die offizielle Website:hyper.ai
Ausgewählte öffentliche Datensätze
1.Math-Graph Mathematischer Satz Abhängigkeitsgraph Datensatz
Math-Graph ist ein Datensatz mathematischer Theorem-Abhängigkeitsgraphen, der 2026 vom Labor für Mathematische Künstliche Intelligenz der Universität Washington veröffentlicht wurde. Er erstellt einen solchen Graphen auf der Ebene einzelner Aussagen. Die zugehörige Publikation trägt den Titel „TheoremGraph: Bridging Formal and Informal Mathematics“.
Dieser Datensatz enthält 47.952 Paare informeller und formaler mathematischer Aussagen und integriert die beiden Arten mathematischen Wissens in einen kohärenten Abhängigkeitsgraphen, der sowohl informelle als auch formale Mathematik abdeckt. Er umfasst Metadaten von Publikationen, mathematische Aussagen (formal/informell), Abhängigkeitskanten und LLM-generierte natürlichsprachliche Beschreibungen.
Online ausführen:https://go.hyper.ai/bwVQf
2.Nemotron-SFT-Math-v4 Mathematische Inferenz SFT-Datensatz
Nemotron-SFT-Math-v4 ist ein Datensatz für mathematisches Schließen, der von NVIDIA im Mai 2026 veröffentlicht wurde. Die zugehörige Publikation trägt den Titel „Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision“. Ziel ist es, die Probleme inkonsistenter Qualität, nicht-standardmäßiger Schlussfolgerungspfade, geringer Genauigkeit und begrenzter Szenarien in traditionellen mathematischen Datensätzen zu lösen. Der Datensatz verbessert effektiv das strukturierte Schließen, das Schließen über mehrere Trajektorien hinweg und die Antwortverifizierungsfähigkeiten des Modells. Er wird häufig für die Feinabstimmung umfangreicher Modelle für mathematisches Schließen, die Analyse von Schlussfolgerungspfaden, die Entwicklung von Algorithmen zur Antwortverifizierung, den Aufbau von Systemen für das Schließen über lange Kontexte und die Bewertung der Robustheit des Modellschlusses eingesetzt.
Dieser Datensatz umfasst 545.431 Trainingsbeispiele, darunter 285.516 Beispiele für logisches Denken aus dem COT-Tool und 259.915 Beispiele für logisches Denken aus dem TIR-Tool. Er deckt mathematische Szenarien aus Wettbewerben und universitären Forschungsarbeiten in Algebra, Geometrie, Zahlentheorie, Kombinatorik usw. ab. Die Daten wurden mithilfe einer hybriden manuellen und automatisierten Methode annotiert und enthalten standardisierte Felder wie eindeutige Nummer, Fragetext, mehrstufiger Dialog, Standardantwort, Quelle und Protokoll.
Online ausführen:https://go.hyper.ai/Kv9E4
3.MathNet Multimodaler mathematischer Benchmark-Datensatz für Inferenz
MathNet ist ein umfangreicher, mehrsprachiger und multimodaler Datensatz für mathematisches Schließen, der 2026 von einem Team des MIT in Zusammenarbeit mit der King Abdullah University of Science and Technology und anderen Institutionen veröffentlicht wurde. Die zugehörige Publikation trägt den Titel „MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval“.Ziel ist es, die Fähigkeiten großer Modelle bei mathematischen Denkaufgaben und strukturierten Suchaufgaben auf olympischem Niveau zu bewerten und zu verbessern. Es wird häufig zur Bewertung mathematischer Denkprozesse, in der RAG-Forschung und im multimodalen KI-Training eingesetzt.
Dieser Datensatz (Version v0) enthält 27.817 mathematische Aufgaben auf Expertenniveau sowie deren Standardlösungen. Er umfasst offizielle Aufgaben von Mathematikwettbewerben aus 58 Ländern und Regionen in 17 Sprachen, darunter 5.148 illustrierte Aufgaben mit insgesamt 7.541 geometrischen und grafischen Darstellungen. Der Datensatz deckt Algebra, Geometrie, Zahlentheorie, Kombinatorik, Analysis, Wahrscheinlichkeitsrechnung und Statistik sowie weitere Wissensgebiete der Mathematikolympiaden ab. Er unterstützt drei Benchmark-Aufgaben: das Lösen mathematischer Aufgaben, die mathematische semantische Suche (Identifizierung strukturell äquivalenter und ähnlicher Aufgaben) und die Verbesserung der Suchergebnisse.
Online ausführen:https://go.hyper.ai/AWKaV

4Nemotron-Math-v2 Datensatz für mathematische Inferenz
Nemotron-Math-v2 ist ein Datensatz für mathematisches Schließen, der 2025 von der NVIDIA Corporation veröffentlicht wurde. Die zugehörige Forschung trägt den Titel „Nemotron-Math: Effiziente Langzeitkontext-Destillation mathematischen Schließens aus Multi-Mode-Supervision“. Er wird primär verwendet, um LLMs für strukturiertes mathematisches Schließen zu trainieren, die Unterschiede zwischen werkzeuggestütztem und reinem sprachlichem Schließen zu untersuchen und Langzeitkontext- oder Mehrpfad-Schließsysteme zu entwickeln.
Dieser Datensatz enthält ca. 347.000 hochwertige mathematische Probleme und 7 Millionen modellgenerierte Inferenztrajektorien. Jedes Problem wird in sechs Konfigurationen gelöst: hohe/mittlere/niedrige Inferenztiefe und mit/ohne Python TIR. Die Lösungen werden anschließend mithilfe einer Pipeline validiert, die ein LLM als Arbitrator verwendet.
Online ausführen:https://go.hyper.ai/rYdfW
5. CHIMERA Allgemeiner Inferenz-Synthetikdatensatz
CHIMERA ist ein synthetischer Datensatz für das Training von logischem Denken, der speziell dafür entwickelt wurde. Die zugehörige Publikation trägt den Titel CHIMERA: Kompakte synthetische Daten für generalisierbares LLM-Reasoning.
Dieser Datensatz deckt ein breites Spektrum an MINT-Fächern ab und bietet Trajektorien für langfristiges Denken (Long Chain Thinking, CoT). Er enthält 9.225 Fragen aus acht Fächern (Mathematik, Informatik, Chemie, Physik, Literatur, Geschichte, Biologie und Phonetik). Alle Beispiele wurden mithilfe eines großen Sprachmodells (Large Language Model, LLM) generiert und automatisch ohne manuelle Annotation validiert.
Online ausführen:https://go.hyper.ai/JskxG
6. Open-RL-Inferenzproblem-Datensatz
Open-RL ist ein von Turing im Jahr 2026 veröffentlichter Datensatz für domänenübergreifende Denkaufgaben. Er enthält unabhängige, verifizierbare und explizite MINT-Denkaufgaben aus den Bereichen Physik, Mathematik, Biologie und Chemie. Jede Aufgabe erfordert mehrstufiges Denken, beinhaltet symbolische Operationen und/oder numerische Berechnungen und hat eine objektiv verifizierbare Endlösung.
Dieser Datensatz eignet sich für die Feinabstimmung von Reinforcement Learning, Reward-Modellierung, ergebnisüberwachtem Training und verifizierbarem Inferenz-Benchmarking.Jede Aufgabe erfordert mehrere Denkschritte und beinhaltet symbolische Operationen und numerische Berechnungen, wobei am Ende eine überprüfbare Lösung vorliegt.
Online ausführen:https://go.hyper.ai/WYDck
7. GPT-5.4 Schrittweiser Inferenzdatensatz
Der GPT-5.4 Step-by-Step-Reasoning-Datensatz ist ein hochdichter, synthetischer Reasoning-Datensatz, der für die Modellierung von Long-Chain Reasoning (CoT) und komplexen Problemlösungsaufgaben entwickelt wurde. Der Datensatz basiert auf einem „Master-Architect“-Workflow, der gemini 3 flash zur Generierung anspruchsvoller Hinweise nutzt und diese mit dem GPT-5.4 Reasoning Core kombiniert, um mehrstufige Schlussfolgerungen zu ziehen und Ergebnisse zu generieren.
Dieser Datensatz umfasst ca. 1.500 Beispiele auf Spitzenniveau aus hochkomplexen Bereichen wie Mathematik, Programmierung und Medizin. Der Schwierigkeitsgrad der Aufgaben ist einheitlich auf „Großmeister“- und „Über-Doktorgrad“-Niveau festgelegt. Die Datenbeispiele beinhalten vollständige, mehrstufige Denkprozesse und verifizierte Endlösungen und eignen sich daher für Szenarien mit komplexen logischen Ableitungen und zur Beurteilung außergewöhnlicher Denkfähigkeiten.
Online ausführen:https://go.hyper.ai/CeBEp
8.Sutra 10B Vortrainings- und Trainingsdatensatz
Sutra 10B Pretraining ist ein hochwertiger Trainingsdatensatz für das Vortraining großer Sprachmodelle. Er wurde mit dem Sutra-Framework generiert und erstellt strukturierte Lerninhalte, die das Vortraining von Sprachmodellen optimieren. Als größter Datensatz der Sutra-Reihe demonstriert er, wie dichte, sorgfältig kuratierte Datensätze optimale Vortrainingsergebnisse für kleine Sprachmodelle ermöglichen.
Dieser Datensatz umfasst 10.193.029 Unterrichtseinheiten mit insgesamt über 10 Milliarden Tokens und deckt neun Hauptbereiche ab: interdisziplinär, Technologie, Naturwissenschaften, Sozialkunde, Mathematik, Lebenskompetenzen, Kunst und Kreativität, Sprachkunst sowie Philosophie und Ethik. Die Daten folgen einem etablierten Unterrichtsmodell mit zehn Schwierigkeitsstufen von grundlegend bis fortgeschritten und weisen eine klare Hierarchie und systematische Organisation auf.
Online ausführen:https://go.hyper.ai/skT3q
9. VisCoR-55K Visual Inference Dataset
VisCoR-55K ist ein hochwertiger Datensatz für visuelles Schlussfolgern, der 2026 von der Huazhong University of Science and Technology in Zusammenarbeit mit Alibaba Cloud veröffentlicht wurde. Dieser Datensatz enthält ca. 55.000 Beispiele für visuelles Schlussfolgern, wobei jedes Beispiel einen entsprechenden Schlussprozess anhand kontrastierender Beispiele generiert.Ein hochwertiger Datensatz zum visuellen Denken, der fünf Kategorien abdeckt: allgemeines Denken, logisches Denken, mathematisches Denken, grafische Darstellung und OCR.Ziel ist es, die Forschung an visuellen Sprachmodellen für ein zuverlässiges und robustes visuelles Denken zu fördern.
Online ausführen:https://go.hyper.ai/kIlWk
Ausgewählte öffentliche Tutorials
1. MiniCPM-Roboter: Ein verkörpertes Intelligenzmodell für die reale Welt
MiniCPM-Robot ist eine Familie von Modellen verkörperter Intelligenz aus OpenBMB für die Wahrnehmung, Entscheidungsfindung und Handlung in der realen Welt. Die erste Version umfasst zwei Modelle: MiniCPM-RobotManip, ein allgemeines VLA-Modell für die Robotermanipulation, und MiniCPM-RobotTrack, ein Edge-Modell für die Verfolgung verkörperter Ziele.
Online ausführen:https://go.hyper.ai/0VsYI

2. Diamond-1.0: Autoregressives Sprachwiederherstellungsmodell
Diamond ist ein Sprachwiederherstellungsmodell, das von nineninesix.ai im Juli 2026 entwickelt wurde. Es verwendet eine autoregressive seq2seq-Architektur, um verschlechtertes Audio (Kodierung mit niedriger Bitrate, Hintergrundgeräusche, Clipping, schmalbandig) zu 44,1 kHz-Sprache in nahezu Studioqualität wiederherzustellen.
Online ausführen:https://go.hyper.ai/OHZ6o

3. Nanbeige4.2-3B: Kompaktes intelligentes Agentenmodell
Nanbeige4.2-3B ist ein kompaktes Agentenmodell, das von Nanbeige im Juli 2026 entwickelt wurde und auf Nanbeige4.2-3B-Base basiert. Dieses Modell verwendet eine Looped-Transformer-Architektur, die Transformer-Schichten wiederverwendet, um die Modellkapazität zu erhöhen, ohne die Anzahl der Parameter zu erhöhen. Mit nur 3 Milliarden nicht eingebetteten Parametern (von insgesamt 4 Milliarden) übertrifft es größere Modelle wie Qwen3.5-9B und Gemma4-12B in Agenten-Benchmark-Tests.
Online ausführen:https://go.hyper.ai/KI1QR

4. Fara 1.5-27B: Multimodale Computer mit intelligenten Agenten
Fara1.5-27B ist ein multimodaler Computeragent, der im Mai 2026 von Microsoft Research AI Frontiers veröffentlicht wurde. Seine Kerninnovation ist eine rein visuelle Wahrnehmungsarchitektur: Er beobachtet den Browser mithilfe von Screenshots und führt End-to-End-Aufgaben durch strukturierte Werkzeugaufrufe (Klicken, Tippen, Scrollen, Webseitensuche usw.) aus, ohne auf das DOM zuzugreifen. Dieses Modell basiert auf Qwen3.5-27B und wurde unter Aufsicht feinabgestimmt. Die Trainingsdaten stammen aus dem Multiagentenprozess FaraGen1.5.
Online ausführen:https://go.hyper.ai/9AwuJ

5. NVIDIA Cosmos3-Edge: Vollmodales Inferenzmodell
Cosmos3-Edge ist ein multimodales Weltmodell mit 4 Milliarden Parametern, das vom NVIDIA-Team im Juli 2026 veröffentlicht wurde. Seine Kerninnovation und sein Hauptmerkmal ist die Verwendung einer hybriden Transformer-Architektur (MoT), die autoregressive Transformer und Diffusion Transformer in einem einheitlichen Rahmenwerk integriert, um die Textgenerierung bzw. die multimodale Generierung von Bildern/Videos/Aktionen zu handhaben.
Online ausführen:https://go.hyper.ai/yB4bz

6. Mage-Flow: Ein grundlegendes Modell für die effiziente Generierung und Bearbeitung von Bildern in nativer Auflösung
Mage-Flow ist ein kompaktes 4B-Bildgenerierungs- und Bearbeitungsmodell, das von Microsoft im Juli 2026 veröffentlicht wurde. Durch eine sorgfältig konzipierte gemeinsame Optimierung von Tokenizer, Backbone-System und Bildverarbeitungssystem erreicht es eine mit größeren Modellen (Qwen-Image 20B, FLUX.2 32B) vergleichbare Qualität bei einer Parametergröße von 4B und bietet gleichzeitig eine höhere Inferenzgeschwindigkeit und einen geringeren Speicherbedarf.
Online ausführen:https://go.hyper.ai/3cw36

7. LingBot-World-V2: Bild-zu-Video-Generierung mit unendlichen Welten und vielfältigen Interaktionen
LingBot-World-V2 ist ein Bild-zu-Video-Generierungsmodell, das im Juli 2026 vom Robbyant-Team veröffentlicht wurde. Dank kausalem Vortraining ermöglicht dieses Modell unendlich lange Interaktionen bei gleichbleibender Ausgabequalität. Es unterstützt zudem die Echtzeit-Videogenerierung in 720p mit 60 Bildern pro Sekunde und bietet vielfältige interaktive Funktionen wie Angreifen, Bogenschießen und Zauberwirken. Darüber hinaus führt LingBot-World-V2 als erstes Modell ein intelligentes Agenten-Framework in das Weltmodell ein und ermöglicht so ein intelligenteres Szenenverständnis und eine optimierte Interaktionsgenerierung durch Verhaltensplanungs- und Umgebungssynthese-Agenten.
Online ausführen:https://go.hyper.ai/wecWC

8. MOSS-Transcribe-Diarize: End-to-End-Audiotranskription und Sprechertrennung mit mehreren Sprechern
MOSS-Transcribe-Diarize ist ein durchgängiges Modell zur Audioanalyse mit mehreren Sprechern, das vom MOSI.AI (OpenMOSS)-Team im Juli 2026 veröffentlicht wurde. Mit nur einer Inferenz kann das Modell gleichzeitig die Sprachtranskription und die Sprechertrennung durchführen und strukturierten Text mit Zeitstempeln und anonymen Sprecherbezeichnungen (wie z. B. [S01], [S02]) ausgeben.
Online ausführen:https://go.hyper.ai/TElI9

💡Wir haben außerdem eine Austauschgruppe für Tutorials zur stabilen Diffusion eingerichtet. Willkommen, Freunde, scannen Sie den QR-Code und kommentieren Sie [SD-Tutorial], um der Gruppe beizutreten, verschiedene technische Probleme zu besprechen und Anwendungsergebnisse auszutauschen~

Interpretation von Gemeinschaftsartikeln
1. Das Argonne National Laboratory in den Vereinigten Staaten hat ChemGraph vorgeschlagen, das 13 Benchmark-Tests verwendet, um den Wert von Agentien auf dem Gebiet der Computerchemie zu bewerten.
Das Argonne National Laboratory hat ChemGraph vorgestellt, einen LLM-basierten intelligenten Agenten, der speziell für die Automatisierung von Molekülsimulationsabläufen in der Computerchemie entwickelt wurde. Benchmark-Tests zeigen, dass große Modelle wie GPT-4o komplexe Aufgaben stabil bewältigen. Durch die strategische Aufteilung der Aufgaben können jedoch auch kleinere Modelle (wie GPT-4o-mini) ihre Leistung deutlich verbessern und die Leistung größerer Modelle erreichen oder sogar übertreffen. Diese Forschung bietet einen neuen Ansatz für die kostengünstige Automatisierung von KI in der wissenschaftlichen Forschung.
Den vollständigen Bericht ansehen:https://go.hyper.ai/Cgo56
2. Auf Basis von Inferenz großer Modelle und der Verwendung des MCP-Tools haben KI-Röntgenwissenschaftler der Stanford University die Einkristall-Beugungsausrichtung an einer Synchrotronstrahlungsquelle autonom durchgeführt.
Ein Forschungsteam der Stanford University und des SLAC National Accelerator Laboratory hat ein KI-gestütztes Röntgensystem entwickelt und an einer realen Strahlführung der Stanford Synchrotronstrahlungsquelle eingesetzt. Das Team testete das System zunächst in einer virtuellen Strahlführung, bevor es auf die reale Anlage übertragen wurde. Anhand der Aufgabe, eine Orientierungsmatrix eines Einkristalls zu lösen, prüfte es, ob die KI mehrere experimentelle Schritte selbstständig durchführen und unerwartete Abweichungen in einer realen Umgebung bewältigen kann.
Den vollständigen Bericht ansehen:https://go.hyper.ai/jF9qk
Beliebte Enzyklopädieartikel
1. Mensch-Maschine-Schleife (HITL)
2. Automatische Spracherkennung (ASR)
3. Optische Zeichenerkennung (OCR)
4. Weltaktionsmodell (WAM)
5. Das Thinking-Driven Reinforcement Learning Framework (GTR)
Hier sind Hunderte von KI-bezogenen Begriffen zusammengestellt, die Ihnen helfen sollen, „künstliche Intelligenz“ zu verstehen:
August-Frist für den Gipfel
Das Obige ist der gesamte Inhalt der Auswahl des Herausgebers dieser Woche. Wenn Sie über Ressourcen verfügen, die Sie auf der offiziellen Website von hyper.ai veröffentlichen möchten, können Sie uns auch gerne eine Nachricht hinterlassen oder einen Artikel einreichen!
Bis nächste Woche!








