HyperAIHyperAI

Command Palette

Search for a command to run...

15 亿参数挑战机器人控制,MiniCPM-RobotManip 正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型 Cosmos3-Edge

Featured Image

在具身智能领域,让机器人具备感知、理解与行动能力,是推动智能体进入真实世界的关键。 MiniCPM 推出的 MiniCPM-Robot 系列模型,围绕机器人操作与目标跟踪两大核心任务展开探索。其中,MiniCPM-RobotManip 是一个仅 15 亿参数的视觉语言动作模型,基于 MiniCPM-V 4.6 视觉语言骨干,并结合扩散动作头,实现从视觉观察和语言指令到机器人动作的端到端映射;MiniCPM-RobotTrack 则聚焦实体目标跟踪,以 0.9B 参数实现端侧实时视觉跟踪能力。通过轻量化架构、流式上下文记忆和高效视觉压缩技术,MiniCPM-Robot 系列展现了小规模模型在真实机器人场景中的高效推理潜力。

目前,HyperAI 超神经官网已上线了「MiniCPM-Robot:面向真实世界的具身智能模型」,快来试试吧~

在线使用:https://go.hyper.ai/0VsYI

7 月 25 日- 7 月 30 日,hyper.ai 官网更新速览:

*  优质公共数据集:9 个

*  优质教程精选:8 个

* 社区文章解读:2 篇

* 热门百科词条:5 条

* 8 月截稿顶会:6 个

访问官网:hyper.ai

公共数据集精选

1.Math-Graph  数学定理依赖图数据集

Math-Graph 是由华盛顿大学数学人工智能实验室于 2026 年发布的数学定理依赖图数据集,构建了一个语句级粒度的数学定理依赖图,相关论文成果为 TheoremGraph: Bridging Formal and Informal Mathematics 。

该数据集包含 47,952 条非形式化与形式化数学的语句匹配对,将两类数学知识整合为一张连贯的依赖图,覆盖非形式化(informal)与形式化(formal)数学,涵盖论文元数据、数学语句(形式/非形式)、依赖关系边以及 LLM 生成的自然语言描述数据。

在线运行:https://go.hyper.ai/bwVQf

2.Nemotron-SFT-Math-v4  数学推理 SFT 数据集

Nemotron-SFT-Math-v4 是由 NVIDIA 于 2026 年 5 月发布的数学推理数据集,相关论文成果为 Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision,旨在解决传统数学数据集质量参差不齐、推理轨迹不规范、准确率低、场景单一的问题,有效提升模型结构化推理、多轨迹推理与答案校验能力,广泛用于大模型数学推理微调、推理轨迹分析、答案校验算法研发、长上下文推理系统搭建与模型推理鲁棒性评测。 

该数据集包含 545,431 条训练样本,涵盖 285,516 条 COT 思维推理样本与 259,915 条 TIR 工具推理样本,覆盖代数、几何、数论、组合数学等竞赛与高校科研级数学场景,数据采用人工与自动化混合标注方式,包含唯一编号、题目文本、多轮对话、标准答案、来源、协议等标准化字段。

在线运行:https://go.hyper.ai/Kv9E4

3.MathNet  多模态数学基准推理数据集

MathNet 是由 MIT 团队联合阿卜杜拉国王科技大学等机构于 2026 年发布的一个大规模多语言、多模态数学推理数据集,相关论文成果为 MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval,旨在评估与提升大模型在奥林匹克级数学推理与结构化检索任务中的能力,广泛应用于用于数学推理评测、 RAG 研究及多模态 AI 训练等方向。

该数据集为 v0 版本,共收录 27,817 道专家级数学试题及配套标准解答,涵盖 58 个国家和地区、 17 种语言的官方数学竞赛真题,其中包含 5,148 道配图试题、共计 7,541 张几何及图形辅助配图。数据集覆盖代数、几何、数论、组合数学、微积分、概率统计等奥数知识体系,支持数学问题求解、数学语义检索(识别结构等价及相似试题)、检索增强问题求解 3 个基准任务。

在线运行:https://go.hyper.ai/AWKaV

数据集示例

4.Nemotron-Math-v2  数学推理数据集

Nemotron-Math-v2 是一个由 NVIDIA Corporation 于 2025 年发布的数学推理数据集,相关文论成果为 Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision 。主要用于训练 LLM 以执行结构化数学推理,研究工具增强的推理与纯语言推理的差异,以及构建长语境或多轨迹推理系统等。

该数据集包含约 34.7 万个高质量数学问题和 700 万个模型生成的推理轨迹。每个问题在六种配置下进行求解:高 / 中 / 低推理深度与是否使用 Python TIR,答案通过 LLM 作为裁判的管道进行验证。

在线运行:https://go.hyper.ai/rYdfW

5.CHIMERA  通用推理合成数据集

CHIMERA 是一个专为推理训练设计的合成推理数据集,相关论文成果为 CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning 。

该数据集涵盖广泛的 STEM 学科,并提供长链思维(CoT)轨迹,包含 9,225 个问题,8 个学科(数学、计算机科学、化学、物理、文学、历史、生物学、语音学),所有示例均由大型语言模型(LLM)生成,并通过自动验证,无需人工标注。

在线运行:https://go.hyper.ai/JskxG

6.Open-RL  推理问题数据集

Open-RL 是由 Turing 于 2026 年发布的多领域推理问题数据集,包含物理学、数学、生物学和化学的独立、可验证和明确的 STEM 推理问题。每个问题需要多步推理,涉及符号操作和/或数值计算,且具有可客观验证的最终答案。

该数据集适合用于强化学习微调、奖励建模、结果监督训练以及可验证推理基准测试。每个问题需要多步推理,并涉及符号操作和数值计算,具有可验证的最终答案。

在线运行:https://go.hyper.ai/WYDck

7.GPT-5.4 逐步推理数据集

GPT-5.4-step-by-step-reasoning 逐步推理数据集是一个高密度合成推理数据集,面向长链思维(CoT)建模与复杂问题求解任务。数据集基于「Master-Architect」流程构建,由 gemini 3 flash 生成高难度提示,结合 GPT-5.4 Reasoning Core 完成多步推理与结果生成。

该数据集包含约 1,500 条精英级样本,覆盖数学、编程与医学等高复杂度领域,任务难度统一设定为「Grandmaster」及「Beyond-PhD」级别。数据样本包含完整多步推理过程及验证后的最终解答,适用于长链逻辑推导与极限推理能力评估场景。

在线运行:https://go.hyper.ai/CeBEp

8.Sutra 10B Pretraining  教学训练数据集

Sutra 10B Pretraining 是一个用于大语言模型预训练的高质量教学数据集,由 Sutra 框架生成,创建了结构化的教育内容,优化了语言模型的预训练。这是 Sutra 系列中最大的一个数据集,旨在展示密集、精心策划的数据集如何为小型语言模型提供最佳的预训练性能。

该数据集共包含 10,193,029 条教学记录,总规模超过 100 亿个 token,涵盖跨学科、技术、科学、社会研究、数学、生活技能、艺术与创意、语言艺术以及哲学与伦理学等九大领域。数据内容遵循成熟的教学范式设计,难度由基础到高级划分为 10 个等级,具备良好的层次性与系统性。

在线运行:https://go.hyper.ai/skT3q

9.VisCoR-55K  视觉推理数据集

VisCoR-55K 是由华中科技大学联合阿里云与 2026 年发布的一个高质量视觉推理数据集,该数据集包含约 55,000 个视觉推理样本,每个样本都利用对比样本生成相应的推理过程,涵盖通用、推理、数学、图表及 OCR 五大类别的高质量视觉推理数据集,旨在促进视觉语言模型在可信且稳健的视觉推理方面的研究。

在线运行:https://go.hyper.ai/kIlWk

公共教程精选

1. MiniCPM-Robot:面向真实世界的具身智能模型

MiniCPM-Robot 是 OpenBMB 面向真实世界感知、决策与动作的具身智能模型族,首发包含两款模型:面向机器人操作的通用 VLA 模型 MiniCPM-RobotManip,以及面向具身目标跟踪的端侧模型 MiniCPM-RobotTrack 。

在线运行:https://go.hyper.ai/0VsYI

Demo 页面

2. Diamond-1.0:自回归语音修复模型

Diamond 是由 nineninesix.ai 于 2026 年 7 月开发的语音修复模型,采用自回归 seq2seq 架构,将退化音频(低码率编码、背景噪声、削波、窄带)还原为 44.1 kHz 近录音室品质语音。

在线运行:https://go.hyper.ai/OHZ6o

Demo 页面

3. Nanbeige4.2-3B:紧凑型智能体模型

Nanbeige4.2-3B 是由南北阁于 2026 年 7 月开发的紧凑型智能体模型,基于 Nanbeige4.2-3B-Base 构建。该模型采用 Looped Transformer(循环 Transformer)架构,通过复用 Transformer 层来在不增加参数量的前提下提升模型容量——仅用 3B 非嵌入参数(总计 4B),即可在智能体基准测试中超越 Qwen3.5-9B 、 Gemma4-12B 等更大模型。

在线运行:https://go.hyper.ai/KI1QR

Demo 页面

4. Fara1.5-27B:多模态计算机使用智能体

Fara1.5-27B 是由 Microsoft Research AI Frontiers 于 2026 年 5 月发布的多模态计算机使用智能体。核心创新为仅视觉感知架构:通过截图观察浏览器,以结构化工具调用(点击、输入、滚动、网页搜索等)完成端到端任务,无需访问 DOM 。该模型基于 Qwen3.5-27B 进行监督微调,训练数据由 FaraGen1.5 多智能体流程生成。

在线运行:https://go.hyper.ai/9AwuJ

Demo 页面

5. NVIDIA Cosmos3-Edge:全模态推理模型

Cosmos3-Edge 是由 NVIDIA 团队于 2026 年 7 月发布的 4B 参数全模态世界基础模型,核心创新与特点为采用混合 Transformer(MoT)架构,在一个统一框架内融合自回归 Transformer 和扩散 Transformer,分别处理文本生成和图像/视频/动作等多模态生成。

在线运行:https://go.hyper.ai/yB4bz

Demo 页面

6. Mage-Flow:高效原生分辨率图像生成与编辑基础模型

Mage-Flow 是由 Microsoft 于 2026 年 7 月发布的紧凑型 4B 图像生成与编辑基础模型。它通过精心设计的 tokenizer-backbone-system 协同优化,在 4B 参数规模下达到了与更大模型(Qwen-Image 20B 、 FLUX.2 32B)相媲美的质量,同时保持更快的推理速度和更低的内存占用。

在线运行:https://go.hyper.ai/3cw36

Demo 页面

7. LingBot-World-V2:无限世界与多样化交互的图像到视频生成

LingBot-World-V2 是由 Robbyant 团队于 2026 年 7 月发布的图像到视频生成模型。该模型通过因果预训练实现无限时长交互,并保持稳定输出质量;同时支持 720p 60fps 实时视频生成,具备攻击、射箭、施法等多样化交互能力。此外,LingBot-World-V2 首次将智能体框架引入世界模型,通过行为规划智能体和环境合成智能体,实现更智能的场景理解与交互生成。

在线运行:https://go.hyper.ai/wecWC

Demo 页面

8. MOSS-Transcribe-Diarize:端到端多说话人音频转录与说话人分离

MOSS-Transcribe-Diarize 是由 MOSI.AI (OpenMOSS) 团队于 2026 年 7 月发布的端到端多说话人音频理解模型。只需一次推理,模型即可同时完成语音转写和说话人分离,输出带有时间戳和匿名说话人标签(如 [S01] 、 [S02])的结构化文本。

在线运行:https://go.hyper.ai/TElI9

Demo 页面

💡我们还建立了 Stable Diffusion 教程交流群,欢迎小伙伴们扫码备注【SD 教程】,入群探讨各类技术问题、分享应用效果~

社区文章解读

1. 美国阿贡实验室提出 ChemGraph,13 项基准测试评估 Agent 在计算化学领域价值

阿贡国家实验室推出由 LLM 驱动的智能体 ChemGraph,专用于自动化计算化学分子模拟工作流。基准测试表明,GPT-4o 等大模型在复杂任务中表现稳定;而通过策略性地将任务拆解,较小模型(如 GPT-4o-mini)也能大幅提升性能,达到甚至超越大模型水平。此研究为低成本推动 AI 科研自动化提供了新思路。

查看完整报道:https://go.hyper.ai/Cgo56

2. 基于大模型推理与 MCP 工具调用,斯坦福大学 AI X 射线科学家在同步辐射光源自主完成单晶衍射对准

斯坦福大学与 SLAC 国家加速器实验室研究团队开发了一套「AI X 射线科学家」系统,并将其部署到斯坦福同步辐射光源的真实光束线上。研究团队先在虚拟光束线中完成系统调试,再迁移至真实设备,以单晶取向矩阵求解为任务,检验 AI 能否自主完成多步实验,并处理真实环境中的突发偏差。

查看完整报道:https://go.hyper.ai/jF9qk

热门百科词条精选

1. 人机回圈 HITL

2. 自动语音识别 ASR

3. 光学字符识别 OCR

4. 世界动作模型 WAM

5. 思维引导的强化学习框架 GTR

这里汇编了数百条 AI 相关词条,让你在这里读懂「人工智能」:

https://go.hyper.ai/wiki

8 月截稿顶会

*  截稿时间为 AoE 时间

一站式追踪人工智能学术顶会:https://go.hyper.ai/event

以上就是本周编辑精选的全部内容,如果你有想要收录 hyper.ai 官方网站的资源,也欢迎留言或投稿告诉我们哦!

下周再见!