HyperAIHyperAI

Command Palette

Search for a command to run...

文本/LaTeX/HTML 表格一步搞定!OvisOCR2 实现端到端文档智能解析;1.4 万+ 元素标注、万条语言指令!Voxel51 发布 SceneFun3D 室内场景微观交互数据集

OvisOCR2  由 ATH-MaaS 、阿里等团队于 2026 年 7 月推出,是一款参数仅 0.8B(约 1.7GB)的紧凑型端到端文档解析模型。该模型基于 Qwen3.5-0.8B 构建,能将文档图像直接转化为保留自然阅读顺序的结构化 Markdown 格式,并精准解析文本、公式、表格及可视区域。凭借创新的混合数据引擎与多阶段(SFT 、 RL 和 OPD)训练方案,OvisOCR2 在 OmniDocBench v1.6 评测中斩获 96.58 分,成为首个性能超越传统流水线方法的端到端模型,完美实现了极低部署成本与卓越性能的统一。

目前,HyperAI 超神经官网已上线了「OvisOCR2:0.8B 端到端文档解析模型」,快来试试吧~

在线使用:https://go.hyper.ai/1qOnc

欢迎登录官网查看更多内容:

https://hyper.ai

7 月 18 日- 7 月 24 日,hyper.ai 官网更新速览:

*  优质公共数据集:9 个

*  优质教程精选:9 个

* 社区文章解读:1 篇

* 热门百科词条:5 条

* 8 月截稿顶会:6 个

访问官网:hyper.ai

公共数据集精选

1. SceneFun3D 3D 场景功能交互数据集

SceneFun3D 是由 Voxel51 于 2024 年发布的 3D 场景功能交互数据集,聚焦于微小交互部件的细粒度理解,涵盖部件定位、 Gibsonian 功能推理、运动参数估计及自然语言任务描述。该数据涵盖 710 个高分辨率真实室内场景,包含 14,867 个功能交互元素标注、 9 类功能类别、 14,279 个运动参数以及 10,913 余个自然语言任务指令。

在线使用:https://go.hyper.ai/g81mC

2. Vāgdhenu 梵语吟诵语料数据集

Vāgdhenu 是一个单人梵语吟诵录音语料库,主要面向梵语语音合成训练、韵律格律研究及语言无障碍应用等场景。该数据集共包含 1,467 个片段,音频总时长约 5.3 小时,采用 24 kHz 单声道 WAV 格式,数据集包含 style_a 与 style_b 两个独立子集,覆盖大量不同诗节。

在线使用:https://go.hyper.ai/D7Q6H

3. Math-Graph 数学定理依赖图数据集

Math-Graph 是由华盛顿大学数学人工智能实验室于 2026 年发布的数学定理依赖图数据集,构建了一个语句级粒度的数学定理依赖图。该数据集包含 47,952 条非形式化与形式化数学的语句匹配对,将两类数学知识整合为一张连贯的依赖图,覆盖非形式化与形式化数学,涵盖论文元数据、数学语句、依赖关系边以及 LLM 生成的自然语言描述数据。

在线使用:https://go.hyper.ai/CtIDb

4. GLM-5.2 Agent 智能体交互轨迹数据集

GLM-5.2 Agent 是由 TeichAI 使用 Teich 生成的一个 GLM – 5.2 模型原始智能体交互轨迹数据集,旨在为智能体(Agent)模型的训练设计提供标准化、可解析的会话记录,支持后续的微调与工具调用能力增强。

在线使用:https://go.hyper.ai/itLRp

5. EVA-Bench 端到端语音智能体基准数据集

EVA-Bench 是由 ServiceNow 发布的一款端到端语音智能体评估基准数据集,旨在评测语音智能体的任务完成能力与交互体验。该数据集包含 213 个场景,涵盖航空客服管理、医疗人力资源服务和企业 IT 服务管理 3 个企业领域,支持对多轮语音交互、工具调用、任务完成情况和语音场景鲁棒性进行综合评估。

在线使用:https://go.hyper.ai/51B4l

6. Metacognition-Bench 元认知基准数据集

Metacognition-Bench 是由 ginigen-ai 发布的一个有关大语言模型元认知能力的基准测试数据集,旨在测量模型检测自身推理错误并自我纠正的功能性元认知能力,而并非仅仅评估最终答案的准确性。该数据集包含 300 个元认知陷阱问题,覆盖数学、物理、生物、法律、医学、经济学、统计学、伦理学、计算机科学等 121 个领域,涵盖 8 种元认知行为类型,包括自我纠正、陷阱逃脱、转换检测、矛盾解决、渐进发现、多约束处理、专家面板和不确定性决策。

在线使用:https://go.hyper.ai/8qdca

7. SVG Benchmark 静态图像生成基准数据集

SVG Benchmark 是由 Rapidata 于 2025 年发布的大模型静态图像生成评测数据集,旨在通过人工评估对比 30 个前沿大语言模型根据文本提示生成静态 SVG 的能力。 该数据采用两两对比的形式进行数据收集,包含 500 个来自人工撰写或公开数据集的英文提示词,188,754 组图像对比样本,以及基于人类投票的 1,355,161 条偏好反馈。

在线使用:https://go.hyper.ai/13Rn2

8. IFStruct v1.0 结构化输出合规性基准数据集

IFStruct v1.0 是由 Liquid AI 于 2026 年发布的结构化输出合规性基准测试数据集,旨在系统评估大语言模型生成符合指定 Schema 的结构化输出的能力。该数据集包含 2,000 条提示词,每条提示词要求模型根据目标模式生成若干实例,提示词的呈现风格包括自然对话、显式路径指令、原始 JSON Schema 、代码块要求、无附加文本等,且均附带严格的底层 Schema 验证规范。

在线使用:https://go.hyper.ai/3NUcg

9. EdgeBench 智能体真实环境学习基准数据集

EdgeBench 是由字节跳动(ByteDance Seed)于 2026 年发布的智能体真实环境学习基准测试数据集,旨在评估自主 AI 智能体从真实环境中学习的能力。该数据集包含 134 个真实世界任务,其中 51 个任务已开源,涵盖科学计算与机器学习、系统与软件工程、最优化、知识推理、形式化推理及博弈游戏六大能力类别。

在线使用:https://go.hyper.ai/FqmX7

公共教程精选

1. OvisOCR2:0.8B 端到端文档解析模型

OvisOCR2 模型由 ATH-MaaS 团队于 2026 年 7 月发布,是一个紧凑的 0.8B 端到端文档解析模型。该模型通过对 Qwen3.5-0.8B 进行后训练构建,采用精心设计的数据引擎(结合真实数据与合成数据)以及集成 SFT 、 RL 和 OPD 的多阶段训练策略。

在线运行:https://go.hyper.ai/1qOnc

Demo 页面

2. RoBERTa Tweet 情感文本抽取

RoBERTa 模型是由 Facebook AI 团队于 2019 年 7 月发布,其核心创新与特点为在 BERT 基础上引入动态掩码策略、更大批次训练和更多训练数据,显著提升了 NLP 基准测试性能。

在线运行:https://go.hyper.ai/8iZIz

3. handson-ml2 机器学习实战教程

这是一个完整的机器学习实战教程集合,包含从机器学习基础到深度学习的全面内容。本教程基于 Aurélien Géron 的经典著作《Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow》(第 2 版)。 

在线运行:https://go.hyper.ai/jEyUh

4. Keras 深度学习基础教程 — 乳腺癌分类

本教程源自 Kaggle 上 Paras Jindal 于 2026 年 7 月 发布的入门级深度学习项目,使用 Keras Sequential API 构建神经网络模型,对乳腺癌细胞特征数据进行良恶性二分类。

在线运行:https://go.hyper.ai/s1X9X

模型汇总对比

5. Recommendation Engine 共购推荐引擎

共购推荐引擎是一个基于 Chris Deotte 的 Kaggle Notebook Recommend Items Purchased Together 的推荐系统,该 Notebook 于 2022 年 2 月发布。其核心创新在于通过分析历史交易数据构建共购矩阵,从而推荐经常一起购买的商品,融合了三种策略:历史购买频率、共购模式和热门商品兜底。该算法在 H&M 个性化时尚推荐竞赛中取得了 MAP@12 = 0.021 的成绩。

在线运行:https://go.hyper.ai/fiegd

6. Titanic 数据科学解决方案:从零入门机器学习

Titanic – Machine Learning from Disaster 是 Kaggle 平台上最经典的入门竞赛之一。任务目标是根据乘客的个人信息(舱位等级、性别、年龄、家庭规模等),预测其在泰坦尼克号沉船事故中是否幸存。

在线运行:https://go.hyper.ai/gGUJO

数据分析

7.  灾难推文分类:使用 BERT 进行 NLP 文本分类

本教程基于 Kaggle 上 xhlulu 的经典 Notebook,使用 BERT 进行灾难推文二分类。本教程通过一个完整的 NLP 实战项目,带你从零搭建 BERT 文本分类 pipeline:数据加载 → Tokenization 编码 → 模型构建 → 训练微调 → 推理预测。你将学会如何将预训练 BERT 应用于自定义二分类任务,并理解 [CLS] token 、 sigmoid 输出层等关键设计选择背后的原理。

在线运行:https://go.hyper.ai/ENFgs

8. Ternary-Bonsai-27B:7.2GB 三值量化推理 27B

Ternary Bonsai 27B 是由 Prism ML 团队于 2026 年 7 月开发的推理型大语言模型,基于 Qwen3.6-27B 进行端到端三值化量化。模型采用混合注意力机制(~75% 线性注意力 / ~25% 全注意力),支持 262K 超长上下文,在 100K token 上下文下仅需 ~14.7 GB 峰值内存。提供 DSpark 投机解码加速层,可实现 1.34x 无损解码加速。

在线运行:https://go.hyper.ai/OfSLw

Demo 页面

9. Lyft Motion Prediction:基于 ResNeXt50 FPN 的自动驾驶车辆运动轨迹预测

Lyft Motion Prediction 是 Lyft 在 2020 年举办的 Kaggle 竞赛,任务是根据自动驾驶场景中的上下文信息,预测智能体(车辆、行人等)未来 5 秒的运动轨迹(50 个时间步,10Hz)。

在线运行:https://go.hyper.ai/vJYkN

Demo 页面

💡我们还建立了 Stable Diffusion 教程交流群,欢迎小伙伴们扫码备注【SD 教程】,入群探讨各类技术问题、分享应用效果~

社区文章解读

1. 基于超 1 万肿瘤样本训练,哈佛医学院等提出泛癌症基础模型 COMPASS,平均性能优于 22 种现有方法

来自哈佛医学院、罗氏制药及浙江大学的研究团队提出一种泛癌症基础模型 COMPASS 。该模型基于来自 33 种癌症类型的 10,184 个肿瘤样本进行训练,并在 7 种癌症、 6 种免疫检查点抑制剂覆盖的 16 个临床队列中进行评估。结果显示,COMPASS 的平均性能优于 22 种现有方法,在不同队列中平均将预测准确率提升了 8.5% 。

查看完整报道:https://go.hyper.ai/FyRsC

热门百科词条精选

1. 技能 Skills

2. 世界动作模型 WAM

3. 缩放定理 Scaling Law

4. 每秒帧数 Frames Per Second

5.  自动语音识别 Automatic Speech Recognition

这里汇编了数百条 AI 相关词条,让你在这里读懂「人工智能」:

https://go.hyper.ai/wiki

8 月截稿顶会

*  截稿时间为 AoE 时间

一站式追踪人工智能学术顶会:https://go.hyper.ai/event