Command Palette

Search for a command to run...

LoongBench 多领域推理基准数据集

日期

2 个月前

机构

CAMEL-AI

论文链接

2509.03059

许可协议

MIT

加入 Discord 社区

*该数据集支持在线使用,点击此处跳转

LoongBench 是由 CAMEL-AI 团队于 2025 年发布的一个多领域推理评测数据集,相关论文成果为「Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers」,旨在为 LLM 提供多领域、可验证的训练与评测资源。

该数据集包含 8,729 条以自然语言问题形式表达、覆盖高等数学、高等物理学、化学、计算生物学、编程等 12 个推理密集型领域,每条样本不仅附带可执行代码和经过验证的答案,还包括问题陈述、详细推理过程、最终解答,以及元数据(问题 ID 与领域信息)和领域标签,适用于跨领域推理能力的训练与基准测试。

数据集构成

用 AI 构建 AI

从想法到上线——通过免费 AI 协同编程、开箱即用的环境和市场最优价格的 GPU 加速您的 AI 开发

AI 协同编程
即用型 GPU
最优价格
立即开始

Hyper Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供