HyperAIHyperAI

Command Palette

Search for a command to run...

Metacognition-Bench 元认知基准数据集

日期

3 小时前

论文 URL

FINALBench

许可证

Apache 2.0

Metacognition-Bench 是由 ginigen-ai 发布的一个有关大语言模型元认知能力的基准测试数据集,旨在测量模型检测自身推理错误并自我纠正的功能性元认知能力,而并非仅仅评估最终答案的准确性,相关论文成果为 FINAL Bench: Measuring Functional Metacognitive Reasoning in Large Language Models 。 该数据集包含 300 个元认知陷阱问题,覆盖数学、物理、生物、法律、医学、经济学、统计学、伦理学、计算机科学等 121 个领域,问题难度分为 A(前沿)、 B(专家)、 C(核心)3 个级别,涵盖 8 种元认知行为类型,包括自我纠正、陷阱逃脱、转换检测、矛盾解决、渐进发现、多约束处理、专家面板和不确定性决策。每个问题均嵌入一个隐蔽陷阱,以测试模型在面临惯性但错误的推理路径时的表现。该数据集通过多项选择题和开放式生成两种任务形式进行独立评分,用于客观衡量模型在对抗性推理陷阱中的脆弱性及适配器的纠错增益。

数据字段:

  • task_id: 唯一标识符 (格式 META-001 至 META-300)
  • domain: 问题所属领域
  • grade: 难度等级 (A/B/C)
  • ticos_type: 元认知行为类型 (共 8 种)
  • difficulty: 定性难度描述
  • prompt: 任务提示词
  • expected_behavior: 正确推理过程及直觉易出错的具体节点
  • hidden_trap: 隐藏的错误推理路径
  • ticos_required: 所需的 TICOS 元认知代码

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供