Command Palette
Search for a command to run...
Metacognition-Bench 元认知基准数据集
Metacognition-Bench 是由 ginigen-ai 发布的一个有关大语言模型元认知能力的基准测试数据集,旨在测量模型检测自身推理错误并自我纠正的功能性元认知能力,而并非仅仅评估最终答案的准确性,相关论文成果为 FINAL Bench: Measuring Functional Metacognitive Reasoning in Large Language Models 。 该数据集包含 300 个元认知陷阱问题,覆盖数学、物理、生物、法律、医学、经济学、统计学、伦理学、计算机科学等 121 个领域,问题难度分为 A(前沿)、 B(专家)、 C(核心)3 个级别,涵盖 8 种元认知行为类型,包括自我纠正、陷阱逃脱、转换检测、矛盾解决、渐进发现、多约束处理、专家面板和不确定性决策。每个问题均嵌入一个隐蔽陷阱,以测试模型在面临惯性但错误的推理路径时的表现。该数据集通过多项选择题和开放式生成两种任务形式进行独立评分,用于客观衡量模型在对抗性推理陷阱中的脆弱性及适配器的纠错增益。
数据字段:
- task_id: 唯一标识符 (格式 META-001 至 META-300)
- domain: 问题所属领域
- grade: 难度等级 (A/B/C)
- ticos_type: 元认知行为类型 (共 8 种)
- difficulty: 定性难度描述
- prompt: 任务提示词
- expected_behavior: 正确推理过程及直觉易出错的具体节点
- hidden_trap: 隐藏的错误推理路径
- ticos_required: 所需的 TICOS 元认知代码