Command Palette
Search for a command to run...
메타인지-벤치 데이터셋
ginigen-ai에서 출시한 Metacognition-Bench는 대규모 언어 모델의 메타인지 능력을 평가하기 위한 벤치마크 데이터셋입니다. 이 데이터셋은 단순히 최종 답변의 정확도를 평가하는 것이 아니라, 모델이 자신의 추론 오류를 감지하고 수정하는 기능적 메타인지 능력을 측정하는 것을 목표로 합니다. 관련 연구 논문은 다음과 같습니다... FINAL Bench: 대규모 언어 모델에서 기능적 메타인지 추론 측정 . 이 데이터셋은 수학, 물리학, 생물학, 법학, 의학, 경제학, 통계학, 윤리학, 컴퓨터 과학을 포함한 121개 분야에 걸쳐 300개의 메타인지 함정 문제를 포함하고 있습니다. 난이도는 A(최첨단), B(전문가), C(핵심)의 세 단계로 나뉘며, 자기 수정, 함정 회피, 전환 감지, 갈등 해결, 점진적 발견, 다중 제약 조건 처리, 전문가 패널, 불확실성 의사 결정 등 8가지 메타인지 행동 유형을 포괄합니다. 각 문제에는 관성적이지만 오류가 있는 추론 경로에 직면했을 때 모델의 성능을 테스트하기 위한 숨겨진 함정이 포함되어 있습니다. 이 데이터셋은 객관식과 주관식 생성이라는 두 가지 유형의 문제를 사용하여 독립적으로 점수를 매겨 적대적 추론 함정에 대한 모델의 취약성과 어댑터의 오류 수정 이득을 객관적으로 측정합니다.
데이터 필드:
- task_id: 고유 식별자(META-001~META-300 형식)
- 영역: 질문이 속한 영역
- 등급: 난이도 (A/B/C)
- ticos_type: 메타인지행동 유형 (총 8가지 유형)
- 난이도: 질적 난이도 설명
- 프롬프트: 작업 프롬프트 단어
- 예상되는 동작: 올바른 추론 과정과 직관이 오류를 범하기 쉬운 구체적인 지점.
- hidden_trap: 숨겨진 오류 추론 경로
- ticos_required: 필수 TICOS 메타인지 코드