HyperAIHyperAI

Command Palette

Search for a command to run...

메타인지-벤치 데이터셋

날짜

하루 전

Paper URL

FINALBench

라이선스

Apache 2.0

ginigen-ai에서 출시한 Metacognition-Bench는 대규모 언어 모델의 메타인지 능력을 평가하기 위한 벤치마크 데이터셋입니다. 이 데이터셋은 단순히 최종 답변의 정확도를 평가하는 것이 아니라, 모델이 자신의 추론 오류를 감지하고 수정하는 기능적 메타인지 능력을 측정하는 것을 목표로 합니다. 관련 연구 논문은 다음과 같습니다... FINAL Bench: 대규모 언어 모델에서 기능적 메타인지 추론 측정 . 이 데이터셋은 수학, 물리학, 생물학, 법학, 의학, 경제학, 통계학, 윤리학, 컴퓨터 과학을 포함한 121개 분야에 걸쳐 300개의 메타인지 함정 문제를 포함하고 있습니다. 난이도는 A(최첨단), B(전문가), C(핵심)의 세 단계로 나뉘며, 자기 수정, 함정 회피, 전환 감지, 갈등 해결, 점진적 발견, 다중 제약 조건 처리, 전문가 패널, 불확실성 의사 결정 등 8가지 메타인지 행동 유형을 포괄합니다. 각 문제에는 관성적이지만 오류가 있는 추론 경로에 직면했을 때 모델의 성능을 테스트하기 위한 숨겨진 함정이 포함되어 있습니다. 이 데이터셋은 객관식과 주관식 생성이라는 두 가지 유형의 문제를 사용하여 독립적으로 점수를 매겨 적대적 추론 함정에 대한 모델의 취약성과 어댑터의 오류 수정 이득을 객관적으로 측정합니다.

데이터 필드:

  • task_id: 고유 식별자(META-001~META-300 형식)
  • 영역: 질문이 속한 영역
  • 등급: 난이도 (A/B/C)
  • ticos_type: 메타인지행동 유형 (총 8가지 유형)
  • 난이도: 질적 난이도 설명
  • 프롬프트: 작업 프롬프트 단어
  • 예상되는 동작: 올바른 추론 과정과 직관이 오류를 범하기 쉬운 구체적인 지점.
  • hidden_trap: 숨겨진 오류 추론 경로
  • ticos_required: 필수 TICOS 메타인지 코드

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
메타인지-벤치 데이터셋 | 데이터 세트 | HyperAI초신경