HyperAIHyperAI

Command Palette

Search for a command to run...

PerceptionBench 시각 인지 벤치마크 데이터 세트

날짜

조직

Beijing Moonshot AI Technology Co., Ltd.

Paper URL

2607.24957

라이선스

Non-Commercial

태그

PerceptionBench는 Moonshot AI에서 2026년에 공개한 대규모 모델의 시각적 인식 능력 벤치마크 데이터셋입니다. 특히 멀티모달 대규모 언어 모델(MLLM)의 기본적인 시각적 인식 능력을 평가하기 위해 설계되었습니다. 관련 연구 논문으로는 다음과 같은 것들이 있습니다... PerceptionBench: 멀티모달 대규모 언어 모델에서 원자적 시각 인식을 평가합니다. . 이 데이터셋은 시각적 관계 이해, 계산, 속성 인식, 깊이 및 3D 지각, 공간 위치 파악, 비교 추론, 세밀한 인식, 문맥 통합, OCR 텍스트 이해, 지각 관련 환각 등 10가지 기본 지각 능력을 다루는 3,000개의 검증된 테스트 문항을 포함합니다. 이 중 1,800개는 기존 벤치마크의 실패 샘플에서 파생된 원자 수준의 하위 문제이며, 나머지 1,200개는 보충 이미지를 기반으로 새롭게 생성된 문항입니다. 평가는 표준화된 프롬프트 단어 템플릿과 최대 추론 예산을 사용하여 GPT-5.6-Sol, Kimi K3, Claude-Fable-5를 포함한 16개의 최첨단 멀티모달 대규모 언어 모델에서 개방형 질문-답변 테스트를 수행했습니다.

데이터 필드:

  • 인덱스: 샘플의 고유 인덱스 번호
  • 답변: 참고 답변
  • 문제: 문제 설명
  • 힌트: 프롬프트 메시지
  • 이미지: 질문에 포함된 이미지 정보
  • error_category: 샘플에 해당하는 원자 감지 능력 범주입니다.
  • source_bmk: 업스트림 벤치마크의 소스 식별자
  • source_idx: 상위 벤치마크에서 샘플의 원래 인덱스입니다.

소환

@article{perceptionbench2026,
title   = {PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models},
author  = {Moonshot AI},
year    = {2026}
}

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp