Command Palette
Search for a command to run...
다중기준: 다중기준 준수를 위한 다중모달 심사자 벤치마킹
다중기준: 다중기준 준수를 위한 다중모달 심사자 벤치마킹
초록
대규모 다중모달 모델(LMMs)은 지시에 대한 강한 따르기 능력과 인간 선호와의 일관성 덕분에 다중모달 평가 시스템에서 심사관으로 점점 더 널리 채택되고 있다. 그러나 이러한 모델이 다양한 세부 평가 기준을 정확히 따를 수 있는 능력은 여전히 탐색되지 않은 영역이다. 본 연구에서는 다중기준에 대한 따름 능력과 신뢰할 수 있는 기준 수준 평가를 수행할 수 있는 능력을 평가하기 위해 'Multi-Crit'이라는 벤치마크를 개발하였다. Multi-Crit는 자유형 생성과 검증 가능한 추론 태스크를 모두 포함하며, 다중 기준에 기반한 인간의 주관적 평가가 부여된 도전적인 응답 쌍을 철저한 데이터 정제 프로세스를 통해 수집하여 구축되었다. 또한, 다중기준 준수의 체계적 평가를 위해 세 가지 새로운 지표를 도입하였으며, 이는 기준 다각화에 대한 적응성, 기준 전환의 유연성, 기준 수준의 선호 갈등 인식 능력을 각각 측정한다. 25개의 LMM에 대한 종합적 분석 결과, 1) 사적 모델은 여전히 다중기준에 일관되게 따르는 데 어려움을 겪고 있으며, 특히 자유형 평가에서 더욱 두드러진다; 2) 오픈소스 모델은 다양한 기준에 유연하게 대응하는 데 더 큰 격차를 보인다; 3) 종합적 평가 신호를 활용한 비판자(fine-tuning)는 시각적 기반 능력을 향상시키지만, 다중기준 수준의 평가로의 일반화는 실패한다. 또한 추론 훈련, 테스트 시각 스케일링, 오픈소스 모델과 사적 모델 간 경계 일관성에 대한 추가 분석을 통해 현재 다중모달 심사관의 한계를 심층적으로 탐구하였다. 본 연구는 다중모달 AI 평가의 신뢰성과 조정 가능성을 구축하기 위한 기초를 마련한 선도적인 연구로, 향후 연구에 중요한 기여를 할 것으로 기대된다.