Command Palette
Search for a command to run...
chi-bench 의료 지능형 에이전트 벤치마크 평가 데이터 세트
chi-bench(Clinical Healthcare Intelligence Benchmark)는 Actava AI에서 2026년에 발표한 의료 인텔리전스 에이전트 평가용 데이터셋입니다. 관련 연구 논문은 다음과 같습니다... CHI-Bench: AI 에이전트가 정책 기반 의료 워크플로우를 처음부터 끝까지 자동화할 수 있을까? 본 데이터 세트는 미국 의료 워크플로 전반에서 AI 에이전트의 계획, 추론, 도구 호출 및 시스템 간 협업 기능을 평가하는 것을 목표로 합니다. 이 데이터셋은 MCP(모델 컨텍스트 프로토콜)의 개방형 인터페이스를 통해 20개의 의료 응용 시스템을 통합하여 고정밀 의료 비즈니스 시뮬레이션 환경을 구축하고, 1,279개의 의료 운영 문서를 포함하는 지식 기반을 제공합니다. 평가 시나리오는 미국 의료 시스템의 세 가지 주요 영역인 사전 승인, 진료비 청구 관리, 인구 집단 관리 등을 다룹니다. 총 101개의 평가 과제가 포함되어 있으며, 75개의 기본 과제, 2개의 에이전트가 참여하는 엔드투엔드 과제 23개, 그리고 장거리 마라톤 과제 3개가 있습니다. 이 데이터셋은 대규모 의료 모델, 의료 에이전트, 다중 에이전트 협업, 의료 프로세스 자동화 등의 연구 및 평가에 활용될 수 있습니다.
소환
@misc{chen2026chibenchaiagentsautomate,
title={CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?},
author={Haolin Chen and Deon Metelski and Leon Qi and Tao Xia and Joonyul Lee and Steve Brown and Kevin Riley and Frank Wang and T. Y. Alvin Liu and Hank Capps MD and Zeyu Tang and Xiangchen Song and Lingjing Kong and Fan Feng and Tianyi Zeng and Zhiwei Liu and Zixian Ma and Hang Jiang and Fangli Geng and Yuan Yuan and Chenyu You and Qingsong Wen and Hua Wei and Yanjie Fu and Yue Zhao and Carl Yang and Biwei Huang and Kun Zhang and Caiming Xiong and Sanmi Koyejo and Eric P. Xing and Philip S. Yu and Weiran Yao},
year={2026},
eprint={2605.16679},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2605.16679},
}