Command Palette
Search for a command to run...
데이터셋 모음 | AI 에이전트 평가 데이터셋: 마이크로소프트, 베이징대학교, 홍콩대학교, 상하이 자오퉁대학교 등에서 공개한 10개의 데이터셋으로, 장기 기억부터 실제 작업 실행까지 모든 것을 포괄합니다.

대규모 모델 기능이 지속적으로 확장됨에 따라 AI 에이전트는 "대화 도구"에서 "작업 실행기"로 빠르게 진화하고 있으며, 자동화된 사무 작업, 코드 생성, 데이터 분석 및 복잡한 프로세스 처리와 같은 시나리오에서 널리 사용되기 시작했습니다. 기존의 질의응답형 대규모 언어 모델(LLM)과 비교했을 때, 에이전트의 핵심적인 변화는 다음과 같습니다.이제는 단순히 질문에 답하는 것을 넘어, 작업을 세분화하고, 도구를 활용하며, 목표가 달성될 때까지 자율적으로 나아갈 수 있습니다.
에이전트의 기능이 확장됨에 따라 학습 및 평가에 사용되는 데이터 세트의 중요성이 점점 커지고 있습니다. 기존의 단일 라운드 질의응답 방식이나 정적인 작업 데이터와 달리, 에이전트 관련 데이터 세트는 장기 계획, 다단계 추론, 도구 사용, 메모리 활용 등과 같은 "처리 능력"을 강조합니다. 이러한 데이터는 모델이 실제 복잡한 작업 환경에서 안정적으로 작동할 수 있는지 여부를 결정하며, 에이전트 시스템의 신뢰성과 성능 한계에 직접적인 영향을 미칩니다.
이 기사에서는 관련 데이터셋 10개를 정리했습니다.이 책은 현재 에이전트 연구의 핵심 역량 영역 몇 가지를 다룹니다. 즉, 장기적인 맥락 이해 및 기억 평가, 복잡한 작업 계획 및 다단계 추론, 도구 호출 및 대화형 실행 기능, 그리고 실제 또는 시뮬레이션 환경에서의 작업 완료 기능 등을 포함합니다.이러한 데이터는 종합적으로 인공지능 에이전트의 기능을 체계적으로 특성화하는 데 사용될 수 있습니다.
이러한 데이터 세트의 구성은 평가 및 훈련 데이터 자체의 변화도 보여줍니다. 즉, 정적인 질문 및 답변 주석에서 상호 작용 프로세스 및 행동 궤적 모델링으로 전환되어, 모델이 단순히 "답변"하는 능력뿐 아니라 "무언가를 수행하는" 능력을 뒷받침하는 데이터에 중점을 두게 되었습니다.
다음 데이터 세트는 HyperAI에서 온라인으로 이용할 수 있습니다.이는 관련 분야의 연구원과 개발자들의 연구 및 탐색 활동을 가속화하는 것을 목표로 합니다.
더욱 고품질의 데이터 세트:
데이터셋 추천
1. RHELM 장기 기억 평가 데이터 세트
* 온라인에서 사용하세요:

RHELM은 마이크로소프트가 2026년에 공개한 장기 기억 평가 데이터셋입니다. 관련 논문은 "정적 대화를 넘어서: 현실적이고 이질적이며 진화하는 장기 기억 벤치마킹"이라는 제목으로, 복잡한 동적 시나리오에서 대규모 모델의 장기 기억, 다중 홉 추론 및 시간 정보 합성 능력을 향상시키는 것을 목표로 합니다. RHELM은 대규모 언어 모델의 장기 기억 평가, AI 비서의 장기 상호작용 능력 검증, 대규모 모델의 다중 홉 추론, 시간 정보 융합, 환각 탐지 등 다양한 연구 분야에서 널리 활용되고 있습니다.
이 데이터 세트는 10개의 가상 캐릭터 프로필 세트, 1,305개의 질문-답변 쌍, 629개의 JSON 형식 대화, 625개의 TXT 형식 이메일 스레드, 그리고 1,053개의 MD 및 HTML 형식 첨부 파일로 구성되어 있습니다. 함께 제공되는 질문은 첨부 파일 참조, 혼합 추론, 사실 확인, 착각 탐지, 정보 집계, 시계열 분석, 그리고 오도 질문 등 7가지 핵심 유형을 다룹니다.
2. MemLens 멀티모달 장기 컨텍스트 벤치마크 데이터셋
* 온라인에서 사용하세요:
MemLens는 시각 언어 모델에서 장기 대화 기억을 평가하기 위한 벤치마크 데이터셋입니다. 이 데이터셋은 32,000, 64,000, 128,000, 256,000개의 컨텍스트 윈도우 내에서 다중 대화에 포함된 시각 및 텍스트 정보를 검색, 회상, 업데이트 및 추론하는 모델의 능력을 테스트합니다. 데이터셋은 정보 검색, 지식 업데이트, 시간적 추론, 다중 대화 추론, 거부(기권)의 다섯 가지 평가 유형을 포괄하는 789개의 항목으로 구성되어 있으며, 네 가지 컨텍스트 길이(32,000/64,000/128,000/256,000)를 제공합니다.
또한 이 데이터 세트는 추론 비용의 균형을 맞추기 위해 메모리 증강 에이전트를 평가하는 데 특화된 195개의 질문으로 구성된 고정된 계층화된 샘플 하위 집합을 제공합니다.
3. LongBlocks 장문 컨텍스트 다국어 질의응답 데이터셋
* 온라인에서 사용하세요:
LongBlocks는 리스본 대학교, 텔레커뮤니카송 연구소, TransPerfect 및 기타 기관에서 2026년에 공개한 다국어 장문 문맥 합성 데이터셋입니다. 이 데이터셋은 책, 웹 페이지 텍스트, 위키피디아 항목, arXiv 논문, 프로그래밍 코드, 커뮤니티 Q&A 등 장문 문서 코퍼스를 포괄하는 약 194,000개의 장문 문맥 질문-답변 예제를 포함하고 있습니다.
4. AgentTrove 지능형 에이전트 상호작용 궤적 데이터 세트
* 온라인에서 사용하세요:
AgentTrove는 OpenThoughts-Agent 팀에서 공개한 대규모 오픈 소스 에이전트 상호작용 궤적 데이터셋입니다. 이 데이터셋은 코드 수정, 셸 스크립팅, 수학 문제 해결, 프로그래밍 경진대회, 일반 컴퓨팅 사용 등 다양한 작업을 포괄하는 219개의 데이터셋에서 수집된 1,696,847개의 행으로 구성되어 있습니다. 모든 궤적은 오픈 소스 Harbor 에이전트 평가 및 데이터 생성 프레임워크를 사용하여 수집되었으며, Terminus-2 하네스 형식(ShareGPT와 유사한 대화 레이아웃)으로 통일되어 게시됩니다.
5. Claw-Eval 실세계 벤치마크 데이터셋
* 온라인에서 사용하세요:

Claw-Eval은 실제 환경에서 인공지능 에이전트의 성능을 평가하기 위한 투명한 엔드투엔드 평가 벤치마크 데이터셋으로, 2026년 베이징대학교와 홍콩대학교에서 공동으로 발표했습니다. 관련 논문은 "Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents"입니다. 이 데이터셋은 자율 에이전트가 실제 환경에서 작업을 수행하고, 도구를 호출하고, 다양한 모달리티를 이해하고, 상호 작용하는 능력을 평가하는 것을 목표로 합니다. Claw-Eval은 에이전트 시스템 평가, 자동화된 작업 실행, 멀티모달 에이전트 연구, 대규모 모델 성능 분석 등 다양한 분야에서 널리 활용되고 있습니다.
이 데이터 세트는 영어와 중국어를 모두 지원하며, 일반, 멀티모달, 멀티턴의 세 가지 핵심 작업 그룹을 포함하여 커뮤니케이션, 금융, 사무, 생산성 도구 등 총 24개의 작업 범주를 포괄합니다.
6. OpenMementos 컨텍스트 메모리 압축 데이터셋
* 온라인에서 사용하세요:
OpenMementos는 마이크로소프트에서 2026년에 공개한 컨텍스트 메모리 압축 데이터셋으로, 대규모 모델의 긴 체인 추론 및 컨텍스트 관리 기능을 모델링하기 위해 설계되었습니다. 이 데이터셋은 컨텍스트 압축 및 연속 추론을 수행하는 모델을 학습시켜 제한된 컨텍스트 윈도우 내에서 복잡한 다단계 추론 작업을 지원하는 것을 목표로 합니다. 긴 체인 추론 모델링, 메모리 효율 향상 모델 학습, 효율적인 생성 등 다양한 연구 시나리오에 활용될 수 있습니다.
이 데이터셋은 OpenThoughts 추론 데이터셋을 기반으로 구축되었으며, 123,333개의 수학 트랙, 61,485개의 과학 트랙, 43,739개의 프로그래밍 트랙을 포함하여 총 228,557개의 구조화된 추론 트랙을 포함합니다. 트랙당 평균 문장 수는 187개입니다.
7. MIA 다단계 추론 및 결정 궤적 데이터셋
* 온라인에서 사용하세요:

MIA(Memory Intelligence Agent)는 2026년 4월 중국화교사범대학교, 상하이혁신연구소, 하얼빈공업대학교가 공동으로 발표한 데이터셋입니다. 장기 기억 및 작업 실행 능력을 갖춘 지능형 에이전트를 학습하고 평가하는 데 사용됩니다. 관련 연구 논문은 "Memory Intelligence Agent"라는 제목으로, 지능형 에이전트의 장기 기억 활용 및 다단계 의사 결정 능력 향상을 목표로 합니다. 이 데이터셋은 문제 해결, 계획, 탐색, 실행의 전 과정을 포괄하는 약 21,000개의 추론 궤적 데이터를 포함하고 있으며, 에이전트 추론 및 강화 학습 연구에 적합합니다.
8. ToolACE 복합 도구 학습 대화 데이터 세트
* 온라인에서 사용하세요:
ToolACE는 도구 학습 작업을 위한 자동화 에이전트 파이프라인 데이터셋으로, 상하이 자오퉁 대학교가 중국과학기술대학교, 화웨이 노아의 방주 연구소 등과 협력하여 2024년에 발표했습니다. 관련 논문은 "ToolACE: LLM 함수 호출 점수 획득"입니다. ToolACE는 정확하고 복잡하며 다양한 도구 학습 데이터를 생성하여, 특히 도구 학습에서 발생하는 데이터 품질 부족 및 제한된 시나리오와 같은 실제 문제를 해결하는 것을 목표로 합니다.
이 데이터셋은 총 26,507개의 다양한 API를 호출하는 다단계 대화 예제를 포함합니다. 샘플은 다중 에이전트 상호작용을 통해 생성되었으며, 규칙 검사 및 모델 검증의 2단계 품질 보증 프로세스를 거칩니다. 각 대화는 다단계, 다중 소스 정보 검색 및 분석 작업을 나타내며, 실제 도구 호출 시나리오를 현실적으로 시뮬레이션하여 LLM(저수준 모델링)을 위한 가치 있는 학습 데이터를 제공합니다.
9. 크리에이티브 전문가를 위한 창의적 작업 지침 데이터 세트
* 온라인에서 사용하세요:
Creative Professionals Agentic Tasks는 멀티모달 AI 에이전트의 학습, 평가 및 미세 조정을 위해 설계된 대규모, 고품질 합성 작업 데이터셋입니다. 이 데이터셋은 36개의 창의적, 기술적, 엔지니어링 소프트웨어 환경을 포괄하는 1,070,917개의 에이전트 명령 작업을 포함합니다. 본 데이터셋은 복잡한 소프트웨어 상호작용과 다단계 추론 과정을 탐구하는 것을 목표로 합니다.
10. AgentNet 데스크톱 운영 작업 데이터 세트
* 온라인에서 사용하세요:
AgentNet은 홍콩대학교 XLANG 연구실이 Moonshot AI, 스탠포드대학교 및 기타 기관과 협력하여 2025년에 공개한 최초의 대규모 데스크톱 컴퓨터 에이전트 궤적 데이터셋입니다. 관련 논문은 "OPENCUA: Open Foundations for Computer-Use Agents"라는 제목으로, 크로스 플랫폼 GUI 기반 에이전트와 비전-언어-행동(VLA) 모델을 지원하고 평가하는 것을 목표로 합니다.
이 데이터 세트에는 Windows, macOS, Ubuntu를 포함한 22.6K개의 수동 주석이 달린 컴퓨터 사용 작업 추적 데이터와 200개 이상의 애플리케이션 및 웹사이트 데이터가 포함되어 있습니다. 시나리오는 사무용, 전문용, 일상용, 시스템의 네 가지 범주로 분류됩니다. 데스크톱 자동화, 다중 애플리케이션 프로세스, 크로스 플랫폼 에이전트의 교육 및 평가에 적합합니다.
이번 호에서 추천하는 모든 데이터셋입니다. 클릭 한 번으로 다운로드하여 사용해 보세요!








