HyperAIHyperAI

Command Palette

Search for a command to run...

AgentWorldBench 언어 세계 모델 벤치마크 데이터셋

날짜

조직

Qwen

Paper URL

2606.24597

라이선스

Apache 2.0

AgentWorldBench는 Qwen이 2026년에 공개한 언어 세계 모델의 종합적인 평가를 위한 벤치마크 데이터셋입니다. 관련 연구 논문은 다음과 같습니다... Qwen-agentworld: 일반 에이전트를 위한 언어 세계 모델이 도구는 언어 세계 모델의 환경 모델링 및 추론 능력을 평가하는 것을 목표로 하며, 대규모 모델 에이전트 기능 평가, 도구 호출 및 시스템 상호 작용 검증, 자동화된 소프트웨어 엔지니어링 및 운영 체제 수준의 작업 연구 등에서 널리 사용됩니다. 이 데이터셋은 평균 22.8회의 상호작용을 포함하는 2,170개의 샘플로 구성되어 있습니다. Tool Decathlon, Terminal-Bench 1.0/2.0, OSWorld-Verified와 같은 주요 벤치마크에서 얻은 실제 모델 궤적을 기반으로 구축되었습니다. 각 평가 샘플에는 실제 환경에서 실행하여 얻은 표준 응답이 함께 제공됩니다. 예측된 환경 관찰 결과는 형식, 사실성, 일관성, 현실성, 품질의 다섯 가지 차원에서 평가되어 환경 시뮬레이션에 필요한 추론, 지식 및 장기적인 맥락 이해 능력을 탐구합니다.

데이터 세트 구성

  • MCP: API 서버 응답, 도구 호출 결과, 데이터베이스 상태 및 서비스 프로토콜을 포함하여 평균 23.1회의 상호 작용이 이루어진 286개의 샘플.
  • 검색: 458개 샘플, 평균 15.5회 상호작용, 검색 엔진 결과, URL, 요약, 순위 및 페이지 콘텐츠 포함.
  • 터미널: 354개의 샘플을 분석했으며, 평균 26.7회의 상호 작용이 발생했습니다. 분석 대상은 명령줄 환경, 셸 출력, 파일 시스템 상태 및 프로세스 동작입니다.
  • SWE: 472개 샘플, 평균 28.1회 상호 작용, IDE/코드 편집 환경, Git diff, 테스트 결과 및 컴파일 오류 포함.
  • Android: 200개의 샘플, 평균 상호 작용 시간 37.8회, 터치/제스처 조작 후 Android UI 계층 구조의 변화를 포함합니다.
  • 웹: 200개의 샘플, 평균 14.2회의 상호작용, 사용자 상호작용 후 브라우저 DOM 상태 변화를 분석했습니다.
  • OS: 데스크톱 운영 체제 상태, 파일 시스템, 창 관리 및 애플리케이션 동작을 포함하는 200개의 샘플, 평균 12.7회 실행.

소환

@article{zuo2026qwen,
title={Qwen-agentworld: language world models for general agents},
author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
journal={arXiv preprint arXiv:2606.24597},
year={2026}
}

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp