HyperAIHyperAI

Command Palette

Search for a command to run...

AgentWorldBench 언어 세계 모델 벤치마크 데이터셋

날짜

14일 전

조직

Paper URL

2606.24597

라이선스

Apache 2.0

AgentWorldBench는 Qwen이 2026년에 공개한 언어 세계 모델의 종합적인 평가를 위한 벤치마크 데이터셋입니다. 관련 연구 논문은 다음과 같습니다... Qwen-agentworld: 일반 에이전트를 위한 언어 세계 모델이 도구는 언어 세계 모델의 환경 모델링 및 추론 능력을 평가하는 것을 목표로 하며, 대규모 모델 에이전트 기능 평가, 도구 호출 및 시스템 상호 작용 검증, 자동화된 소프트웨어 엔지니어링 및 운영 체제 수준의 작업 연구 등에서 널리 사용됩니다. 이 데이터셋은 평균 22.8회의 상호작용을 포함하는 2,170개의 샘플로 구성되어 있습니다. Tool Decathlon, Terminal-Bench 1.0/2.0, OSWorld-Verified와 같은 주요 벤치마크에서 얻은 실제 모델 궤적을 기반으로 구축되었습니다. 각 평가 샘플에는 실제 환경에서 실행하여 얻은 표준 응답이 함께 제공됩니다. 예측된 환경 관찰 결과는 형식, 사실성, 일관성, 현실성, 품질의 다섯 가지 차원에서 평가되어 환경 시뮬레이션에 필요한 추론, 지식 및 장기적인 맥락 이해 능력을 탐구합니다.

데이터 세트 구성

  • MCP: API 서버 응답, 도구 호출 결과, 데이터베이스 상태 및 서비스 프로토콜을 포함하여 평균 23.1회의 상호 작용이 이루어진 286개의 샘플.
  • 검색: 458개 샘플, 평균 15.5회 상호작용, 검색 엔진 결과, URL, 요약, 순위 및 페이지 콘텐츠 포함.
  • 터미널: 354개의 샘플을 분석했으며, 평균 26.7회의 상호 작용이 발생했습니다. 분석 대상은 명령줄 환경, 셸 출력, 파일 시스템 상태 및 프로세스 동작입니다.
  • SWE: 472개 샘플, 평균 28.1회 상호 작용, IDE/코드 편집 환경, Git diff, 테스트 결과 및 컴파일 오류 포함.
  • Android: 200개의 샘플, 평균 상호 작용 시간 37.8회, 터치/제스처 조작 후 Android UI 계층 구조의 변화를 포함합니다.
  • 웹: 200개의 샘플, 평균 14.2회의 상호작용, 사용자 상호작용 후 브라우저 DOM 상태 변화를 분석했습니다.
  • OS: 데스크톱 운영 체제 상태, 파일 시스템, 창 관리 및 애플리케이션 동작을 포함하는 200개의 샘플, 평균 12.7회 실행.

소환

@article{zuo2026qwen,
title={Qwen-agentworld: language world models for general agents},
author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
journal={arXiv preprint arXiv:2606.24597},
year={2026}
}

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
AgentWorldBench 언어 세계 모델 벤치마크 데이터셋 | 데이터 세트 | HyperAI초신경