HyperAIHyperAI

Command Palette

Search for a command to run...

EVA-Bench 엔드투엔드 음성 에이전트 벤치마크 데이터셋

날짜

하루 전

Paper URL

2605.13841

라이선스

MIT

EVA-Bench는 ServiceNow에서 공개한 엔드투엔드 음성 에이전트 평가 벤치마크 데이터셋입니다. 관련 연구 논문은 다음과 같습니다... EVA-Bench: 음성 에이전트 평가를 위한 새로운 엔드투엔드 프레임워크이 도구는 음성 지능형 에이전트의 작업 완료 능력과 상호 작용 경험을 평가하는 것을 목표로 하며, 대화형 음성 지능형 에이전트의 시뮬레이션 대화 생성 및 품질 측정에 널리 사용됩니다. 이 데이터 세트는 항공 고객 서비스 관리, 의료 인력 서비스, 기업 IT 서비스 관리 등 세 가지 기업 영역을 포괄하는 213개의 시나리오를 포함합니다. 39가지 유형의 워크플로와 121개의 도구 호출을 포함하며, 다중 턴 음성 상호 작용, 도구 호출, 작업 완료 상태 및 음성 시나리오의 안정성을 종합적으로 평가할 수 있도록 지원합니다.

기업 도메인 분류

  • 항공사 고객 서비스 관리(CSM): 비정상적인 항공편 재예약, 자발적 변경, 취소, 당일 대기, 보상 바우처 발행, 문제 사용자 응대 등 50가지 시나리오를 다룹니다.
  • 의료인사서비스(HRSD): 의료진의 온보딩 및 자격 검증, 면허 및 DEA 등록 확인, OTP 2차 인증, 휴가 및 특별 신청, 이중/삼중 의도 요청, 악의적 사용자 등 83가지 시나리오를 다룹니다.
  • 엔터프라이즈 IT 서비스 관리(ITSM): 인시던트 분류 및 처리, 에스컬레이션 제어, 변경 및 문제 관리, 자산 및 액세스 제어, 다단계 인증, 단일에서 4가지 의도를 가진 복합 요청, 악의적인 사용자 대응 등 80가지 시나리오를 다룹니다.
    순서도
    순서도

AI로 AI 구축

아이디어에서 출시까지 — 무료 AI 코코딩, 즉시 사용 가능한 환경, 최적의 GPU 가격으로 AI 개발을 가속화하세요.

AI 협업 코딩
바로 사용 가능한 GPU
최적의 가격

HyperAI Newsletters

최신 정보 구독하기
한국 시간 매주 월요일 오전 9시 에 이번 주의 최신 업데이트를 메일로 발송합니다
이메일 서비스 제공: MailChimp
EVA-Bench 엔드투엔드 음성 에이전트 벤치마크 데이터셋 | 데이터 세트 | HyperAI초신경