HyperAI
Command Palette
Search for a command to run...
EVA-Bench 端到端语音智能体基准数据集
EVA-Bench 是由 ServiceNow 发布的一款端到端语音智能体评估基准数据集,相关论文成果为 EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents,旨在评测语音智能体的任务完成能力与交互体验,广泛应用于对话式语音智能体的仿真对话生成与质量测量。 该数据集包含 213 个场景,涵盖航空客服管理、医疗人力资源服务和企业 IT 服务管理 3 个企业领域,共涉及 39 类工作流与 121 个工具调用,支持对多轮语音交互、工具调用、任务完成情况和语音场景鲁棒性进行综合评估。
企业领域分类
- 航空客服管理(CSM):涵盖 50 个场景,覆盖航班异常改签、自愿变更、取消、当日候补、补偿券发放、对抗性用户等
- 医疗人力资源服务(HRSD):涵盖 83 个场景,覆盖医疗人员入职与资质审核、执照与 DEA 注册验证、 OTP 二次认证、请假与特殊申请、双意图 / 三意图复合请求以及对抗性用户等
- 企业 IT 服务管理(ITSM):涵盖 80 个场景,覆盖事件分类与处理、升级控制、变更与问题管理、资产与权限分配、多层认证、单到四意图复合请求以及对抗性用户等

流程框架图
此数据集由社区用户贡献,仅用于教育和信息目的。如有任何内容涉及版权侵权,请通过 [email protected] 联系我们,我们将及时审核并删除。