HyperAIHyperAI

Command Palette

Search for a command to run...

EVA-Bench 端到端语音智能体基准数据集

日期

3 小时前

论文 URL

2605.13841

许可证

MIT

EVA-Bench 是由 ServiceNow 发布的一款端到端语音智能体评估基准数据集,相关论文成果为 EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents,旨在评测语音智能体的任务完成能力与交互体验,广泛应用于对话式语音智能体的仿真对话生成与质量测量。 该数据集包含 213 个场景,涵盖航空客服管理、医疗人力资源服务和企业 IT 服务管理 3 个企业领域,共涉及 39 类工作流与 121 个工具调用,支持对多轮语音交互、工具调用、任务完成情况和语音场景鲁棒性进行综合评估。

企业领域分类

  • 航空客服管理(CSM):涵盖 50 个场景,覆盖航班异常改签、自愿变更、取消、当日候补、补偿券发放、对抗性用户等
  • 医疗人力资源服务(HRSD):涵盖 83 个场景,覆盖医疗人员入职与资质审核、执照与 DEA 注册验证、 OTP 二次认证、请假与特殊申请、双意图 / 三意图复合请求以及对抗性用户等
  • 企业 IT 服务管理(ITSM):涵盖 80 个场景,覆盖事件分类与处理、升级控制、变更与问题管理、资产与权限分配、多层认证、单到四意图复合请求以及对抗性用户等
    流程框架图
    流程框架图

用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供