Command Palette
Search for a command to run...
MerchantBench:面向电商运营中长期连贯性的 LLM 智能体基准测试
MerchantBench:面向电商运营中长期连贯性的 LLM 智能体基准测试
摘要
大语言模型智能体正越来越多地被评估为自主工具使用者,然而现有基准大多聚焦于具有即时成功标准的有界任务。现实世界的部署通常需要长期连贯性,即在较长的时间跨度内保持有目的的行为,同时根据积累的证据调整决策。评估这种能力需要一个持久的环境,在该环境中,行动会约束未来的选择,反馈以不同的延迟到达,而不连贯的行为会产生可衡量的累积效应。卖方端电子商务通过产品采购、上架与定价控制、现金流管理以及混合延迟反馈适应等反复且相互依赖的决策,为这一评估提供了合适的场景。我们引入了 MerchantBench,这是一个基于 98,843 条真实电商产品记录、配备 26 种智能体交互工具的 365 天订单级模拟环境。MerchantBench 将即时可观测的上游供应商事件与延迟的下游订单结果相结合,要求智能体跟踪单个订单的生命周期并重新审视先前的决策。我们在两个智能体框架下对八种大语言模型进行了 48 次运行评估,每次运行均跨越 365 个模拟天。我们的结果揭示了即使是最新的大语言模型与人类参与者之间也存在显著差距,表现最佳的大语言模型配置仅达到人类参与者平均最终净资产的 27.3%。我们的代码已开源,地址为 https://github.com/KhanCold/merchantbench。
一句话总结
浙江大学、北京大学和复旦大学的研究人员推出了MerchantBench,这是一个为期365天的电子商务模拟,利用98,843条真实产品记录和26种工具来评估LLM agents在顺序决策(如产品采购、定价、现金流管理以及混合延迟反馈)中的长期连贯性,发现表现最好的LLM仅达到人类参与者平均最终净资产的27.3%。
核心贡献
- MerchantBench是一个为期365天的订单级模拟基准,用于评估卖方电商中agent的长期连贯性,构建自98,843条真实产品记录和26种交互工具。
- 该环境将即时可观测的上游供应商事件与延迟的下游订单结果耦合,要求agents跟踪单个订单生命周期并跨混合延迟反馈调整决策。
- 在两个agent框架上对八种LLM进行48次运行评估,显示最佳LLM配置仅达到人类参与者平均最终净资产的27.3%,突显了持续自主决策方面的巨大差距。
引言
在诸如卖方电商等持续商业环境中,对LLM agents进行扩展现实时间尺度上的评估至关重要,因为持续的策略、适应性和目标维护非常关键。现有基准主要关注短视窗、单次会话任务,无法捕捉长期运营连贯性的挑战,包括活动退化、目标过早放弃以及策略转变校准不当。作者推出了MerchantBench,这是一个基于98,843条真实产品记录的365天订单级模拟,专门设计用于衡量八种LLM和两个agent框架上的长期连贯性,并揭示与人类基线的性能差距。
实验
经过365个模拟天后,ReAct GPT-5.6 Sol在净资产、GMV、利润率和Sustained Window Rate方面领先所有模型,同时罚款最少、异常率最低。Claude Opus 4.8表现出强大的店铺可靠性,平均评分最高;GLM-5.2处理的订单最多,但支付的罚款最多且利润率最低。Sustained Window Rate差异悬殊,ReAct近乎完美,而Qwen3.7-Max仅为11%,突显了长期运营一致性方面的巨大差距。ReAct GPT-5.6 Sol获得了最佳整体商业表现,净资产、GMV和利润率最高,罚款和异常率均保持在低位。Claude Opus 4.8获得了最高的平均店铺评分和低异常率,但其财务指标落后于ReAct。GLM-5.2推动了最高的订单量,但在所有agents中遭受了最大的罚款和最低的利润率。Sustained Window Rate从99.4%(ReAct)到11.1%(Qwen3.7-Max),揭示了长期可靠性方面的极端差异。异常率最低的是ReAct(10.7%),最高的是Qwen3.7-Max(16.1%),表明各模型店铺运营不稳定。
月度净利润概况显示,人类基线的利润远高于任何Hermes模型,并在年中出现明显激增,超过35k。在Hermes变体中,一些表现出中等盈利能力,峰值约为8-9k,而另一些则全年保持接近或低于1k,且通常在后期下降。人类基线显示出急剧的季节性高峰,在第6-8个月达到最高利润,峰值超过39k。Hermes模型表现差异很大:最佳表现者达到约8-9k的峰值利润,而最弱的模型很少超过2k并呈下降趋势。多个Hermes模型年终利润低于1k,而人类基线则维持更高的持续收益。
一项365天的模拟店铺实验评估了多个LLM agents,其中ReAct GPT-5.6 Sol在净资产、利润率和长期可靠性(99.4%持续窗口率)方面领先,而其他模型则显示出权衡,例如高订单量伴随着极大的罚款和低可靠性。一项独立的人类与Hermes利润研究发现,人类交易者获得了远高于Hermes的利润,季节性峰值超过39k,而Hermes模型最多仅产生约8-9k的峰值,且常低于1k,突显了巨大的性能差距。