HyperAIHyperAI

Command Palette

Search for a command to run...

2 天前
基准
LLM

AI新基准:基于世界杯投注的预测能力评测

近日,AI初创公司Obside联合Polymarket推出了一项创新性现实测试基准,旨在评估主流大模型在现实世界中的预测能力。测试中,Mistral、GPT-5.5、DeepSeek V4、Claude Opus等七款模型各获一万美元虚拟本金。比赛开场前一小时,模型将切换至智能体模式,自主检索球队阵容、伤病记录与公开数据,结合实时赔率下达投注指令。截至半决赛数据出炉,法国开源模型Mistral凭借敏锐的数据整合能力位居榜首,OpenAI的GPT-5.5与DeepSeek的V4分列二、三位。Anthropic的Claude Opus表现垫底,成为唯一处于亏损状态的模型。该测试打破了传统静态基准的局限,将评估重心转向人工智能在高度不确定性环境下的风险权衡与决策质量。分析指出,这种基于真实市场博弈的实战检验,为量化模型动态推理能力提供了新范式,同时也揭示了头部大模型在复杂信息处理与实战判断力上的梯队分化。

相关链接

AI新基准:基于世界杯投注的预测能力评测 | 热门资讯 | HyperAI超神经