HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
基准

大语言模型综合效能测评排行榜

2026年8月23日,应用人工智能架构师Ed Yau在Kerv平台发布更新版“Ed-o-meter”大模型综合评测榜单。该榜单摒弃传统学术指标,聚焦实际业务场景,依托开源框架Featherbench对17款主流模型进行严格测定。测试采用统一指令与确定性评分,模拟涵盖代码、数据、现实推理、安全及工具调用的28项真实任务,旨在为大模型智能体工作流提供工程化参考。 最新结果显示,智谱glm-5.3以百分之百的任务通过率位居榜首,单次成本仅0.28美元,约为gpt-5.5的五分之一,综合性价比领先。gpt-5.5以13.2秒的首字生成时间成为速度首选。针对细分需求,榜单指出gpt-5.6-luna适合低风险可重试场景,haiku-4-5首次作答准确率最高,sonnet-4-6则在质量与延迟间取得最优平衡。该评测数据已全面开源,推动企业大模型选型标准从理论性能转向实战表现与综合成本核算。

相关链接