AMD MI355X部署Kimi K3,显存优势挑战CUDA
近期开源大模型参数规模迅猛扩张,Kimi K3以2.8万亿参数突破性能瓶颈。面对超1.5TB的显存需求,单节点NVIDIA B200已无法胜任,业界测试将重心转向显存架构更具优势的AMD MI355X。据技术媒体Wafer实测,八卡MI355X集群成功承载该模型,在千令牌输入基准下实现单节点952令牌每秒的聚合吞吐与118令牌每秒的单流解码。相较需跨节点部署的十六卡B200方案,MI355X在聚合吞吐上提升近四倍,单流解码提升逾三成。尽管单卡绝对峰值略逊于B300,但结合显著的成本优势,MI355X以压倒性差距夺得性能价格比榜首。 针对ROCm生态的初期适配挑战,技术团队未开发自定义内核,而是通过代码层优化快速破局。研究小组修复了推理框架中缺失的核函数定义,解决投机解码引发的调度器崩溃,使单流性能提升两倍。同时,针对超长上下文的首字延迟痛点,通过维度对齐指令成功调用高速预填充内核,将冷启动处理速度提升两至三倍。此次验证表明,AMD MI355X在硬件规格与成本结构上已具备替代NVIDIA旗舰芯片的实战能力。随着主流框架持续打磨,底层算力生态壁垒正面临实质性考验,高算力低成本的开源模型部署新范式已清晰显现。
