HyperAIHyperAI

Command Palette

Search for a command to run...

深度逆向解析苹果M1神经网络引擎架构

近日,技术社区完成对苹果M1芯片神经引擎的深度逆向工程。在历时三年的追踪后,研究者结合2025年M5芯片将神经核心集成至GPU的架构趋势,全面还原了该引擎的底层设计与数据流模型。 分析表明,该引擎并非通用处理器,而是采用固定功能的数据流架构。其计算单元含十六个核心与两千零四十八个乘加通道,专为稠密张量优化。调度层面,引擎摒弃传统指令流,依赖编译器预生成的任务描述符直接配置硬件寄存器,实现数据搬运、权重读取与激活计算的全链路固化。 研究进一步指出,实际性能严重受制于内存带宽瓶颈。在六十八GB/s系统带宽下,算力面临约一百六十二次操作每字节的算术强度门槛。硬件采用双层SRAM缓存,内核与输入数据的传输呈串行执行,印证了早期设计高度契合卷积神经网络时代的静态权重复用逻辑。随着大语言模型对动态缓存需求的激增,传统独立加速器架构显现局限。M5的集成方案印证了移动端AI向高吞吐架构转型的行业共识。该成果不仅还原了苹果七年前的硅片设计哲学,也为下一代端侧AI硬件优化提供了关键技术参考。

相关链接