HyperAIHyperAI

Command Palette

Search for a command to run...

NVIDIA
LLM

英伟达机密计算实现私有高性能AI推理

近日,英伟达性能工程团队发布技术评估报告,详细验证了基于机密计算架构运行大语言模型私有推理的性能表现。研究依托Blackwell GPU与TensorRT LLM框架,在DGX B200平台上开展对照实验。针对机密环境带来的内存加密与安全路径变更,团队对框架进行了底层适配,涵盖主机至设备的加密数据搬运、内核自动调优器时序稳定化,以及无NVLS多卡通信优化。测试表明,在并发请求1至16的负载下,开启机密计算后系统仍能保留96.1%至98.2%的基线令牌吞吐率,平均延迟开销控制在1.2%至4.3%。该结果证实,英伟达的软硬件协同方案有效化解了安全架构带来的性能损耗,使企业级私有AI推理具备生产可行性。英伟达指出,机密计算并未免除性能调优责任,平台工程师需将安全配置与推理优化纳入全栈工程体系,依托实际业务负载进行精准基准测试,从而实现数据安全与算力效率的平衡。

相关链接