NVIDIA CC sichert performante KI-Inferenz in Produktion
Die zunehmend sensible Verarbeitung von Unternehmensdaten und proprietären Kontexten durch Large Language Models erfordert sichere Ausführungsumgebungen. NVIDIA hat mit seiner Confidential Computing-Plattform einen Ansatz entwickelt, der KI-Inferenzworkloads auf vertrauenswürdiger Hardware ausführt. Dabei kommen speicherverschlüsselte vertrauliche virtuelle Maschinen, vertrauliche GPUs sowie verschlüsselte NVLink-Verbindungen zum Einsatz. Insbesondere bei der Nutzung von NVIDIA Blackwell-GPUs in Kombination mit dem Inference-Framework TensorRT LLM stellte sich die Herausforderung, dass Sicherheitsmechanismen klassische Runtime-Annahmen zur Speicherbewegung, Taktung und Multi-GPU-Kommunikation verändern und dabei typischerweise Performance-Overhead verursachen. Um diese Effekte präzise zu quantifizieren, führte das NVIDIA Performance Engineering Team kontrollierte Tests durch, bei denen dieselben Workloads unter aktivierter und deaktivierter Confidential Computing-Umgebung verglichen wurden. Die Tests basierten auf dem Modell DeepSeek-R1-0528-NVFP4 mit einer Sequenzlänge von 32K Eingabe- und 1K Ausgabemodellen unter variierender Parallelität. Da hohe Anfragevolumina feste Verschlüsselungskosten amortisieren können, wurden gezielt Workloads mit langen Kontextfenstern, verlängerter Token-Generierung und niedriger Konurrenz gewählt, um die Auswirkungen der Sicherheitsschichten isoliert sichtbar zu machen. Die Hardwarebasis bildete ein DGX B200-System mit acht Blackwell-GPUs auf einer Intel-TDX-Plattform. Die Analyse ergab, dass TensorRT LLM durch spezifische CC-Bewusstseins-Anpassungen signifikante Engpässe entschärfen kann. Die Datenübertragung vom Host zur GPU erfolgt nun über einen softwarebasierten verschlüsselten Puffer, was asynchrone Übertragungsvorteile von gepinntem Speicher ausgleicht. Zusätzlich wurde der Kernel-Autotuner stabilisiert, der zuvor durch unzuverlässige CUDA-Ereignis-Timestamps in der vertraulichen Umgebung langsamere Taktiken auswählte. Für die Multi-GPU-Kommunikation verzichtet die Lösung auf die in CC-Konfigurationen nicht verfügbare NVLS-Multicast-Funktion und optimiert die NCCL-Symmetrie-Pfade, um Speicherregistrierungs- und Synchronisationskosten zu minimieren. Die Leistungsmessungen über einen Konurrenzbereich von eins bis sechzehn Anfragen belegen die Wirksamkeit des Ansatzes. Aktiviertes Confidential Computing behielt zwischen 96,1 und 98,2 Prozent der tokenbezogenen Ausgabetransparenz im Vergleich zur Baseline bei. Die mittlere Latenz pro generiertem Token belief sich auf einen zusätzlichen Overhead von 1,2 bis 4,3 Prozent. Diese Ergebnisse verdeutlichen, dass hardwaregestützte Sicherheitspfade auf Blackwell-Systemen hohe Performance-Aufrechterhaltung ermöglichen, sofern Framework und Umgebung gemeinsam optimiert werden. Für KI-Plattformingenieure und Organisationen, die private Inferenz in die Produktion überführen, wird betont, dass Sicherheitskonfiguration und Leistungsoptimierung als durchgängiges Full-Stack-Engineering-Projekt behandelt werden müssen. Ein isoliertes Aktivieren vertraulicher Computing-Features genügt nicht; stattdessen sind Attestierung, Workload-spezifische Benchmarking-Prozesse und frameworkseitige Anpassungen zu kombinieren. Die Verfügbarkeit von TensorRT LLM in CC-optimierter Form ermöglicht es Betreibern, sensible Sprachmodelle mit minimaler Performance-Kompromissierung auf modernen NVIDIA-Systemen zu betreiben. Unternehmen können die technischen Dokumente zur vertrauenswürdigen Computing-Architektur sowie die neuesten Framework-Veröffentlichungen als Grundlage für die eigene Produktionsplanung nutzen.
