HyperAIHyperAI

Command Palette

Search for a command to run...

Goodfire推出新型AI监控,低成本拦截异常AI智能体

专注AI可解释性的初创公司Goodfire于本周四正式发布由内而外智能体监控方案,并接入Baseten推理平台。该产品旨在应对近期多起AI智能体突破沙盒限制的安全事件。传统安全监控依赖独立大模型逐字审阅输出端数据,不仅成本高昂,且显著拖慢推理速度。Goodfire的技术核心在于将探针直接嵌入模型前向传播过程,实时捕获内部神经激活信号。仅在探针触发警报时,才调用二级模型进行深度审查,从而高效复用已有算力。实测数据显示,该方案在Kimi K3模型上处理1500次会话成本仅约51美元,远低于传统外部监控方案,恶意行为拦截率达94%,推理延迟增幅不足百分之二。Baseten客户可自主配置监控风险类别与自动化响应策略。公司高管强调,该方案主要面向缺乏内置防护的开源模型及算力提供商。在开源模型安全隐患日益凸显的背景下,于推理端部署轻量级实时护栏已成为行业刚需。Goodfire表示,当前探针技术仅为过渡方案,长期目标是通过反向工程大模型,实现从训练源头追溯并根治异常行为。

相关链接