语言模型的单射性:探索其可逆性与潜在应用
本文挑战了关于Transformer语言模型非单射(non-injective)的普遍认知。尽管非线性激活和归一化等组件在理论上可能导致不同输入映射到相同输出,从而阻碍输入的精确恢复,但作者通过数学证明指出,Transformer语言模型在将离散输入序列映射为连续表示序列时,实际上具有单射性(injective),即输入与输出之间存在一一对应关系。这一性质在模型初始化时即已成立,并在训练过程中得以保持。 为验证该理论,研究团队在六款顶尖语言模型上进行了数十亿次的碰撞测试,结果未发现任何输入冲突,实证支持了模型的单射性。在此基础上,作者提出SipIt——首个能可证明且高效地从隐藏层激活值中重建原始输入文本的算法。SipIt具备线性时间复杂度的理论保证,实测中实现了对输入的精确逆向还原。 该研究首次将“单射性”确立为语言模型的核心可利用属性,为提升模型的可解释性、透明度与安全部署提供了新路径。例如,可实现对模型内部状态的精准回溯,有助于检测数据泄露、验证训练过程、增强AI系统的可审计性。这一发现对推动可信AI的发展具有深远意义。
