OTHER
基于散度的理性注意力大语言模型安全度量
Anh Tung Nguyen, Quanyan Zhu
- 发表年份
- 2026
- 访问权限
- 开放获取
摘要
本文提出了一种基于散度的安全度量方法,用于评估大语言模型在嵌入输入攻击下的安全性。该方法利用理性注意力模型与Transformer注意力的等价性,量化了干净与受攻击模型输出分布之间的最坏情况KL散度,并应用于GPT-2和GPT-Neo-125M模型,展示了其区分模型安全特性的能力。
关键词
large language modelssafety measuredivergencerational inattentionembedding attacks
相关论文
OTHER
📊 26,957 引用
Statistical Learning Theory
Yuhai Wu, Vladimir Vapnik
1999
OTHER
开放获取📊 20,501 引用
Fractional Differential Equations
Igor Podlubný
2025
OTHER
📊 18,993 引用
Applied Nonlinear Control
Jean-Jacques Slotine, Weiping Li
1991
OTHER
📊 13,277 引用
Genetic Programming: On the Programming of Computers by Means of Natural Selection
John R. Koza
1992