首页 /研究 /基于散度的理性注意力大语言模型安全度量
OTHER

基于散度的理性注意力大语言模型安全度量

Anh Tung Nguyen, Quanyan Zhu

发表年份
2026
访问权限
开放获取

摘要

本文提出了一种基于散度的安全度量方法,用于评估大语言模型在嵌入输入攻击下的安全性。该方法利用理性注意力模型与Transformer注意力的等价性,量化了干净与受攻击模型输出分布之间的最坏情况KL散度,并应用于GPT-2和GPT-Neo-125M模型,展示了其区分模型安全特性的能力。

关键词

large language modelssafety measuredivergencerational inattentionembedding attacks

相关论文

查看 OTHER 分类全部论文