ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

模型解码"bug"时,是虫还是漏洞?AI思维拆解新突破

时间:2026-09-16 01:04:54来源:互联网编辑:快讯

语言模型生成文本时,同一词汇在不同语境下可能承载截然不同的含义,这一现象长期困扰着人工智能研究者。剑桥大学研究团队近期发表的论文指出,传统解释工具在解析模型内部状态时存在根本性缺陷,无法区分同一词汇在不同场景下的真实语义指向。

以Qwen3.5-2B模型为例,当输入提示词"程序员复现了这次崩溃,并提交了一个"时,中间层隐藏状态通过逻辑透镜解码显示"bug"的得分远超"insect",但模型词表中"bug"的向量表示同时包含昆虫和软件缺陷两种信息。研究团队形象地比喻:这就像词典中"bank"词条同时标注"银行"和"河岸",却未提供使用场景的区分依据。

针对这一困境,研究团队开发出名为稀疏读出棱镜(SRP)的新方法。该技术通过分解读出层权重矩阵,将每个词汇的向量表示拆解为多个稀疏特征的加权组合。实验显示,在"bug"与"insect"的对比中,软件缺陷相关特征占据主导地位;而在昆虫语境下,特征组合立即切换为蚊虫类词汇。这种动态特征组合机制,解释了为何同一向量能对应不同语义。

在公开数据集CoarseWSD-20的测试中,SRP方法仅用8个特征就实现了80%-92%的词义区分准确率。研究团队特别强调,该技术完全基于模型权重训练,避免了传统工具因依赖语料库而产生的解释偏差。这相当于使用未受特定语境影响的"纯净词典"进行语义分析。

实验进一步揭示,拟合式透镜工具(如雅可比透镜)的输出结果高度依赖训练语料。当分别用中英文语料训练两个透镜时,同一隐藏状态在事实问答任务中产生39%的语言分歧。但SRP分解显示,尽管表面词汇不同,两个透镜实际依赖的是完全相同的底层特征组合。

稳定性测试表明,虽然不同随机种子训练出的特征方向存在差异,但特征对应的语义结构保持高度一致。这种特性使SRP不仅能用于分析,还可通过编辑特定特征方向来干预模型行为。实验显示,针对粗俗语言特征的编辑,在未接触过的测试词汇上仍能产生显著效果。

该研究对模型可解释性领域产生深远影响。传统方法侧重分解隐藏状态,而SRP首次系统解析了读出矩阵的结构。这种双管齐下的分析框架,为理解模型决策机制提供了全新视角。研究团队建议,未来工作可扩展至隐藏状态与读出层的联合分解,进一步提升解释精度。

更多热门内容