核心观点 - 提出一种名为稀疏权重分解(SWD)的新方法,直接从预训练权重中“拆”出可干预单元,无需训练独立的替代网络,以更低成本实现大模型机制可解释性 [5][6][48] 方法背景与问题 - 传统机制可解释性研究需先训练新的稀疏表示(如Transcoder、稀疏特征模块)来近似原模型,带来额外训练成本和替换误差 [1] - 训练型替代表示需针对不同模型、层和checkpoint分别拟合,使大规模系统性回路分析困难 [3] - 理想方案应同时保持原模型行为、提供可独立干预单元,并能低成本从已有权重中构造 [4] SWD方法原理 - 将稠密权重矩阵W分解为两个稀疏矩阵A和B,使W≈AB,共享m个中间维度作为瓶颈单元 [6][11] - 每个瓶颈单元是一条固定的rank-one读写路径,可独立评分、选择和消融 [6][12] - 使用少量校准文本优化分解前后输出误差,通过硬阈值维持非零预算并重新拟合保留权重 [12] 与SVD的对比优势 - SVD成分的读方向和写方向通常稠密,即使保留少数成分仍可能连接几乎所有输入输出维度 [17] - SWD对每个单元施加稀疏读写连接,少量单元对应少量活跃连接 [18] - 精确还原原权重的full-rank SVD和Random-B对照,需更多活跃连接才能达到与SWD相同的任务表现 [20][21] 数据效率与保真度 - 在GPT-2 Small第8层mlp.c_proj单矩阵实验中,SWD仅用数千个校准token进入低CE误差区间,而Transcoder等基线需约10⁶量级token [24] - 在达到匹配替换保真度时,SWD使用的数据不到训练型替代表示的1% [7][24] - 该趋势在Qwen2.5-0.5B、1.5B、3B和Qwen3.5-27B上得到验证 [24][26] 任务回路因果测试结果 - 在GPT-2 Small的GreaterThan、IOI、Docstring和Gendered Pronoun四项任务上,SWD达到相同充分性或必要性要求时,通常比Transcoder和VPD-Recon-CI需要更少的单元和活跃连接 [29] - 将平均激活消融替换为零消融后,优势依然保持 [30] - 该结果扩展至Qwen2.5和Qwen3.5-27B [31][34] 模型规模与全模型扩展 - 单矩阵替换和回路抽取流程从GPT-2扩展至Qwen2.5-0.5B、1.5B、3B,最终至Qwen3.5-27B [36] - 在27B模型第31层mlp.down_proj上,SWD以显著更少数据达到低CE delta,并以更少活跃连接达到充分性和必要性目标 [36] - 将GPT-2 Small全部48个注意力和MLP权重矩阵替换为稀疏分解,SWD-FT在连接数不变下将模型CE从3.90降至3.44,略优于稀疏预训练基线的3.45 [36] - SWD-FT总计使用约2,060万个token,而稀疏预训练基线使用28.84亿个token,前者不到后者的1% [37] Zero-data版本 - 完全不使用校准文本,直接最小化原权重与分解权重之间的Frobenius误差 [37] - Zero-data SWD在权重空间中更接近原矩阵,其瓶颈单元仍能抽取出有效任务回路 [38] 语义模式与定向编辑 - 在GreaterThan任务中,GPT-2 Small第6、8、10层六个高排名瓶颈单元中,四个集中响应数字、年份、数量或度量信息,两个对应标点、句法和命名实体 [40][42] - 定向编辑实验:筛选瓶颈单元c205,将读方向诱导的rank-one更新施加到原始稠密GPT-2权重上,在提示词“The opposite of up is”中,正确答案down相对干扰答案left的logit margin提高0.216,七条无关事实提示上平均末token KL仅为4.02×10⁻⁵ [44] - 该单单元方向测得的副作用低于随机单元和rank-4 LoRA对照 [45]
至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%
量子位·2026-08-14 15:47