可解释性arXiv 2610.09000·10月7日研究定位 LLaMA-2-7B-Chat 安全敏感参数定位安全敏感参数并稀疏改动权重以削弱安全对齐arXiv2610.09000发表10月7日层模型层场景模型与 API被测模型LLaMA-2-7B-Chat攻击模型篡改风险拒答失当深度解读完整解读
可解释性arXiv 2610.05295·10月4日研究用因果追踪区分间接提示注入中的可读信号与有效干预用因果追踪区分间接提示注入中的角色可读性与有效干预arXiv2610.05295发表10月4日层应用层场景AI Agent被测模型Qwen-2.5-7B、Qwen-2.5-1.5B、Llama-3.1-8B 等 8 个攻击提示注入摘要作者称源角色先于强工具选择效应可读,有效编辑还取决于位置、长度和方向来源。在权重固定的白盒模型上,源角色可以先被读出。沿相关方向的编辑是否改变行为,要在目标位点上另测。。深度解读完整解读