全部论文
另有 428 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
- 防御arXiv 2610.00348
NEEDLE:通过权重正交化移除 LLM 后门
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
- arXiv
- 2610.00348
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
- 防御arXiv 2609.00786
MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
- arXiv
- 2609.00786
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要MROP 不重训练,在发射端纯化补丁后门。
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
- 可解释性arXiv 2609.07746
LLM Forensics:用稀疏自编码器定位并控制后门触发机制
用 SAE 定位后门触发机制并分离检测与因果控制
- arXiv
- 2609.07746
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击投毒与后门
摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。
已经到底了