防御arXiv 2610.02432
论文提出 LLM 输入扰动鲁棒性度量,并发布 ASA 攻击与 AttestMCP 防护
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
- arXiv
- 2610.02432
- 发表
- 层
- 应用层
- 攻击者
- 黑盒
- 被测模型
- Gemma-3-27B-Instruct、Gemma-3-4B-Instruct、Llama-3.2-3B-Instruct 等 12 个
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
提出 SkillClone,仅凭良性任务交互重构闭源 Agent 技能
论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。
提出 SigLeak,从黑盒 Agent 执行轨迹推断专有技能
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型
EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。