攻击arXiv 2610.03857
研究者提出 EviLLM 攻击:通过被入侵账号向 AI 代码生成流程注入漏洞
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
- arXiv
- 2610.03857
- 发表
- 层
- 应用层
- 被测模型
- GPT-4o、Llama 3.2 (3B)
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行
用演化算法构造 mind virus 并测量其在多智能体中的传播