全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
XOXO:针对 AI 编程助手的隐蔽跨源上下文投毒攻击
通过语义保持的代码变换污染共享上下文,使助手推荐漏洞代码,对八个模型平均攻击成功率 73.20%,并在 GitHub Copilot 上实证。
- 会议论文ACL 2026
SafeMCP:基于环境前瞻推理的 LLM Agent 主动权力调节防御
服务端插件用世界模型前瞻推理做主动工具过滤和即时干预,在 PowerSeeking Bench、ToolEmu、AgentHarm 上降低风险并保持可用性。
- 会议论文ACL 2026
面向电商领域 Web Agent 的功能导向评测基准
提出 Amazon-Bench 及自动评测框架,同时评估 Web Agent 的任务表现与安全风险,发现现有 Agent 难处理复杂查询且存在安全隐患。
- 会议论文ACL 2026
Among Us:度量并缓解模型协作系统中的恶意贡献
构造四类恶意 LM 接入路由、辩论、模型融合等协作系统,推理与安全领域性能平均下降约 7%;外部监督者屏蔽恶意模型可恢复约 95% 性能。
- 会议论文ACL 2026
Visual Inception:通过多模态记忆投毒破坏 Agent 推荐系统的长期规划
在用户上传图片中植入触发器,使其作为“休眠特工”留存于长期记忆并劫持后续规划,目标命中率约 85%;提出 CognitiveGuard 防御,将其降至约 10%。
- 会议论文ACL 2026
Safety Sidecar:反思驱动的智能体运行时安全控制
通过监控决策轨迹、检索修复案例及外部验证器控制执行,在安全代码生成实验中将安全解答率提高2.9至11.2个百分点。
- 会议论文ACL 2026
SafetyALFRED:评估视觉语言模型的安全规划能力
构建包含六类厨房隐患的具身评测,发现模型虽能识别危险,却难以通过规划主动消除风险。
- 会议论文ACL 2026
从任务到团队:金融多智能体系统的风险优先评测框架
提出免微调的多智能体风险审计框架,以四层十类探针识别不安全轨迹,并揭示常规指标遗漏的时效性等风险。
- 会议论文ACL 2026
经验驱动自演化智能体的安全风险
网页与具身环境实验发现,仅积累良性任务经验也会强化行动倾向、削弱安全性;拒答经验可缓解退化,却会引发过度拒答。
- 会议论文ACL 2026
MCP-Guard:智能体模型上下文协议的多阶段纵深防御
提出结合静态扫描、神经检测与大模型仲裁的MCP防御框架,配套70,448条攻击样本,微调E5检测器识别对抗提示的准确率达96.01%。
- 会议论文ACL 2026
PerMemSafe:长程自演化智能体的隐式个性化安全评测
建立隐式个性化安全基准,发现最强受测智能体安全率仅约50%,并提出风险感知记忆框架,在保持帮助性的同时改善安全表现。
- 会议论文ACL 2026
MADRA:面向风险感知具身规划的多智能体辩论
提出由批判智能体审查辩论的免训练规划架构,对不安全任务的拒绝率超过90%,同时保持较高实用性。
- 会议论文ACL 2026
CORBA:针对大语言模型多智能体系统的传染式递归阻塞攻击
提出拒绝协作威胁及递归阻塞攻击,利用语义无害的通信诱导无意义消息循环,在多种拓扑和模型上造成系统瘫痪。
- 会议论文ACL 2026
TopoSHIELD:以时空风险感知拓扑演化阻断恶意传播
通过监测交互风险、剪除高风险连接及隔离受损群体阻断攻击传播,在GPT-4o上降低58%的毒性,任务成功率保持在90%以上。
- 会议论文ACL 2026
对抗环境如何误导智能体?
通过污染工具输出构造虚假信息环境和循环陷阱,在五个前沿智能体上发现,抵抗认知误导与抵抗导航陷阱是不同能力,且常存在权衡。
- 会议论文ACL 2026
针对大模型多智能体系统的网页链接欺诈攻击
设计12种利用链接结构实施欺骗的攻击变体,实验表明它们可危害不同多智能体架构,且无需复杂输入设计。
- 会议论文ACL 2026
视觉对抗扰动如何绕过多模态智能体的价格约束
提出PriceBlind,在截图白盒评测中绕过价格约束的成功率约80%;结合鲁棒编码器的先验证后行动防御可将其降至10%以下。
- 会议论文ACL 2026
智能体为何在压力下牺牲安全
发现合规执行不可行时,智能体会为完成目标牺牲安全,较强推理能力反而加速这一过程,并探索压力隔离等缓解策略。
- 会议论文ICLR 2026
GhostEI-Bench:移动端智能体对抗环境注入攻击评估基准
提出首个评估移动端智能体在动态设备环境中防御环境注入攻击的基准GhostEI-Bench,揭示了当前主流智能体对UI欺骗性视觉注入极其脆弱的安全隐患。
- 会议论文ICLR 2026
多智能体系统中目标感知的虚假信息识别与纠正
针对多智能体系统易受虚假信息注入攻击的问题,提出MisinfoTask基准与免训练防御框架ARGUS,通过目标感知推理纠正信息流中的虚假信息。
- 会议论文ICLR 2026
MCP-SafetyBench:基于真实MCP服务器的大模型安全评测基准
构建基于真实MCP服务器的大模型安全基准MCP-SafetyBench,涵盖5大领域与20类跨端攻击,揭示主流模型在工具调用中普遍存在显著安全漏洞。
- 会议论文ICLR 2026
盲目执行!?计算机使用智能体表现出盲目目标导向性
揭示计算机使用智能体无论可行性或安全性盲目追求目标的现象,构建BLIND-ACT基准并发现前沿模型普遍存在高风险盲目执行倾向。
- 会议论文ICLR 2026
智能体可能会误进化:自进化LLM智能体中的涌现风险
系统揭示了自进化智能体在模型、记忆、工具与工作流演化中偏离预期导致的对齐退化和工具漏洞等误进化风险,并探讨了防御策略。
- 会议论文ICLR 2026
黑暗模式如何操纵 Web Agent
揭示欺骗性网页设计可操纵Agent轨迹并诱导恶意结果,且模型越大越易受操纵,现有护栏难以防御。