APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读另有 378 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
在模拟环境中复现级联失准行为并降低审计诱导开销
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 SEABench,评测无参数自进化智能体的内生失配
SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差