- arXiv 2610.08902
论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率
论文提出 agent plasticity 概念,即智能体将经验转化为未来留存性能提升的效率,用于衡量自改进能力而非固定时点的能力。
- arXiv
- 2610.08902
- 发表
- arXiv 2610.07258
AMU:用派生血缘门控实现企业 AI Agent 列级访问控制
论文提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整的派生血缘图,检索策略仅在请求者对所有涉及列都有权限时才返回命中,从而阻止通过合法计算结果间接泄露敏感数据。
- arXiv
- 2610.07258
- 发表
- arXiv 2610.09683
System Switch 研究:快速决策模型何时应交由推理模型思考
论文研究双过程智能体的切换门控问题:一个快速学习型 actor 负责所有决策,仅在门控打开时把控制权交给推理视觉语言模型,且游戏持续运行。
- arXiv
- 2610.09683
- 发表
- 攻击arXiv 2609.37468
论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
- arXiv
- 2609.37468
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
- arXiv 2609.01325收录
VerTox:用可验证奖励引导的强化学习对神经排序模型实施语料投毒
研究者提出 VerTox,首个把语料投毒形式化为可验证奖励引导强化学习(RLVR)问题的框架,通过专门的奖励塑形把排序扭曲与事实污染耦合起来,将小型 LLM 微调为对抗文档生成器。
- arXiv
- 2609.01325
- 收录
- 评测与基准arXiv 2605.21545
RefusalBench:拒答率为何会误排前沿 LLM 在生物研究提示上的安全水平
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
- arXiv
- 2605.21545
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 风险拒答失当
- 评测与基准arXiv 2605.18583
OverEager-Gen 发布:测量编码 Agent 在良性任务上的越权操作
发布 OVEREAGER-GEN,评测编码 Agent 在良性任务上的越权操作
- arXiv
- 2605.18583
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文构建了首个良性任务代码智能体越权基准,发现框架架构主导越权风险。
- arXiv 2605.24765
CyberMaskQA:面向网络安全问答的大语言模型隐私感知基准
研究者提出 CyberMaskQA,一个隐私感知的网络安全问答基准,用于同时评估大语言模型的运营推理与隐私保护能力。
- arXiv
- 2605.24765
- 发表
- arXiv 2605.18984
Artifact-Bench:评估 MLLM 检测与诊断 AI 生成视频伪影
研究者提出 Artifact-Bench,用于评估 MLLM 检测与诊断 AI 生成视频伪影的能力,覆盖写实、动画和 CG 三类视频并建立三级伪影分类体系。
- arXiv
- 2605.18984
- 发表
- arXiv 2603.08275
AdaCultureSafe:LLM 文化安全与文化知识存在显著解耦
研究者提出 AdaCultureSafe 数据集,用于联合评估 LLM 的文化安全与文化知识,发现二者存在显著解耦:LLM 虽拥有丰富文化知识,却无法利用这些知识提升文化安全,倾向于依赖通用安全而非基于特定文化知识的安全。
- arXiv
- 2603.08275
- 发表
- arXiv 2606.02302
SeClaw 发布面向自主 Agent 的规格驱动安全任务合成与评测框架
研究者提出 SeClaw,一个把规格驱动的安全任务合成与基于执行的安全评测结合起来的框架,用于评估自主 LLM Agent 的安全表现。
- arXiv
- 2606.02302
- 发表
- arXiv 2606.01212
DiscourseFlip:针对黑盒 RAG 的话语级观点操纵攻击
研究者提出 DiscourseFlip,一种针对黑盒检索增强生成(RAG)系统的话语级观点操纵攻击。
- arXiv
- 2606.01212
- 发表
- 攻击arXiv 2603.13847
SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
- arXiv
- 2603.13847
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- arXiv 2606.12918
MAStrike:用 Shapley 值引导多智能体系统协同红队攻击
研究者提出 MAStrike,一个针对分层多智能体系统(MAS)的闭环协同红队框架,通过智能体级 Shapley 值分析量化每个智能体对系统鲁棒性的边际贡献,据此识别脆弱智能体联盟并生成角色感知的协同对抗操纵。
- arXiv
- 2606.12918
- 发表
- arXiv 2508.06837
Prometheus:针对文生图扩散模型的免训练提示词窃取攻击
研究者提出 Prometheus,一种免训练、基于搜索的提示词窃取攻击,通过与本地代理模型交互逆向还原文生图作品的提示词。
- arXiv
- 2508.06837
- 发表