评测与基准arXiv 2604.02947
AgentHazard:评估计算机使用智能体有害行为的基准
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
- arXiv
- 2604.02947
- 发表
- 层
- 应用层
- 攻击恶意使用
摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
另有 452 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
提出时间步感知目标条件化,改善差分隐私能源时序插补效用
作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。
提出 Intervention Score 与 DIR-R,按干预效果选择并修订遗忘参数支持
Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。