CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读另有 1049 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 PatchBench 局部协议,评测激活补丁修复越狱的附带损伤
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读揭示类型化决策模型按选项标签而非定义规则作答
发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
重评提示注入检测器,检验基准分数对智能体部署的预测力
提出 FAITHCONFLICT,测量对齐训练导致模型静默改写相悖输入
本文系统揭示并实证分析了语言模型后训练中存在的“能力–安全–忠实度”三元冲突。
用 MMPIBench 评测智能体框架的多模态提示注入
评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
在模拟环境中复现级联失准行为并降低审计诱导开销