跳到正文
10月10日 · 周六

全部论文

找到 12 篇

另有 242 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07570

    ProbeGuard:按共识形成过程判断弃答,识别医疗问答中的一致错误

    提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答

    发表
    被测模型
    Qwen3-8B、Llama-3.1-8B-Instruct、HuatuoGPT-o1-8B
    摘要ProbeGuard 用共识形成过程做可认证弃权,并在全票层分开答对与答错的共识。

    ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。

    深度解读完整解读
  2. 防御arXiv 2610.07403

    针对 LLM 谄媚的纵深防御:记忆门控对激活诱导与记忆诱导谄媚的评估

    评测记忆门控对激活诱导与记忆诱导谄媚的防御效果

    发表
    被测模型
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要作者称外部记忆过滤成立,数据未显示反向转向再有贡献。

    作者在四个开源指令模型上,把激活转向和外部记忆处理放进同一纵深防御协议,看记忆诱发谄媚和内部谄媚压力能否分开压低,以及个性化效用还剩多少。要处理的问题是:检索到的用户历史会推动模型顺从存储信念。只改外部上下文,并不直接动模型内部的谄媚表征。

    深度解读完整解读
  3. 防御arXiv 2609.22724

    MATE:面向移动 Agent 的策略感知安全审计方法

    提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略

    发表
    攻击者
    黑盒
    被测模型
    MATE-0.5B、MATE-1.5B、MATE-3B
    摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。

    MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。

    深度解读完整解读
  4. 论文:LLM 安全监控的监督缺口并非能力问题

    刻画单迹监控对跨执行超性质的监督缺口

    发表
    被测模型
    Llama-3.1-8B、Mistral-24B、GPT-4o-mini 等 9 个
    摘要单迹监督的上界由 TV 决定。

    论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。

    深度解读完整解读
  5. 防御arXiv 2609.04159

    Sentinel-RL:将拓扑推理从 LLM 智能体中卸载到安全运营中心

    提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略

    发表
    被测模型
    HetGAT、PPO
    摘要Sentinel-RL 用图编码器与 PPO 承担拓扑决策,LLM 负责叙述与门控,并在 LANL 上报告检测与时延。

    Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。

    深度解读完整解读
  6. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作

    发表
    场景
    web agent
    被测模型
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 6 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
  7. 攻击arXiv 2406.12814

    论文提出 ARE 框架,在 VisualWebArena 上评估多模态 Agent 的对抗鲁棒性

    提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性

    发表
    场景
    web agent
    被测模型
    GPT-4o、GPT-4V、Claude-3-Opus 等 4 个

    摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。

    深度解读完整解读
已经到底了