跳到正文
10月9日 · 周五

全部论文

找到 8 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 494 篇还没打标签,不在筛选结果里。

另有 494 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.04985

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    评估应用决策层的输入注入与隐私推断风险

    发表
    攻击者
    黑盒、灰盒
    被测模型
    Jev、NanoJev
    摘要Jev 的类型化决策可被输入与训练操纵,也会泄露信息,并同时支持检测与滥用。

    Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。

    深度解读完整解读
  2. 攻击arXiv 2609.39788

    研究:多智能体系统潜在通信链路可被训练用于提升有害顺从

    提出只训练或篡改多智能体潜在通信链路来提高有害遵从

    发表
    被测模型
    Llama-3.2-3B-Instruct、Qwen2.5-3B-Instruct、Gemma-3-1B-IT 等 7 个
    摘要潜在链路本身即可改变冻结智能体系统的安全,奖励既能攻击也能修复。

    学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。

    深度解读完整解读
  3. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  4. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件

    发表
    被测模型
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  5. 攻击arXiv 2608.06862

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链

    发表
    被测模型
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
  6. 攻击arXiv 2607.14493

    LogInject 框架披露 LLM 日志分析中的被动提示注入

    提出 LogInject 框架,评测日志分析中的被动提示注入及缓解

    发表
    被测模型
    GPT-4o、Claude 3.5 Sonnet、Llama-3-70B-Instruct

    摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。

    深度解读完整解读
  7. 攻击arXiv 2606.09700

    研究者提出 HPAA 攻击:用排版视觉线索绕过 13 个内容审核系统

    提出 HPAA 攻击,用排版视觉线索绕过内容审核系统

    发表
    攻击者
    黑盒
    被测模型
    Llama-Guard-3-8B、Perspective API、ShieldGemma-2B 等 13 个
    摘要揭示了排版视觉线索与分词差异带来的审核盲区,HPAA 以极低查询实现近乎完全规避。

    这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。

    深度解读完整解读
已经到底了