跳到正文
10月8日 · 周四

全部论文

找到 9 篇

另有 702 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出 DIBench,评测界面注入对移动智能体选择决策的操纵

    发表
    测试
    DoubaoSeed-1.6、Qwen2.5-VL(32B)、Qwen3-VL(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  2. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击

    发表
    测试
    UI-TARS-1.5-7B、gpt-5、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  3. 风险行为arXiv 2609.35928

    论文发现暴露模型身份标签会削弱多智能体 LLM 合作

    测量公开模型家族标签引发的多智能体派系化与合作下降

    发表
    测试
    Seed-OSS (Seed-OSS-36B-Instruct)、Gemma (gemma-4-26B-A4B-it)、GPT-OSS (gpt-oss-20b) 等 6 个
    摘要可见身份标签让异构 LLM 群体按标签结派,共识更慢、更贵,去掉标签后该行为消失。

    Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。

    深度解读完整解读
  4. 评测与基准arXiv 2606.18936

    SciRisk-Bench:面向 AI4Science 安全的风险维度感知基准

    提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全

    发表
    测试
    doubao-seed-1-8、kimi-k2.6、glm-5.1 等 14 个
    摘要SciRisk-Bench 以风险维度和学科诊断 AI4Science 安全。

    SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。

    深度解读完整解读
  5. 风险行为arXiv 2609.35291

    窄域多模态微调可诱发涌现性失配,覆盖 15 个视觉语言模型

    发现无显式危害的窄域图文微调可诱发涌现失准

    发表
    测试
    BAGEL-14B-A7B、GPT-4o、GPT-4.1 等 15 个
    摘要证实窄多模态微调可引发全面的多渠道未对齐行为转变,揭示了后训练阶段对齐被隐蔽重塑的安全隐患。

    论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。

    深度解读完整解读
  6. 防御arXiv 2609.35932

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    证明保留词元表示放大模板注入并验证分词缓解

    发表
    场景
    AI Agent
    测试
    Seed-OSS-36B-Instruct、Qwen3-8B、Qwen3-32B 等 6 个

    摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。

    深度解读完整解读
  7. 防御arXiv 2609.03438

    CONFLICTGUI 基准与 CONFLICTGUARD 框架:让多模态 GUI Agent 学会在冲突指令下终止执行

    AI 导读作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。

    发表
    测试
    UI-TARS-1.5-7B、UI-Venus-1.5-8B、OS-Atlas-Base-7B 等 10 个
    摘要ConflictGUI 暴露 GUI 智能体的执行偏向过度服从,ConflictGuard 用条件转向提高冲突终止率。

    ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。

    深度解读完整解读
已经到底了