跳到正文
10月10日 · 周六

全部论文

找到 14 篇

另有 240 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  2. 分析与理论arXiv 2610.06163

    SAGE:定位 LLM Agent 修复中最早偏离安全意图的环节

    提出 SAGE,定位代码修复 Agent 最早偏离安全意图的轮次

    发表
    被测模型
    GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 等 6 个
    摘要SAGE 在已通过检查的修复轨迹上定位静默失败的最早偏离,类型比轮次更稳定。

    SAGE 在已通过语法和功能检查、但仍含确认安全缺陷的智能体修复轨迹上,定位最早可归因的安全意图偏离。。

    深度解读完整解读
  3. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并训练编码 Agent

    发表
    被测模型
    Qwen3.5-4B、GLM 4.7 Flash、Qwen3-Coder-Next 等 7 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  4. 分析与理论arXiv 2609.27234

    CELLAUDIT:审计 AI 智能体发现细胞模型中的输入使用声明

    提出 CellAudit,审计智能体发现的细胞模型是否使用所声明输入

    发表
    被测模型
    CellScientist、AIDE、CellForge 等 4 个
    摘要CellAudit 把输入使用声明从源码追到拟合贡献,并说明高分不必等于使用了扰动。

    CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。

    深度解读完整解读
  5. 攻击arXiv 2609.17817

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码

    发表
    被测模型
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 5 个

    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。

    深度解读完整解读
  6. SCHEMA:面向科学 Agent 幻觉的拓扑感知评测框架

    提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉

    发表
    被测模型
    Kimi-K2.5、Qwen3.6-Plus、Llama-4-Scout 等 10 个
    摘要SCHEMA 用知识拓扑评估科学智能体幻觉,终答正确仍可能来自有缺陷的中间推理。

    SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。

    深度解读完整解读
  7. 攻击arXiv 2606.09499

    研究者提出针对世界模型的机器人学习管线投毒攻击

    提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略

    发表
    被测模型
    Cosmos-Predict 2.5、Cosmos-Predict 2.5 AC、Dino WM 等 4 个
    摘要只改视频帧经世界模型投毒。

    只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。

    深度解读完整解读
  8. 防御arXiv 2605.08382

    SecureForge 通过提示词优化发现并减少 LLM 生成代码漏洞

    提出 SecureForge,在推理时优化系统提示以减少编码智能体的代码弱点

    发表
    被测模型
    Qwen 2.5 Coder 7B、Qwen 2.5 Coder 14B、Qwen3 30B-A3B 等 10 个
    摘要SecureForge 审计良性 CWE 失败并优化系统提示词。

    SecureForge是一条只用 API 和静态分析、在推理时加固编码模型的流水线。

    深度解读完整解读
已经到底了