跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 9 条 · 共 9 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 2
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源502新闻与研究603细分与主体7来源:论文追踪论文追踪1 条材料来源:tl;dr sectl;dr sec2 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御1 条材料来源:Adversa AIAdversa AI1 条材料来源:SPY LabSPY Lab1 条材料论文:研究提出人机审计协作框架 HAAC,并在对话购物 Agent 上验证论文2026-09-21研究提出人机审计协作框架 HAAC,并在对话购物 Agent 上验证动态:tl;dr sec #335:提示注入即角色混淆、PHP 生态安全与新版 MCP 规范动态2026-07-02tl;dr sec#335:提示注入即角色混淆、PHP 生态安全…动态:tl;dr sec 第345期:漏洞传闻即被利用、版本控制 DFIR 与自适应 Agent 蠕虫动态2026-09-10tl;dr sec 第345期:漏洞传闻即被利用、版本控制 DFIR 与自适应 Agent 蠕虫论文:综述提出智能体 AI 安全的跨维度威胁分类 T={S,B,P,A}论文2026-09-20综述提出智能体 AI 安全的跨维度威胁分类 T={S,B,P,A}动态:Adversa AI 汇总 2026 年 8 月 AI 编码 Agent 安全资源动态2026-08-03Adversa AI 汇总 2026 年 8 月 AI 编码Agent 安全资源动态:ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击动态2023-06-30ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击方向:Agent 安全Agent 安全5方向:其他方向其他方向3方向:观点与讨论观点与讨论6方向:红队红队5方向:供应链安全供应链安全2方向:提示注入提示注入2方向:越狱与攻击越狱与攻击2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。3 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 9 条
  • 论文论文追踪

    研究提出人机审计协作框架 HAAC,并在对话购物 Agent 上验证

    研究者提出 Human-Agent Audit Collaboration(HAAC)工作流与系统,用于在 AI 审计中划分人与 AI 智能体的分工,让智能体承担探索、评估、报告和复核,同时在需要情境判断的环节保留人类监督。团队将该框架实例化到对话购物 Agent 上并开展两项研究:71 名审计员的实验显示,AI 辅助提高了攻击成功率并扩大了探索范围,同时也影响了后续攻击方式,并增加了审计员对 AI 生成评估与报告的依赖。对负责任 AI 从业者的访谈表明,可落地的审计需要覆盖范围可见、攻击轨迹可复现,以及对审计智能体本身进行评估。

  • 动态tl;dr sec

    tl;dr sec #335:提示注入即角色混淆、PHP 生态安全与新版 MCP 规范

    本期 tl;dr sec 周报汇总了多条 AI 与安全动态。ICML 2026 论文将提示注入解释为角色混淆,作者用线性探针测量模型对 token 角色的内部判断,发现推理风格文本即使被包在用户标签里也被当作模型自身想法,据此设计的 CoT Forgery 攻击把前沿模型上的攻击成功率从接近零提升到约 60%。Akamai 团队分析即将发布的 MCP 2026-07-28 规范,指出其转向无状态架构并强制 OAuth 2.1 与 PKCE,同时带来跨 Agent 工作流劫持、_meta 元数据操纵、desync 攻击、存储型 XSS 和异步任务拒绝服务等新攻击面。PHP 基金会披露一个月生态安全工作,用 AI 模型扫描 300 多个 Composer 包,已产出近 100 个公开修复。

  • 动态tl;dr sec

    tl;dr sec 第345期:漏洞传闻即被利用、版本控制 DFIR 与自适应 Agent 蠕虫

    tl;dr sec 第345期汇总了多条 AI 与安全交叉动态。Anil Madhavapeddy 为 OCaml 的 cohttp 6.3.0 提交路径遍历修复后十分钟内,就有探测流量以相同漏洞模式访问其服务器;他先用 Claude 分析代码被安全拦截拒绝,改由 DeepSeek V4 Pro 仅凭模糊描述在一分钟内写出利用代码,说明仅凭传闻就足以让 Agent 自行找到漏洞,利用时间已早于补丁发布。Wiz 发布覆盖 GitHub、GitLab、Bitbucket 和 Azure DevOps 的版本控制 DFIR 海报,指出 GitHub 仅保留 Git 事件 7 天、GitLab 默认不记录 Git 操作、只有 GitHub 提供 API 请求日志且需显式配置,且这些遥测都不追溯。

  • 论文arXiv:越狱、提示注入、投毒与防御

    综述提出智能体 AI 安全的跨维度威胁分类 T={S,B,P,A}

    一篇综述对 2022 至 2026 年间发表的 66 项研究做结构化梳理,提出跨维度表示 T={S,B,P,A},把受影响的系统面、交互或信任边界、被违反的安全属性与实证考察的架构关联起来。作者分析了 22 项有制品支撑的红队研究以及 11 个代表性安全基准,发现证据集中在提示词与推理、记忆和工具调用类攻击,且多为单智能体场景;持久化、人机交互、复杂多智能体、系统性和长时程威胁的覆盖较少。作者强调这些结论描述的是所选语料而非全部实证研究,并指出指标异构、自适应防御评估有限、架构分布不均和执行状态捕获不完整制约了可比性与可复现性,据此提出 13 个开放研究问题。

  • 动态Adversa AI

    Adversa AI 汇总 2026 年 8 月 AI 编码 Agent 安全资源

    Adversa AI 汇总了 2026 年 8 月的 19 份 AI 编码 Agent 安全资源,按攻击技术、防御、漏洞、事故等类别分组。攻击侧包括 MOSAIC 用 CLI 命令组合达到 96.59% 攻击成功率、HalluSquatting 抢注模型幻觉出的技能或包名、以及通过 README 和 requirements 文件发起的安装期供应链攻击。

  • 动态SPY Lab

    ChatGPT 时代的对抗样本:聊天机器人攻击为何不同于传统对抗攻击

    SPY Lab 撰文指出,传统对抗样本研究的两条基本原则(扰动不可感知、依赖梯度优化)在针对聊天机器人的攻击中基本不成立。越狱攻击由用户自己发起,提示注入中的第三方文本用户通常看不到,因此攻击文本无需保持不可感知;当前最强的越狱手段是手工试错的社会工程式指令,而非优化算法。作者在近期论文中测试了 ARCA 和 GDBA 两种优化攻击,针对 GPT-2、LLaMa 和经过拒答微调的 Vicuna,结果显示优化攻击对无防御模型部分有效,但对 Vicuna 多数失败,且即使存在可触发目标输出的提示词也找不到。

  • 动态Embrace The Red

    Embrace The Red 宣布 2025 年 AI 漏洞月,将披露 20 余篇编码 Agent 漏洞

    安全研究者 Johann Rehberger 宣布启动 2025 年 AI 漏洞月(Month of AI Bugs),8 月将在其博客发布 20 余篇针对主流智能体系统的漏洞分析,重点聚焦 AI 编码 Agent。作者称过去一年审查的每个 AI 编码 Agent 都存在漏洞,均已向对应厂商负责任披露,部分厂商数天内修复,也有厂商数月未回应、部分问题至今未缓解,还有厂商完全停止回复。

  • 动态Adversa AI

    Adversa AI 汇总 2026 年 9 月 AI 编码智能体安全资源

    Adversa AI 汇总了 2026 年 9 月的九项 AI 编码智能体安全资源,按攻击技术、漏洞、防御框架和红队研究分类。GhostJacking 把 WAF 拦截日志变成投递通道,在厂商推荐的 Claude Code 配置上成功率达 90%,侦察显示超过 15000 家组织处于影响范围。Black Hat 2026 披露 Anthropic、Google 和 OpenAI 各自发布的默认 GitHub Actions 配置可被单个未认证 issue 攻破并导致远程代码执行,其中 Gemini CLI 漏洞被 Google 评为 CVSS 10.0。

  • 动态Can.ac

    工具调用的细枝末节:从邮件分类到 Claude 猜数字实验

    作者用 Claude 做猜数字实验,对比五种工具接口(单次比较、批量、打包、向量、纯 emoji 回复)的效率与胜率,结果纯 emoji 方案反而比前沿模型少用约 2 倍 token。文章指出大语言模型每次只输出下一个 token 的概率分布,所谓"模型决定调用工具"并不存在,工具 schema 只是作为开发者消息拼进上下文,校验实际发生在调用方代码里。