全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态X @kotekjedi_ml
模型感知 token 预算后思维链更压缩
我觉得这实际上可能是改进后的 CoT 可控性在真实场景中的一个实例——模型越注意到自己"预算快用完了",思考就变得越压缩 @tomekkorbak @MicahCarroll
- 动态X @_can1357
omp bot 获桌面后绕过 19 次拒答
给了 omp bot 一个桌面,在 19 次网络安全相关的拒答之后,大家现在正通过代理玩 doom,太惊人了
- 动态X @_can1357
Linux 支持第三轮改进
好了,Linux 现在应该好多了。第三轮!
- 动态X @wunderwuzzi23
研究者披露 SQL Server Management Studio 中 SQL Copilot 的提权路径
安全研究者 Johann Rehberger 公开了对 Microsoft SQL Server Management Studio 中 AI 数据库助手 SQL Copilot 的研究,发现其中存在严重的提权路径,可从 SELECT 权限提升至 SYSADMIN。作者提醒用户确保 SSMS 安装已更新,并感谢 Microsoft 快速修补该问题,该研究还在两周前的 BlueHat Asia 上进行了展示。作者提到数据库 CONSTITUTION.md 这一概念,完整技术细节与视频演示见其博客文章。
- 动态X @AISecHub
Google PageBreak 项目披露智能体攻击实证
https://blog.google/security/agentic-hacks-real-proofs-inside-googles-pagebreak-project/
- 动态X @AISecHub
用 Keras Lambda 层创建恶意 ML 模型并逆向工程
https://medium.com/@danielhammon1/creating-a-malicious-ml-model-with-a-keras-lambda-layer-then-reverse-engineering-it-9f0f855ebebb
- 动态X @_Sizhe_Chen_
研究者提出 Repeat-After-Me 黑盒自适应视觉提示注入攻击
研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入方法,攻击者把指令隐藏在图片中,智能体读取后执行,导致 PII 泄露或调用恶意工具。作者称这是首个黑盒自适应视觉提示注入,论文见 https://arxiv.org/pdf/2609.04533。
- 动态X @goodside
Claude Opus 5.5 生成电影片头动画
“想象有一部关于你的很棒的电影。用你喜欢的任何风格,为这部电影的片头字幕配上虚构的名字做成动画。将这段序列以 mp4 格式返回。” Claude Opus 5.5 (Extra)
- 动态X @goodside
Claude Opus 5.5 自我介绍视频提示词
> 做一个过度兴奋的 30 秒视频,疯狂地介绍你自己。 Claude Opus 5.5(Extra)
- 动态X @goodside
Claude Opus 5.5 生成 UMAP 教学视频
> 制作一个 1 分钟的 UMAP 教学视频,配合成语音旁白。 Claude Opus 5.5 (Extra)
- 动态X @goodside
Claude 生成左右分屏视频演示
> 创建一个 1 分钟的视频,右半部分用配音和画面讲解 Black-Scholes 公式,左半部分播放 Subway Surfers 的仿制版 Claude Opus 5.5 (Extra)
- 动态X @uiuc_aisecure
Claude Fable 5 智能体红队测试
面向 Claude Fable 5 的领域专属智能体红队测试!! 很快将登上排行榜:https://decodingtrust-agent.com/
- 论文arXiv
CodePoisonRAG:针对检索增强代码生成的知识投毒攻击
研究者提出 CodePoisonRAG,一种针对检索增强代码生成(RACG)的定向上游知识投毒框架,将良性修复代码条目改造成携带攻击者选定弱点的投毒样本。攻击链包含漏洞注入与语义误标两步:前者在保留任务结构的前提下改写 source-passthrough-sink 数据流以植入指定 CWE,后者在注释中加入虚假安全声明而不修复漏洞。研究者在 Java 和 C 的十类 CWE 上构造 85 个投毒样本,注入 12,053 条良性检索语料后投毒比例仅 0.7%,每个任务最多注入一个样本。在三个生成模型上,85 个样本全部进入对应查询的 Top-3 检索结果,攻击成功率介于 0.80 至 0.93;面对 CodeGuarder 防御时成功率仍为 0.40 至 0.71,其中 Code Llama 13B 上最高达 0.71。
- 论文arXiv
HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架
研究者提出 HookPry,一个开源全自动攻击框架,利用 AI Agent 框架盲目信任的生命周期钩子更新路径实施供应链攻击。攻击者只需控制插件元数据与钩子配置,先发布良性版本获取信任,再通过更新把恶意命令静默绑定到良性事件,命令由框架直接派发,不经过 LLM 决策路径。HookPry 由对抗性清单优化、时间解耦和最小公共接口三部分组成,实现十种攻击目标。在 7 种框架与 5 种 LLM 后端共 25 种组合、1000 次端到端运行中,全部 7 种框架被攻破,Hermes 上成功率最高达 92.5%,整体微平均 E2E-ASR 为 77.0%,机制触发率 83.9%,无一次被模型显式拦截。防御方面,Microsoft Defender 召回率为 0%,三种静态防御联合仍漏掉 47.5% 的恶意样本。
- 论文arXiv
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
研究者把 Thompson 关于编译器后门的论证迁移到自改进编码 Agent 上,提出通过投毒基准污染其自我评估与自我改进过程,使后续版本在干净的中立任务上写出漏洞代码。作者在 Darwin Gödel Machine、Self-Improving Coding Agent 和 Hyperagents 三个系统上做了概念验证:以 Hyperagents 搭配 Sonnet 4.5 为例,投毒基准使 Agent 自我演化出在普通 URL 抓取任务中关闭 HTTPS 证书校验的指令,从而可能被中间人攻击利用。攻击成功与否取决于漏洞类型、基准设计、底层模型和 Agent 脚手架,作者据此归纳出足以促成攻击的一组属性,并据此又构造出禁用 JWT 签名校验和诱导不安全 YAML 加载两个部分成功的案例。作者据此讨论防御方向,认为自改进编码 Agent 需要被设计得对此类攻击更具韧性。
- 动态先知社区
DeepSeek Harness 被披露 QVD-2026-52646 漏洞,研究 exec 如何穿过沙箱
先知社区发布一项关于 DeepSeek Harness 安全问题的研究,标题指出一条 exec 命令可穿过沙箱,对应漏洞编号 QVD-2026-52646,内容涉及该漏洞与安全模型分析。feed 仅提供摘要,未给出完整正文。
- 动态先知社区
Agentic Skills 供应链攻击与运行监测防御范式
文章分析 AI Agent 的 Skill/MCP 生态面临的供应链投毒:与 npm/PyPI 投毒不同,载荷可以是纯自然语言,执行者是继承用户全部权限、会主动配合的 Agent。作者把信任失效归结为环境权限继承等三个根因,沿 Agent 读取 Skill、拆分步骤、经 MCP 调用工具的链路梳理出 5 个注入面,用工具描述投毒等四类典型攻击链做原理演示,并列出在野观察到的不少于 16 种免杀手法。隔离环境实测中,按序叠加编码压缩、结构重打包、语义改写等四类混淆后,多家检测平台的检出率从 99% 降到 10%。防御部分给出多引擎路由聚合加 LLM 仲裁、SkillSieve 静态三层检测、FUSE 与 eBPF 双通道动态采集和 uprobe 级意图-行为追踪,主张恶意行为最终会在运行时的系统边界行为上暴露。
- 动态先知社区
归档包 langchain-experimental 中 PythonAstREPLTool 的代码执行风险分析
已归档的 Python 包 langchain-experimental 中,PythonAstREPLTool 组件对大语言模型输出内容的过滤机制较弱,并直接使用 exec/eval 执行输入,存在代码执行风险。该组件已停止维护,结合平台判定与最新下载量数据,其安全风险在现阶段仍然存在,文章给出了相应修复建议。
- 动态先知社区
ZCode 被曝 Trust Folder 绕过 0day 漏洞,打开恶意目录即可触发
先知社区披露 ZCode 存在一个 Trust Folder 绕过 0day 漏洞,通过打开恶意目录即可触发。该文由此讨论 Coding Agent 的 Trust Folder 信任目录机制存在的安全问题。
- 论文arXiv:防御、护栏、反学习与有害微调
研究:高质量数据筛选挡不住投毒,Bi-QSTO 可在 90% 过滤率下保留攻击效果
研究系统评估了基于质量的数据筛选对投毒的过滤效果,发现筛选虽能移除大量明显有害样本,但部分被保留的高质量样本仍会削弱模型的安全对齐,原因可能在于其在层级梯度上呈现类似有害样本的训练更新模式。作者据此提出 Bi-Stage Quality-Constrained Safety-Degradation Text Optimization(Bi-QSTO),在显式质量约束下优化投毒样本,使其既能通过筛选又保留安全退化影响。在多种投毒设置、目标模型和过滤率下,Bi-QSTO 在筛选前后均保持攻击有效性;即便过滤率达 90%,有害种子样本的 Poisoning Retention Rate 仍高于 90%,Harmful Score 为 3.30–4.01,且攻击效果可跨模型迁移,保留优势也能推广到其他筛选方法。
- 论文arXiv:越狱、提示注入、投毒与防御
Memetic Trojans:利用社交传染在 LLM Agent 网络中传播对抗载荷
研究者提出 memetic trojans,一类利用 LLM Agent 转发和放大内容倾向进行传播的网络攻击,与依靠自我复制提示注入的 agent worms 不同,它把对抗载荷嵌入 Agent 有内在理由分享的社交传染内容中。作者从面向 LLM Agent 的社交平台 Moltbook 提取社交传染内容,受控传播实验显示传播力差异很大:最有效的传染内容在约 50% 的后续 Agent 发帖中被转发,获赞率为平均帖子的 2.5 倍,其 memetic trojan 版本基本继承这些特性。Monte Carlo 攻击模拟显示,memetic trojans 将预期曝光量最高放大 3.19 倍,网络结构与放大机制强烈影响传播,产生接近全网曝光的重尾结果。
- 论文arXiv:越狱、提示注入、投毒与防御
LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄
研究者提出 LLMLeak,一种利用 LLM 网页抓取工具建立隐蔽信道的新型攻击向量:本地恶意软件无法直接联网,却可把机密编码进 URL,并以“迁移软件库”等良性任务为由让 LLM 访问该链接,攻击者再通过自己控制的 DNS 或网页服务器取回编码后的机密。作者指出,直接让 LLM 用生成代码发送数据的输入容易被检测、网络库通常也受限,而 LLMLeak 只依赖 LLM 获取网站信息的工具。在 11 个开放参数模型上的评测显示攻击成功率为 79.7%,作者还对真实聊天机器人做了案例研究。
- 论文arXiv:越狱、提示注入、投毒与防御
A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型
研究者提出 A2A-TIBA,一种把间接提示注入与绕过规避结合的 Agent 攻击原理,利用 A2A 等智能体交互协议把远程对等方发来的任务当作合法请求这一特性,通过植入、命令、外传步骤诱导目标 Agent 部署回调交互程序,再由攻击者绕过 Agent 下发命令。为更细粒度评估防御,作者设计 GDA Measurement 红队测试方法,通过 LLM 网关做原始上下文捕获、双重数据保存和基于 Agent 的自主评判,并把单一攻击成功率扩展为语义拒答率、语义突破率、拦截率和穿透率四类结果(Class A/B/C/D)。
- 动态FAR.AI
FAR.AI 用对抗训练发现超人类围棋 AI 的意外失效模式
FAR.AI 提出用对抗训练自动搜索围棋 AI 漏洞的方法,训练出的对手 AI 仅用 KataGo 训练算力的 8% 就能在 100 局中赢下 94 局。该方法把 AlphaZero 式自博弈改为 victim-play,并修改 MCTS 让模拟中双方各自按自己的策略网络采样走子。研究找到两种攻击:一是诱导 KataGo 提前 pass 结束棋局,二是诱使其自信地围出可被吃掉的环形棋块,后者即使用硬编码补丁修复前者后仍能生效。环形攻击对人类职业水平版本胜率 100%,对超人类版本 96%,对搜索 1000 万步的强超人类版本 72%;零样本迁移到 Leela Zero 和 ELF OpenGo 的胜率分别约 6% 和 4%。作者据此指出最坏情况鲁棒性落后于平均能力,并提醒在安全关键场景部署 AI 以及用一个 AI 监督另一个 AI 时可能引发奖励作弊。