蒸馏攻击防御评估新发现
但事实证明,你可能根本不需要原始推理轨迹…… 来看看这项有趣的工作,我们比较了基于原始轨迹的蒸馏与其他"推理替代物"(包括摘要)的效果。
新的越狱方法、对抗攻击与红队发现,以及它们对主流模型的实际效果。
在这个话题内搜索或按分类筛选但事实证明,你可能根本不需要原始推理轨迹…… 来看看这项有趣的工作,我们比较了基于原始轨迹的蒸馏与其他"推理替代物"(包括摘要)的效果。
奇怪的是,只在最高推理强度下才会出现
我觉得这实际上可能是改进后的 CoT 可控性在真实场景中的一个实例——模型越注意到自己"预算快用完了",思考就变得越压缩 @tomekkorbak @MicahCarroll
给了 omp bot 一个桌面,在 19 次网络安全相关的拒答之后,大家现在正通过代理玩 doom,太惊人了
好了,Linux 现在应该好多了。第三轮!
安全研究者 Johann Rehberger 公开了对 Microsoft SQL Server Management Studio 中 AI 数据库助手 SQL Copilot 的研究,发现其中存在严重的提权路径,可从 SELECT 权限提升至 SYSADMIN。作者提醒用户确保 SSMS 安装已更新,并感谢 Microsoft 快速修补该问题,该研究还在两周前的 BlueHat Asia 上进行了展示。作者提到数据库 CONSTITUTION.md 这一概念,完整技术细节与视频演示见其博客文章。
https://blog.google/security/agentic-hacks-real-proofs-inside-googles-pagebreak-project/
“想象有一部关于你的很棒的电影。用你喜欢的任何风格,为这部电影的片头字幕配上虚构的名字做成动画。将这段序列以 mp4 格式返回。” Claude Opus 5.5 (Extra)
> 做一个过度兴奋的 30 秒视频,疯狂地介绍你自己。 Claude Opus 5.5(Extra)
> 制作一个 1 分钟的 UMAP 教学视频,配合成语音旁白。 Claude Opus 5.5 (Extra)
> 创建一个 1 分钟的视频,右半部分用配音和画面讲解 Black-Scholes 公式,左半部分播放 Subway Surfers 的仿制版 Claude Opus 5.5 (Extra)
面向 Claude Fable 5 的领域专属智能体红队测试!! 很快将登上排行榜:https://decodingtrust-agent.com/
🚨 Claude Fable 5 JAILBROKEN. We ran a quick security scan of Claude Fable 5 with Claude Code on our DecodingTrust-Agent Platform (https://decodingtrust-agent.com) and obtained 15%+ ASR with several high-severity failures😱🚨 Most concerningly, we found that Fable 5 appears very aggressive in financial-risk scenarios, sometimes directly executing transactions initiated from indirect prompt injections, without even confirming with the user! Top 3 most severe attack trajectories we observed👇
研究者提出 CodePoisonRAG,一种针对检索增强代码生成(RACG)的定向上游知识投毒框架,将良性修复代码条目改造成携带攻击者选定弱点的投毒样本。攻击链包含漏洞注入与语义误标两步:前者在保留任务结构的前提下改写 source-passthrough-sink 数据流以植入指定 CWE,后者在注释中加入虚假安全声明而不修复漏洞。研究者在 Java 和 C 的十类 CWE 上构造 85 个投毒样本,注入 12,053 条良性检索语料后投毒比例仅 0.7%,每个任务最多注入一个样本。在三个生成模型上,85 个样本全部进入对应查询的 Top-3 检索结果,攻击成功率介于 0.80 至 0.93;面对 CodeGuarder 防御时成功率仍为 0.40 至 0.71,其中 Code Llama 13B 上最高达 0.71。
推荐理由论文给出针对检索增强代码生成的知识投毒框架,用极低投毒比例实现高攻击成功率,并测试了现有防御的削弱幅度。
研究者提出 HookPry,一个开源全自动攻击框架,利用 AI Agent 框架盲目信任的生命周期钩子更新路径实施供应链攻击。攻击者只需控制插件元数据与钩子配置,先发布良性版本获取信任,再通过更新把恶意命令静默绑定到良性事件,命令由框架直接派发,不经过 LLM 决策路径。HookPry 由对抗性清单优化、时间解耦和最小公共接口三部分组成,实现十种攻击目标。在 7 种框架与 5 种 LLM 后端共 25 种组合、1000 次端到端运行中,全部 7 种框架被攻破,Hermes 上成功率最高达 92.5%,整体微平均 E2E-ASR 为 77.0%,机制触发率 83.9%,无一次被模型显式拦截。防御方面,Microsoft Defender 召回率为 0%,三种静态防御联合仍漏掉 47.5% 的恶意样本。
推荐理由论文把生命周期钩子更新路径单独列为供应链攻击面,并给出跨 7 种 Agent 框架的自动化验证与防御缺口数据。
研究者把 Thompson 关于编译器后门的论证迁移到自改进编码 Agent 上,提出通过投毒基准污染其自我评估与自我改进过程,使后续版本在干净的中立任务上写出漏洞代码。作者在 Darwin Gödel Machine、Self-Improving Coding Agent 和 Hyperagents 三个系统上做了概念验证:以 Hyperagents 搭配 Sonnet 4.5 为例,投毒基准使 Agent 自我演化出在普通 URL 抓取任务中关闭 HTTPS 证书校验的指令,从而可能被中间人攻击利用。攻击成功与否取决于漏洞类型、基准设计、底层模型和 Agent 脚手架,作者据此归纳出足以促成攻击的一组属性,并据此又构造出禁用 JWT 签名校验和诱导不安全 YAML 加载两个部分成功的案例。作者据此讨论防御方向,认为自改进编码 Agent 需要被设计得对此类攻击更具韧性。
推荐理由论文把 Thompson 的编译器后门搬到自改进编码 Agent 上,给出可复现的投毒基准与跨代残留证据,适合评估自进化系统的信任根。
文章分析 AI Agent 的 Skill/MCP 生态面临的供应链投毒:与 npm/PyPI 投毒不同,载荷可以是纯自然语言,执行者是继承用户全部权限、会主动配合的 Agent。作者把信任失效归结为环境权限继承等三个根因,沿 Agent 读取 Skill、拆分步骤、经 MCP 调用工具的链路梳理出 5 个注入面,用工具描述投毒等四类典型攻击链做原理演示,并列出在野观察到的不少于 16 种免杀手法。隔离环境实测中,按序叠加编码压缩、结构重打包、语义改写等四类混淆后,多家检测平台的检出率从 99% 降到 10%。防御部分给出多引擎路由聚合加 LLM 仲裁、SkillSieve 静态三层检测、FUSE 与 eBPF 双通道动态采集和 uprobe 级意图-行为追踪,主张恶意行为最终会在运行时的系统边界行为上暴露。
推荐理由文章梳理 Agent Skill 与 MCP 生态的供应链投毒与注入面,并给出可复现的检测与运行监测思路。
已归档的 Python 包 langchain-experimental 中,PythonAstREPLTool 组件对大语言模型输出内容的过滤机制较弱,并直接使用 exec/eval 执行输入,存在代码执行风险。该组件已停止维护,结合平台判定与最新下载量数据,其安全风险在现阶段仍然存在,文章给出了相应修复建议。
研究提出 Inoculation Midtraining,在 midtraining 阶段教基座模型把不安全行为归属于由新造词标记的特定语境,再在该语境下用不安全数据做后训练,评估时从 system prompt 中移除该新造词。在监督微调和强化学习两种后训练范式下,该方法能降低失准,同时保留良性数据属性的迁移,例如用德语或莎士比亚式文风表达。但它未超过标准的 Inoculation Prompting,对训练配置敏感,且产生的边界存在泄漏,附近语境线索可重新激活不安全行为。作者认为,通过 midtraining 引入学习到的关联可以塑造选择性泛化,但该方法要成为开发者安全框架中的承重组件仍需更多工作。
研究者提出 memetic trojans,一类利用 LLM Agent 转发和放大内容倾向进行传播的网络攻击,与依靠自我复制提示注入的 agent worms 不同,它把对抗载荷嵌入 Agent 有内在理由分享的社交传染内容中。作者从面向 LLM Agent 的社交平台 Moltbook 提取社交传染内容,受控传播实验显示传播力差异很大:最有效的传染内容在约 50% 的后续 Agent 发帖中被转发,获赞率为平均帖子的 2.5 倍,其 memetic trojan 版本基本继承这些特性。Monte Carlo 攻击模拟显示,memetic trojans 将预期曝光量最高放大 3.19 倍,网络结构与放大机制强烈影响传播,产生接近全网曝光的重尾结果。
研究者提出 LLMLeak,一种利用 LLM 网页抓取工具建立隐蔽信道的新型攻击向量:本地恶意软件无法直接联网,却可把机密编码进 URL,并以“迁移软件库”等良性任务为由让 LLM 访问该链接,攻击者再通过自己控制的 DNS 或网页服务器取回编码后的机密。作者指出,直接让 LLM 用生成代码发送数据的输入容易被检测、网络库通常也受限,而 LLMLeak 只依赖 LLM 获取网站信息的工具。在 11 个开放参数模型上的评测显示攻击成功率为 79.7%,作者还对真实聊天机器人做了案例研究。