跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 756 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体7来源:Hugging Face Daily PapersHugging FaceDaily Papers1 条材料来源:El lado del mal / Chema AlonsoEl lado del mal/ Chema Alonso1 条材料来源:AppSec Israel / Nevo PoranAppSec Israel /Nevo Poran1 条材料来源:论文追踪论文追踪3 条材料论文:研究显示拆分学习中的梯度可提升客户端文本重建率论文2026-10-02研究显示拆分学习中的梯度可提升客户端文本重建率动态:对一家背包店 AI 助手进行扰动与去对齐测试动态2026-10-05对一家背包店 AI 助手进行扰动与去对齐测试动态:AppSec Israel 2026:Nevo Poran 将讲如何劫持 AI 智能体信任的工具动态AppSec Israel 2026:Nevo Poran 将讲如何劫持 AI 智能体信任的工具论文:TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击论文2026-10-05TranScope:利用 CPU 性能计数器对Transformer 做成员推断攻击论文:NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试论文2026-10-03NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试论文:研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击论文2026-10-05研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击方向:开源模型安全开源模型安全1方向:Agent 安全Agent 安全3方向:隐私与数据泄露隐私与数据泄露2方向:越狱与攻击越狱与攻击6方向:AnthropicAnthropic1方向:月之暗面 · Kimi月之暗面 ·Kimi1方向:其他方向其他方向2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。6 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文Hugging Face Daily Papers

    研究显示拆分学习中的梯度可提升客户端文本重建率

    研究者在拆分学习场景下测量了梯度对客户端文本泄露的贡献。在 GPT-2 上,仅凭客户端层的公开权重,攻击者从激活值中恢复 94.20% 的 token,同时看到梯度后升至 97.38%,提高 3.17 个百分点,95% 区间为 [2.72, 3.64]。按文档统计差距更大:32 token 的文档中,无梯度时 13.71% 被完整重建,有梯度时为 37.77%,因为文档需每个 token 都正确才计入。防御效果也随统计口径变化,Secret mixup 将每个输出向量与诱饵混合后几乎无法完整重建文档,但攻击者仍能恢复 83-91% 的 token。在 GPT-2 与 Qwen3-0.6B 的第二组实验中,服务器只训练连续若干层时,起始层位置在层数固定情况下同时影响模型质量与泄露程度。 这些结果限于两个小模型与短文本实验,不能直接外推到大模型或长文档;防御测试未采用针对防御的自适应攻击,因此报告的是已观察到的泄露下限。

  • 动态El lado del mal / Chema Alonso

    对一家背包店 AI 助手进行扰动与去对齐测试

    一名安全研究者对某背包商店的 LLM 助手进行去对齐测试,通过在推荐背包列表中把指令嵌入商品名 token,成功绕过其提示词与输出双层护栏。该助手无联网、无编程能力,但研究者用 ASCII 编码、藏头诗和 ELITE 语言等方式多次突破输出过滤,并提取出 System Prompt 配置。研究者据此建议 LLM 助手需重点防护,网络犯罪已在觊觎此类模型。

  • 动态AppSec Israel / Nevo Poran

    AppSec Israel 2026:Nevo Poran 将讲如何劫持 AI 智能体信任的工具

    Tenet Security 联合创始人兼 CTO Nevo Poran 将在 AppSec Israel 2026 发表演讲,主题为通过 AI 智能体所信任的工具劫持智能体,每个步骤都经过授权。他此前曾参与 Cisco AI Defense 创始团队,并主导了早期智能体安全研究。

  • 论文论文追踪

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    TranScope 研究硬件侧信道可能带来的模型成员推断风险,即硬件层面的信息泄露是否能够暴露某条数据参与过模型训练。

  • 论文论文追踪

    NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试

    开源 Rust 自主渗透测试框架 NeuroSploit v4.2.0 在 GOAD 靶场(5 台虚拟机、2 个森林、3 个域)上完成评测,其编排 22 个 AD 专用智能体与 7 套多阶段攻击链 playbook,覆盖枚举、Kerberoasting、AD CS(ESC1-ESC8)、DCSync、跨森林信任滥用等完整杀伤链。对 Claude Opus 4.6/4.7/4.8、GPT-6 Astra、GPT-5.6 Sol、Grok 4.6、Qwen 3.8、GLM 5.3、Kimi k3 九个前沿模型的测试显示,框架实现 96-100% 技术覆盖率与 90-97% 精确率,直接调用仅覆盖 21-54% 且误报多出 3.2 倍;使用 Opus 4.8 时 134 分钟完成三域完全攻陷,护栏机制阻止了触发锁定的喷洒、未授权 DCSync 转储与越界侦察。

  • 论文论文追踪

    研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击

    研究者提出 Reward Stealing Attack(ReSA)框架,针对 LLM 对齐背后的潜在安全奖励发起对抗攻击。该方法用最大熵逆强化学习,仅凭对齐模型的行为恢复出一个代理奖励模型,再在推理阶段将该奖励反向,通过奖励引导的解码机制得到对抗策略。实验显示,单个恢复出的奖励可跨提示词和多种模型泛化,ReSA 在攻击有效性和可迁移性上明显优于现有方法,论文认为这揭示了对齐层面的一个根本性脆弱点。代码已公开,论文共 19 页。

  • 动态The Hacker News

    微软披露新型 ClickFix 攻击:借浏览器缓存藏载荷绕过 Windows Run 字符限制

    微软威胁情报团队披露一种新型 ClickFix 攻击,受感染网站将伪装成 PNG 的脚本载荷预取进浏览器缓存,诱使用户粘贴执行命令后运行本地缓存内容,从而绕过 Windows Run 对话框约 260 字符的输入截断限制。载荷为 VBScript,会枚举浏览器配置文件夹中名称以 "f_" 开头的文件,按字节长度匹配后将缓存条目复制为 t.vbs 并用 wscript.exe 执行,再经 PowerShell 多级下载 .NET 载荷注入 timeout.exe 窃取浏览器与设备凭据。此前 2025 年 10 月已有缓存走私投递 ZIP 的案例,CloudSEK 还演示过用不可见提示注入与 prompt overdose 让 AI 摘要系统生成 ClickFix 指令。

  • 论文arXiv

    TAPDreamer:可跨任务迁移的世界动作模型对抗补丁

    研究者提出 TAPDreamer,一种针对世界动作模型的对抗补丁攻击,仅用公开编码器构造固定局部扰动,无需查询目标策略即可跨任务和动作架构迁移。其思路是补丁引起的注意力权重与 value 向量变化会把表征偏移广播到补丁范围之外,且在不同任务观测中保持稳定;方法用单一源任务的六帧最大化干净与加补丁编码器表征之间的全局 L1 距离。闭环评测中,每个基准一个冻结补丁覆盖约 6.5% 输入,使 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而随机补丁仍保持 81.5% 和 79.2%。同一补丁在两个 DreamWAM 配置上把成功率降至 2.1% 和 0.8%,在 Motus 上降至 10.0%。

  • 论文arXiv

    研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击

    论文研究针对深度强化学习(DRL)的基于迁移的黑盒攻击,攻击者在白盒替代智能体上构造观测扰动,再施加给未知受害者策略,并将攻击形式化为每步扰动预算下的回报最小化。作者首先发现,把图像分类的可迁移攻击 FGSM、MI-FGSM 和 NI-FGSM 移植到逐帧目标后,生成的扰动虽能迁移,但强度不超过同等预算的随机噪声。为此他们提出轨迹级攻击,借助可微环境模型和温度平滑的替代策略,在滚动时域上优化一串扰动,并使用相同的优化器。在 CartPole-v1 上,针对十个 DQN 与 DDQN 智能体、100 对替代与受害者组合,该轨迹级攻击在白盒、跨模型和跨算法设置下均优于逐帧攻击和随机噪声。

  • 论文arXiv

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    研究者提出 Tracer 框架,用于识别扩散模型中被遗忘算法擦除的概念并估计其数量,无需事先知道哪些概念被删除。该方法不生成和分类图像,而是对权重足迹做轻量谱分析,从而在大型候选词表上高效搜索;通过足迹覆盖目标引导顺序发现多个被擦除概念,并依据候选置信度的骤降估计擦除数量,无需标注样本校准。框架仅需轻量线性代数和有限前向探测,不依赖对遗忘算法的先验知识。在文本到图像和文本到视频骨干模型及多种遗忘方法上的实验显示,Tracer 可在数秒内完成识别与计数,相比 MIA 和暴力搜索分别实现 150 至 137,000 倍和 133 至 20,000 倍的加速,且识别准确率更高。

  • 论文arXiv

    多模态一定更好吗?缺失模态鲁棒性的几何视角与 Geodesic Unlearning 方法

    多模态模型在推理时缺失某一模态,性能可能反而低于单模态模型,这一失败模式出现在融合模型、CLIP 式双塔模型和视觉语言模型中。研究将其归因于多模态训练在主参数子空间(尤其跨模态交互层)中诱导的结构化旋转,导致任务对齐间隔缩小。作者提出轻量参数编辑方法 Geodesic Unlearning(GU),沿测地路径将主输入子空间旋转至单模态参考,并证明该修正在固定子空间距离预算内最小化到参考的距离;实验显示 GU 在缺失模态推理下提升性能,同时保持全模态准确率,优于强基线。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究者提出序列马赛克攻击并给出防御理论

    研究者针对多轮序列马赛克攻击提出防御理论,这类攻击的单个片段看似无害,组合后却构成有害载荷。作者证明任何固定长度的近期提示窗口在一般情况下都不足以防御,因为安全相关信息可能出现在交互中任意靠前的位置,并形式化了一个在线状态机制 watchman 来携带这些信息。在明确假设下,该机制可实现零失败防御并保持正向的有益帮助性,在更强条件下还是零失败防御者中最优的。研究还给出状态数与查询数的下界,并指出自博弈均衡本身不能证明有用性,进而提出在零失败防御者中最大化最坏情况有益帮助性的约束形式。实验上,通过多轮自博弈在冻结 LLM 上训练角色专属的 attacker 与 defender LoRA 适配器,攻击者更易诱导有害回答,防御者对攻击更鲁棒,在未见攻击目标上也有提升。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Red-TTT:用测试时训练实现大语言模型自动化越狱

    研究者提出 Red-TTT,在针对每个行为的攻击过程中更新攻击者参数,而不是像现有自动化红队方法那样在攻击开始后冻结攻击者权重。每轮攻击中,攻击者采样一组候选、根据受害模型的回复打分,并在抽取下一组前执行一次策略梯度更新,把对当前受害模型的认识固化进权重而非停留在上下文窗口里。该方法还调整了训练目标,以单次最佳样本而非平均表现衡量红队成功。Red-TTT 只需要对受害模型的采样访问,可直接接入现有攻击流程。在 120 次采样的预算下,相比 Best-of-N 基线,其平均攻击成功率从 55.9% 提升到 72.4%,在所有配置上均优于基线,并攻破了此前方法无法攻破的多个行为。

  • 论文arXiv:越狱、提示注入、投毒与防御

    Penumbra:面向监管义务的样本高效对抗搜索方法

    研究者提出 Penumbra,一种面向监管义务的对抗搜索方法,从已验证的锚点出发,在逐步扩大的编辑预算下搜索,直到由两名评估者组成的委员会改变判定,并输出跨越判定边界的两条相邻响应。该方法采用自适应分配,目标是对失败面的覆盖,即每个候选解决的(义务×失败模式)单元格数量。在同等预算下,自适应分配在 59% 的候选上达到均匀分配全预算的覆盖;在相同记录数下,其覆盖的失败模式是朴素枚举的 1.43 倍,且增益局限于其针对的维度。在金融顾问章程的 60 条筛选义务上,Penumbra 返回 144 对响应,每对包含委员会判定为合规与违规的两条文本,仅相差几个词;直接要求模型同时生成两类文本时,两者几乎不共享内容。在临床分诊的第二份章程上,该方法在 18 条义务上复现了结果,得到 49 对同样紧密的响应,且最难的模式相同。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究者提出 EviLLM 攻击:通过被入侵账号向 AI 代码生成流程注入漏洞

    研究者提出名为 EviLLM 的攻击,威胁模型是能力与现有网络犯罪分子相当的第三方攻击者攻陷 AI 代码生成流程,故意向生成的代码中注入漏洞。该攻击实现了两个实例,均只需通过被入侵的账号或浏览器访问底层 LLM,即可注入 13 类 CWE 漏洞;可行性研究显示这两种攻击向量已被用于实施多种现有网络攻击。用户研究中,两个实例注入的漏洞分别有 8 人中的 7 人和 13 人中的 10 人未察觉,21 名参与者中有 13 人很少或从不考虑此类攻击风险。

  • 论文论文追踪

    研究者训练出按多智能体拓扑触发的代码后门模型

    研究者构建人为植入后门的实验模型,测试其是否会依据推断出的单智能体或多智能体部署环境改变代码安全行为。作者报告受控任务中存在环境相关的安全差异,并以多组对照分析触发条件。这是人为构造的受控实验,不是模型自发涌现行为;真实多智能体环境中的触发尚未测试。

  • 论文论文追踪

    研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines

    题为 Cooldown Landmines 的研究讨论 LLM 网关中的跨租户干扰。

  • 论文论文追踪

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    研究者对 Jev 这一将自然语言问题转为带类型答案与概率的决策层接口做了首次系统性安全与隐私研究,使用官方 Jev API 和训练数据与更新可控的本地模型 NanoJev。研究围绕三个问题展开:Jev 作为应用决策层时的安全威胁、受限类型化输出仍可能泄露的隐私信息、以及其通用决策能力的正反两用。作者改造提示注入与对抗后缀来操纵其决策,并通过训练数据投毒在 NanoJev 中植入后门以考察开源分发与更新带来的供应链风险;同时改造成员推断、私有属性推断和内部知识推断攻击,从受限输出格式中恢复敏感信息。研究还用提示注入、越狱输入、有害内容和 AI 生成文本四项检测任务考察其防御用途,并分析越狱与模型提取等滥用场景。实验显示 Jev 对上述安全与隐私威胁仍然脆弱,其决策能力可同时支持有益与恶意用途。

  • 论文arXiv:可解释性

    研究者提出闭环偏见注入攻击,可将 LLaDA-8B 的 BBQ 目标差距从 1.8 提升至 16.7 个百分点

    研究者提出针对掩码扩散语言模型(dLLM)的定向偏见注入攻击:由于 dLLM 在提交答案前会多次重新预测同一位置,攻击者可在去噪过程中读取目标答案概率,并用比例积分(PI)控制器实时调整一个固定引导向量的强度,从而在不改动权重和提示词的情况下把模型推向指定人口群体。在 LLaDA-8B-Instruct 上,该攻击把 BBQ 模糊问题(正确答案为弃答)的目标与对照选项差距从 1.8 提升到 16.7 个百分点,超过最强固定强度基线三倍以上;在 SocialStigmaQA 上把污名化答案的选择率从 17.6% 提升到 58.1%。同一攻击换用其他人口目标时最多可产生 37 个百分点的偏移,每个目标约需一块 GPU 运行 40 分钟。消融实验显示增益来自反馈本身:与控制器平均强度相同的固定开环只带来 3.5 个百分点差距,却产生 20.8% 的无效输出,而闭环为 7.8%。

  • 论文论文追踪

    研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

    研究者提出一种仅针对 SAE 解码器的后门攻击,在语言模型和 SAE 编码器均冻结的情况下,将恶意修改的 SAE 插入前向传播即可诱导攻击者指定的行为。以代码生成为例,该攻击在三个语言模型和多种插入层上实现了较高的非请求代码插入率,并能依据提示词线索触发特定行为。研究还用 HumanEval 和部分 SAEBench 指标评估了被修改的 SAE,发现强后门行为可以与若干常规 SAE 质量指标的较小变化共存。作者据此认为 SAE 可携带行为后门而无需修改语言模型本身,应被视为安全敏感组件。

  • 论文论文追踪

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    研究者提出 CRIME 框架,指出单独通过安全审查的良性 Agent 技能在组合后仍可诱发恶意行为,因为组合会扩展智能体的能力空间。CRIME 先用 Malicious Plot Casting 模块把目标恶意行为拆解为互补需求,从公开技能库中筛选合适的良性技能组合;对无法直接实现的组合,Runaway Reaction Steering 模块借助执行反馈迭代调整技能,同时要求每个技能在单独审查下仍属良性。组合随后进入 Skill Reaction Chamber 模块,在沙箱中执行并检查环境后果以判断目标行为是否发生,失败案例返回继续调整。研究者还构建了覆盖八类网络安全行为的 4000 个公开技能基准用于系统评估。

  • 论文论文追踪

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    研究者对智能体持久记忆发起大规模红队测试,验证攻击者能否在一个会话中把受控字符串以隐写方式写入记忆、在另一会话中取回而不触发安全监督。测试覆盖 14000 次攻击试验、91 个模型与攻击配置、13 个模型和 7 种隐写方案(Acrostic、Mesostic、Telestich、Word-choice、Capitalization、Position-based、Homoglyph)。41.2% 的试验成功在回复中编码目标载荷,29.8% 在记忆写入后仍保持编码完整,25.4% 在检索时可恢复载荷,20.1% 实现精确匹配恢复,其中包括从未向接收方暴露的合成 API key 和密钥材料。精确匹配传输中有 71.4% 同时通过主任务完成度评分并被监督模型独立判定为安全,相当于全部试验的 14.4%。

  • 论文论文追踪

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    研究者提出 AgentDoxx,一个包含 822 份合成访谈文本的评测套件,用于衡量具备联网搜索能力的 LLM Agent 对匿名文本的再识别风险。这些访谈基于 r/IAmA 中公开披露身份者的公开信息生成,经人工判别研究显示其与真实访谈难以区分。在 15 种模型配置上,Kimi K3、GLM-5.3 Flash 和 DeepSeek-V4 Flash 在无搜索条件下仅凭参数知识即可正确识别 15–28% 的文本;一旦目标姓名出现在检索结果中,识别成功率超过 88%。防护方面,命名实体遮蔽后仍有至少一个攻击者能识别 85.3% 的分层样本;属性噪声替换把平均准确率从 75.1% 降至 34.2%;系统提示中的隐私指令降幅最大(75.1% 降至 21.6%),但在拒答姓名的样本中 37% 已在检索阶段拿到姓名、58% 仍描述了目标的辨识性细节。

  • 动态pwn.ai

    pwn.ai 称其 AI 智能体在 Google kvmCTF 中捕获官方 flag

    pwn.ai 称其 AI 智能体在授权的 Google kvmCTF 环境中构建并运行 KVM 漏洞利用,并于 6 月 17 日取得官方 flag,相关漏洞编号为 CVE-2026-46113。该案例涉及虚拟机与宿主之间的隔离边界。作者称因公开补丁的时间窗口未获得赏金;关于首例与自主程度的说法均为作者主张,人类提供了任务、授权与基础设施,现有材料未提供独立复现。