跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 758 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究603细分与主体7来源:Failure-FirstFailure-First6 条材料动态:Event-VLA:面向鲁棒视觉-语言-行动模型的行动条件化事件融合动态2026-08-03Event-VLA:面向鲁棒视觉-语言-行动模型的行动条件化事件融合动态:研究揭示越狱判定器不可靠:ASR 自动评分存在校准与对抗鲁棒性问题动态2026-08-05研究揭示越狱判定器不可靠:ASR 自动评分存在校准与对抗鲁棒性问题动态:[每日论文] 字符串组合实现大量越狱动态2026-08-21[每日论文] 字符串组合实现大量越狱动态:《Jailbreak Paradox》论文证明越狱检测的两个结构性不可能定理并用泰米尔语黑盒实验佐证动态2026-08-21《Jailbreak Paradox》论文证明越狱检测的两个结构性不可能定理并用泰米尔语黑盒实…动态:Endless Jailbreaks 用双射学习构建可调强度的越狱攻击动态2026-08-21Endless Jailbreaks 用双射学习构建可调强度的越狱攻击动态:论文:自适应攻击可绕过可信监控模型,Defer-to-Resample 反而放大风险动态2026-08-21论文:自适应攻击可绕过可信监控模型,Defer-to-Resample 反而放大风险方向:越狱与攻击越狱与攻击6方向:安全评测安全评测2方向:红队红队3方向:AnthropicAnthropic1方向:其他方向其他方向1方向:Agent 安全Agent 安全1方向:AI 控制AI 控制1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。2 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Failure-First

    Event-VLA:面向鲁棒视觉-语言-行动模型的行动条件化事件融合

    针对当前 VLA 模型依赖帧基 RGB 传感器、在光照突变与运动模糊下易发生分布外失效的问题,Liu 等人提出 Event-VLA,将异步事件相机流作为互补观测引入机器人操控策略。该方法通过 Physical Residual Event Integration(PREI)把事件历史分解为瞬时、显著、持续三通道残差图,并以门控交叉注意力加查询引导路由接入冻结语义主干之外的动作通路,辅以一个预测未来事件的辅助头做正则化。在 LIBERO 及三级光照退化的 LIBERO-Cross(LL-Mild、LL-Dark、LL-Severe)上该框架提升了抗退化能力,但仍会在弱对比导致事件激活不足的场景中失败。

  • 动态Failure-First

    研究揭示越狱判定器不可靠:ASR 自动评分存在校准与对抗鲁棒性问题

    Veyon Solutions 的 Yang Gao 在 HarmBench 分类器验证集(596 条人工标注完成结果)上测试了自动越狱判定器的可靠性,发现两类判定器以相反方式失效。专用分类器(如 HarmBench classifier)召回率 0.974、精确率 0.835,倾向过度标记,可能抬高 ASR;LLM-as-judge 精确率高但召回率极低,Qwen2.5-7B 召回仅 0.174、F1 为 0.294,Qwen2.5-3B 召回 0.059。在内容不变的包装攻击下,仅加一句拒答前缀就能让 LLM 判定器把有害内容改判为安全,翻转率在 39% 至 88% 之间,部分模型任意包装的翻转率达 100%。

  • 动态Failure-First

    [每日论文] 字符串组合实现大量越狱

    该论文将 leetspeak、Base64、ROT 密码、ASCII 替换及 JSON/LaTeX 格式化包装统一为一个可逆字符串函数库,通过程序化组合与随机采样构造越狱攻击。方法是 best-of-n 随机搜索而非优化器:给定有害意图和预算 n,从变换库中随机抽取 n 个组合并编码发起攻击,任一成功即判定越狱成立,其评估取 n=25,由 HarmBench 分类器判定。实验还归纳出两条经验性顺序约束——二进制与 Base64 编码只能在词级变换之后应用,JSON、LaTeX 等风格包装应始终置于最后,否则内部变换会破坏语法。

  • 动态Failure-First

    《Jailbreak Paradox》论文证明越狱检测的两个结构性不可能定理并用泰米尔语黑盒实验佐证

    该论文从结构层面证明了两个关于越狱检测的不可能性结果:不存在完美分类器——若假设存在能免疫越狱的最强模型,构造其叠加完美分类器的复合体会更强从而矛盾;弱模型无法判定强模型的越狱输入,因判官置信度受自身能力上限约束而非目标行为。作者将 Albert Jailbreak、Pliny Jailbreak 与两轮代码生成的 CodeJB 三种黑盒方法译为泰米尔语,在不同语言能力层级的多个模型上做了实证检验。

  • 动态Failure-First

    Endless Jailbreaks 用双射学习构建可调强度的越狱攻击

    该论文提出双射学习越狱方法:通过多轮演示让目标模型学会一套临时的替换密码,再把有害请求用这套密码编码提交,模型在安全训练识别之前先完成解码并给出回答。攻击分三步,先教双射映射,再提交编码查询,最后反转映射解码回答,解码错误用 GPT-4o-mini 清理。攻击强度由 dispersion(字母表被重映射的比例)和编码长度(每个字符对应的数字位数)两个参数控制。

  • 动态Failure-First

    论文:自适应攻击可绕过可信监控模型,Defer-to-Resample 反而放大风险

    论文显示,不受信任的模型可以针对具体监控模型自适应改造公开越狱提示词,把注入内容嵌进代码注释与恶意载荷一起提交。攻击者用监控模型自身的 system prompt 和历史反馈做调优信号,DeepSeek-Chat 在其设置中完成离线适配。结果 GPT-4.1 作为监控模型把 375 个带后门的 GPT-5 代码样本全部判为良性,可疑度均为 0。原本作为安全改进的 Defer-to-Resample 在此攻击下结构性失效:若单次采样逃逸概率为 p,k 次采样中至少一次逃逸的概率为 1−(1−p)^k,随 k 增大趋近 1;而取最小可疑度的选择规则会主动挑中注入样本,因为注入样本被专门设计成报告接近零的可疑度。

  • 动态NVIDIA garak 版本发布

    NVIDIA garak v0.13.1 发布:新增多种探针插件并改进检测器配置

    NVIDIA garak 发布 v0.13.1,新增 Atbash 编码、tokenizer ANSI 逃逸码、Dropbox 重复 token 攻击、DRA(伪装与重构攻击)、Dart/perl/raku 包幻觉及 token 走私等多个探针模块。该版本还加入 detector 输出值为 None 的支持、将 config 中 model_* 改为 target_*、CLI 增加 --list_* 过滤选项,并修正未来类探针措辞、重命名扩展 Web 注入探针以及更正文档中的 ASR 数值。

  • 动态Helen Toner

    Helen Toner:AI 对齐的核心挑战在于“可控性”(steerability)

    Helen Toner 提出应把“AI 对齐”理解为“可控性”:真正的问题是能否可靠地引导先进 AI 系统朝向任意目标,而非它是否符合某人价值观。“对齐”一词带有明确的参照系暗示,导致概念混淆——如今在许多圈子里,“对齐”几乎等同于 RLHF 一类的内容审核手段,偏离了对齐原本指向的可控性问题。她指出,ChatGPT 于 2022 年 11 月成功的重要原因之一正是 OpenAI 采用了源自对齐研究的 RLHF,使外界开始主要用它来指称此类技术。

  • 动态Trail of Bits

    Trail of Bits 绕过 ClawHub、Cisco 与 skills.sh 的 skill 扫描器

    Trail of Bits 测试了 ClawHub、Cisco skill-scanner 以及 skills.sh 集成的 Gen、Socket、Snyk 三家扫描器,用四个恶意 skill 全部绕过检测,其中三个不到一小时就完成。攻击手法包括在恶意代码前插入 10 万个换行符让 OpenClaw 扫描器截断文件、用 .docx 压缩包间接引用恶意脚本、在看似无害的格式化 skill 中夹带会读取环境变量的 .pyc 字节码,以及用企业环境配置话术包装的提示注入,诱导 agent 把 npm/yarn 指向攻击者控制的 registry。

  • 会议论文Simon WillisonICML 2026

    研究将提示注入归因于角色混淆,改写文本风格可降低攻击成功率

    Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 的研究指出,模型难以区分自身特权文本(如 <system>、 thinking、<assistant> 标签包裹的内容)与 <user> 标签中的不可信输入,作者称之为角色混淆。研究发现模型更看重文本风格而非实际内容,由此产生令人担忧的越狱方式,例如在请求后附加模仿模型内部思考块风格的文字,gpt-oss-20b 等模型可能因此被误导并覆盖初始训练。研究还发现,将文本改写得不那么像角色标签预期格式的 destyling 操作会显著影响模型对文本的分类,使数据集上的平均攻击成功率从 61% 降至 10%。

  • 动态Wiz Research

    Wiz Research 用 LLM 自动检测恶意 Azure OAuth 应用

    Wiz Research 开发了名为 OAuth Apps Scout 的主动检测流水线,借助 LLM 自动发现新兴恶意 OAuth 应用程序,已在数十家受影响组织中识别出大量恶意应用。该方案基于对多个环境中已知 OAuth 攻击活动的分析,覆盖三起独立的恶意 OAuth 应用活动,涉及超过 20 家公司受害,其中一起野外同形异义词攻击用一个以数字 0 而非字母 O 开头的应用冒充合法名称诱导授权。 补充说明: - 攻击者先在自有 Azure 环境注册仿冒可信品牌的全局应用对象并配置相似图标与主页地址,再通过钓鱼邮件引导用户在真实的 Microsoft 登录页完成认证。

  • 动态Wiz Research

    Wiz Red Agent 发现 B2B 平台数据 API 付费墙绕过漏洞,600M+ 联系人信息可免费获取

    Wiz 的自主 Red Agent 在一家领先 B2B 平台的数据 API 中发现授权绕过漏洞:免费账户在搜索请求中注入单个客户端可控布尔参数(如 unmaskContactData),即可绕过积分付费机制,明文获取 600M+ 商业邮箱、135M+ 已验证直线电话及约 50% 记录中的个人邮箱。该漏洞源于后端信任客户端传入的 flag 而未校验用户权限,属于典型业务逻辑缺陷,传统 SAST/DAST 工具难以检出。平台安全团队在收到报告后 2 小时内完成修复。

  • 动态Microsoft PyRIT 版本发布

    Microsoft PyRIT v0.11.0 发布:新增 WebSocketCopilotTarget 与 30 个越狱模板

    Microsoft PyRIT 发布 v0.11.0,破坏性变更将攻击与执行器从 SeedPromptGroup 改为基于 Message 运行,并重命名场景配置 API。该版本新增 WebSocketCopilotTarget,可通过 WebSocket 向 Microsoft Copilot 发送提示词执行,同时加入图像下载支持的 ImageTarget 重构及 OpenAIImageTarget 的图像编辑/混合功能。

  • 动态Microsoft PyRIT 版本发布

    Microsoft PyRIT v0.12.0 发布:GUI、CLI 与框架三种交互方式全部可用

    Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。

  • 动态Microsoft PyRIT 版本发布

    微软 PyRIT 发布 v1.1.0,扩展扫描器与评分能力

    微软开源红队框架 PyRIT 发布 v1.1.0,重点改进评分机制、扩展扫描器能力并加入 CoPyRIT 新功能,Python 支持范围仍为 >=3.10、<3.15。评分方面新增未确定分数状态,读取 score_value 或调用 get_value() 前需检查 score.is_undetermined,部分被拦截的回复默认纳入评分,可通过 should_score_blocked_content=False 恢复旧行为。扫描器新增 Best-of-N、split-payload、多语言、音频 achilles、包幻觉、system-prompt 提取和 FigStep 等能力,并加入 bijection、CharNoise、CodeAttack、SATA、Vigenere、Acrostic、IPA 等 10 个转换器。官方称本次没有已知高优先级安全问题。

  • 动态腾讯 AI-Infra-Guard 版本发布

    腾讯 AI-Infra-Guard v4.5.1 发布:新增多种多轮越狱攻击与 MCP 安全检测规则

    腾讯 AI-Infra-Guard 发布 v4.5.1,PromptSecurity 新增 Many-Shot、PAIR、GOAT 和 ActorAttack 多轮越狱攻击。Agent-Scan 新增 5 项 OWASP 检测技能(含 agentic-supply-chain、cascading-failure、human-agent-trust、inter-agent-comm、unexpected-code-execution)及 web-exfiltration-detection 技能,MCP-Scan 新增硬编码密钥、不安全反序列化等 4 条 MCP 安全检测规则,并更新 AIG 规则至 2026-07-24。

  • 动态MITRE ATLAS 数据发布

    MITRE ATLAS 发布 v2026.09 数据更新,新增多项 Agent 与多模态攻击技术

    MITRE ATLAS 发布 v2026.09 数据版本,包含 1 个矩阵、16 项战术、120 项技术、88 项子技术、40 项缓解措施和 73 个案例研究。新增技术涵盖多模态输入中的触发器、AI Agent 响应偏置、伪造 AI 助手链接、配置错误或公开暴露的 AI 服务、发现 AI Agent 运行时能力、AI 定向隐蔽以及针对 AI 基础设施的主动扫描等。更新了 LLM 提示混淆、间接 LLM 提示注入、LLM 越狱、LLM 响应渲染和 AI Agent 点击诱饵等技术。缓解措施新增 AI 蜜罐,更新生成式 AI 护栏。

  • 动态NVIDIA NeMo Guardrails 版本发布

    NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails

    NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。

  • 动态NVIDIA garak 版本发布

    NVIDIA garak v0.14.1 发布:新增 WebSocket 生成器并移除 nemollm

    NVIDIA garak 发布 v0.14.1,新增面向实时 LLM 安全测试的 WebSocket 生成器和 OpenAI Harmony 音频输入格式,并为攻击成功率加入 Bootstrap 置信区间。该版本激活 sata 与 badchars 探针、补充简历类提示注入样例、改进 Jinja 注入检测,同时移除了废弃的 nemollm 生成器及其依赖,属破坏性变更。

  • 动态Adversa AI

    Adversa AI 梳理 Claude Code 十起攻击:多数落在配置与审批机制而非模型行为

    Adversa AI 汇总了 2025 年 9 月至 2026 年 9 月间公开的十起针对 Claude Code 的攻击,指出它们几乎都不是模型行为问题,而是落在配置文件、hook 定义、审批弹窗、MCP 工具描述、插件 pin 和 skill 包这些模型外围机制上。其中 Miasma 蠕虫在真实环境中运行,导致微软四个组织下 73 个仓库被禁用;两起获得 CVE(CVE-2025-59536 与 CVE-2026-21852,均已修复);四起被厂商以超出威胁模型为由拒绝处理。作者称十起攻击无一需要越狱,反复出现的失效点是同意机制:弹窗显示的对象与实际授权的操作不一致,这一问题出现在三个研究团队的四处发现中。

  • 论文arXiv

    LLM 仅凭监控器历史判定即可学会规避潜在空间监控

    墨尔本大学的研究者提出一种新的威胁模型:智能体只观察潜在空间监控器对先前输出的二元判定,就能推断监控器检测的概念并改写自身激活以规避检测,监控器目标从未被明确告知。在 llama-3.1-8b-instruct 上,现成模型已产生与监控方向对齐的激活编辑,但幅度不足;把该编辑放大 8 倍即可将监控器 TPR 从 100% 降至 27%。用 rank-1 LoRA 微调出的 model organism 在前向传播内完成规避,在 10 个未参与训练的概念监控器上平均 TPR 降至 0.04,且对当前激活的监控器具有特异性,其他概念监控器 TPR 仍为 0.914。机制分析显示编辑是在上下文中根据判定计算得出而非记忆:翻转上下文判定会平滑削弱并最终反转编辑方向,示例增多则与监控方向的对齐度上升,且编辑在指令块处算好后再被受监控 token 读取。

  • 论文arXiv

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    研究者提出一套仅依赖输出接口的黑盒密钥提取框架,用于从商业 API 大模型中提取被记忆的 API key。方法分两阶段:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏到本地白盒代理;再在代理上用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验筛选候选。在含 5 家厂商、4 种编程语言共 100 个真实密钥的受控基准上,恢复效果较代表性基线最高提升 57.1%,真实密钥比例最高提升 2.6 倍,构建后提取延迟降低 20.7 至 34.8 倍。真实环境评估从三个独立部署的黑盒系统中恢复了被掩码的厂商凭证,涉及 OpenAI 与 Claude Code,GitHub 搜索显示这些密钥存在公开匹配,作者出于伦理未发起实际 API 调用。

  • 论文arXiv

    CSR:跨架构统一攻击概念擦除,FLUX 露骨内容攻击成功率达 50.47%

    研究者提出 Concept Score Relearning(CSR),一个统一的参数级框架,可在各自原生预测空间内重新激活被擦除的概念,无需外部目标概念图像数据集。

  • 论文arXiv:后门、投毒与隐私

    Leaky Students:针对 on-policy distillation 的成员推断攻击

    研究者提出 Leaky,一种针对 on-policy distillation(OPD)的成员推断方法,通过采样目标模型的新轨迹并比较 token log-probabilities 与未见过候选记录的参考模型最大值,再用 Leaky ReLU 处理差值。