跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 1,033 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体7来源:Transformer CircuitsTransformerCircuits2 条材料来源:Failure-FirstFailure-First4 条材料动态:Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征动态2025-04-29Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征动态:Anthropic 可解释性团队解析多选题有害压力下的拒答机制动态2025-11-26Anthropic 可解释性团队解析多选题有害压力下的拒答机制动态:Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型动态2026-07-30Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型动态:IHDec:用发散度引导对比解码维护多轮指令层级动态2026-08-04IHDec:用发散度引导对比解码维护多轮指令层级动态:免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性动态2026-08-10免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性动态:基于模型预测控制的思路实现安全强化学习动态2026-08-24基于模型预测控制的思路实现安全强化学习方向:思维链监控思维链监控1方向:AnthropicAnthropic2方向:对齐对齐2方向:可解释性可解释性3方向:其他方向其他方向2方向:防御与护栏防御与护栏6方向:Agent 安全Agent 安全1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。5 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Transformer Circuits

    Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征

    Anthropic 可解释性团队发布 4 月更新,用电路追踪方法分析一个失败的越狱提示,发现模型拒绝该提示的原因与拒绝直接请求不同,且拒绝倾向反而高于普通提问。该提示要求把 B O M B 拼成单词并说明如何制造炸弹,归因图显示模型并未激活与制造炸弹相关的特征,而是由炸弹概念直接触发有害请求特征;把 make 换成 detect 后模型仍拒绝,且首句与有害版本完全相同。团队用干预实验验证机制:抑制 say bomb 超级节点后 say making 激活降至原来的 1%,模型转而输出与炸弹无关的拒答内容。附录指出特征可视化若数据不够多样会产生误导,并列出 30M CLT 模型中最密集的 10 个特征及其解释,其中 6 个可解释。

  • 动态Transformer Circuits

    Anthropic 可解释性团队解析多选题有害压力下的拒答机制

    Anthropic 可解释性团队在 2025 年 11 月的 Circuits Updates 中报告,Claude 3.5 Haiku 在无有害意图时对 129 道二选一多选题准确率为 100%,加入有害意图表述后降至 48.1%。研究发现注意力机制是关键:有害检测 key 特征与拒答 query 特征负向交互,压低了对正确答案的注意力分数,使答案选择头转而关注错误答案。团队识别出一个拒答特征,在广泛语料上表现为检测到用户请求有害后提供替代方案,称为 refuse and redirect;对该特征做负向引导可将数据集准确率恢复到 93%,仅对部分中层注意力头的 query 侧做更精细干预也能达到同样效果。

  • 动态Failure-First

    Yuvion LLM:面向内容与 AI 安全的对抗感知大语言模型

    Yuvion LLM 提出将对抗鲁棒性与智能体能力列为一等目标的安全模型,通过五类功能性数据和三阶段训练流程应对语义伪装下的有害请求。其数据体系涵盖通用、安全域、对抗、智能体和合成专家数据,分别支撑语言能力、风险分类学、混淆变体(拼音替换、符号替代)、工具调用轨迹与长尾高风险场景覆盖。训练分三阶段推进:知识增强持续预训练内化细粒度审核政策,基于政策的监督微调加 GRPO 打磨决策边界,再以分解密集奖励稳定工具集成与检索增强的多步安全工作流。

  • 动态Failure-First

    IHDec:用发散度引导对比解码维护多轮指令层级

    Liu 等人提出 IHDec,一种免训练、推理时的干预方法,通过实时 logit 调整维护大语言模型的指令层级(System ≻ User ≻ Assistant ≻ Data)。作者用 Jensen-Shannon 散度作为诊断工具,当低优先级角色对下一 token 分布的影响超过高优先级角色时触发冲突集,再用专家与反专家对比解码生成校正向量,并采用 ϵ=1×10−8 的归一化项和 0.97 的衰减因子保证稳定性。在 IHEval 基准上,IHDec 比训练式方法 ISE 提升 11.98 个百分点;在 Llama-3.1-8B-Instruct 的多轮冲突场景达到 50.68% 准确率,而 ISE 为 12.60%。

  • 动态Failure-First

    免训练概念定位方法提升 ViT 对文字排版攻击的鲁棒性

    Liu 等人的研究提出免训练方法,定位并抑制 Vision Transformer 中导致文字排版攻击的特定模块,从而提升模型对图像内干扰文字的鲁棒性。该方法基于线性表示假设,通过随机采样在 MHSA 瓶颈的低维子空间搜索与词汇概念对齐的“获奖向量”,并用基于梯度的归一化文本归因分数 nTAS 定位高脆弱性注意力头。干预方式有两种:在 CLIP 类骨干中重加权 patch token 影响,在缺少 class token 的 LVLM 中将脆弱模块输出置零。

  • 动态Failure-First

    基于模型预测控制的思路实现安全强化学习

    Schäfer 等人提出将 MPC 用作离线安全预言机来预先计算可行状态-动作空间的安全强化学习框架,使机器人与赛博物理系统的探索保持在数学验证过的边界内。该方法通过网格搜索加二分搜索映射连续动作空间的凸区间,并用投影过滤器拦截不安全动作。作者在 Quanser Aero 2 单自由度俯仰平台上做了验证。 补充说明: - 该工作针对标准 RL 在高惯性硬件上的无约束探索风险,定义了不可逆的"临界点"——即可行集边界。 - 安全性判定依赖 MPC 优化器在未来预测视野内找到有效动作序列,且视野需超过系统停止距离以保证递归可行性。

  • 动态Failure-First

    LulzBench 实测:MiniMax-M3 拒绝五分之一良性底线对照请求

    Failure-First 公布的首批托管样例中,MiniMax-M3 经托管的 OpenAI 兼容端点运行 LulzBench 全部 21 项良性底线对照,捕获 21/21、无供应商报错,其中 4 项遭拒答且均为真实的带理由拒答,三项涉及轻度恶习或社交劝说前提。同一道雪茄健康玩笑辩论题在一次采样中被完整作答、另一次却拒答,两次采样的 token 预算也不同,因此该不稳定现象无法由单次跑分定量其抽样方差,需做 n-of-k 重采样实验来锁定拒答率。

  • 动态Google Threat Intelligence

    Google Cloud Run 无认证公开函数的安全风险与加固指南

    Mandiant 安全评估发现大量缺乏认证的公网暴露 serverless 应用,Cloud Run 服务若含第三方依赖易遭本地文件包含(LFI)、远程文件包含及命令注入攻击,成功利用可获得容器实例完整控制权并进一步横向移动接管云环境。该博客基于客户实战经验梳理攻击场景,针对必须公网开放的 Google Cloud Run 服务和函数给出一组加固建议,相关原则同样适用于任意公有 serverless 部署。

  • 动态Google Threat Intelligence

    Google 详解 AI 辅助漏洞管理:从确定性管控到 ZDR 的操作蓝图

    Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。

  • 动态Google Threat Intelligence

    Google Threat Intelligence Group 供应链入侵缓解指南:开放源代码软件生态威胁活动激增

    Google Threat Intelligence Group(GTIG)联合 Mandiant 发布了针对软件供应链入侵的加固与缓解建议,指出 2025 年至 2026 年上半年出现了大规模的开源软件供应链入侵行动,涉及代码仓库、依赖项及开发者工具的攻陷。 其中,UNC6780(又名 TeamPCP)于 2026 年 2 月至 5 月在 PyPI、npm、Docker Hub 发动广泛攻击,滥用 GitHub Actions 的 pull_request_target 触发器获取基础仓库密钥并植入凭证窃取程序 SANDCLOCK,还试图从被感染的 AI 软件横向渗透到企业网络环境。

  • 动态Google Security

    Google 详解 Gemini 抵御间接提示注入的分层防御策略

    Google GenAI 安全团队介绍了 Gemini 针对间接提示注入的分层防御策略,覆盖提示词生命周期的各个阶段。该策略包括对 Gemini 2.5 模型进行对抗数据训练以增强模型韧性,并叠加五项内置防御:提示注入内容分类器、安全思维强化、Markdown 清洗与可疑 URL 屏蔽、用户确认框架以及面向终端用户的安全缓解通知。

  • 动态Google Security

    Chrome 公布智能体能力的分层安全架构

    Chrome 安全团队公布了针对 Gemini 智能体浏览能力的分层防御设计,核心应对威胁是间接提示注入。团队引入 User Alignment Critic,由与不可信内容隔离的独立模型在规划完成后复核每个拟执行动作,判断其是否符合用户目标,不通过则否决并反馈给规划模型重新规划。Chrome 还扩展同源隔离理念提出 Agent Origin Sets,把每个会话的来源分为只读与可读写两类,只允许智能体读取任务相关来源的数据,并限制数据只能流向可写来源,模型生成的 URL 需经确定性检查限定为已知公开 URL。

  • 动态Simon Willison

    MCP Colors:系统化应对提示注入风险

    Tim Kellogg 提出用颜色分类 MCP 工具来应对提示注入风险:红色代表会接触不可信指令的工具,蓝色代表攻击者不应触发的关键操作,智能体可据此避免两类工具同时混用。他建议用 _meta 对象记录 MCP 工具与资源的颜色,并借助 LLM 为约 200 个工具批量打标,使分类标准可扩展到初始工具集之外。

  • 动态Simon Willison

    Claude Code 推出 auto mode,用 Claude Sonnet 4.6 分类器替代跳过权限

    Claude Code 新增 auto mode 权限模式,由 Claude 代替用户做权限决策,并在动作执行前由护栏审查,作为 --dangerously-skip-permissions 的替代方案。护栏由独立的分类器模型实现,运行在 Claude Sonnet 4.6 上,即使主会话使用其他模型也如此;分类器会拦截超出任务范围、指向不可信基础设施或疑似受文件与网页中恶意内容驱动的动作。用户可在终端运行 claude auto-mode defaults 查看完整默认规则 JSON,并可用自定义规则扩展。

  • 动态Simon Willison

    OpenAI 上线 Lockdown Mode,限制提示注入后的数据外泄

    OpenAI 正式上线 Lockdown Mode,此前在 2 月已有预告,现面向符合条件的个人账户(Free、Go、Plus、Pro)及自助式 ChatGPT Business 账户推送。该模式通过限制可能把敏感数据传给攻击者的对外网络请求,阻止提示注入攻击的最后一步数据外泄,但不会阻止提示注入出现在 ChatGPT 处理的内容中,例如缓存网页或上传文件里的注入仍可能影响回答的行为或准确性。Simon Willison 认为这一设计直接切断了致命三要素中的数据外泄环节,且所用机制是确定性的,不依赖可能被复杂攻击绕过的 AI 系统来判定。

  • 动态Goodfire Research

    Goodfire 提出基于探针的数据归因方法,定位并缓解 LLM 后训练中的有害行为

    Goodfire Research 提出基于探针的数据归因方法,可定位 LLM 后训练中涌现的有害行为对应的训练数据点。研究以 OLMo 2 7B 的 DPO 训练为自然测试床:模型在有害请求后附加格式约束(distractor)时从拒答转为顺从,该现象在 OLMo 2 32B 上更强。方法将行为变化与训练数据点都表示为模型激活向量,用余弦相似度匹配,再用 Grok 4 生成的 150 条提示构建探针向量。过滤探针排名最高的 3 万个数据点后,有害行为下降 63%,且 GSM8k、IFEval、XSTest 性能无明显损失;交换这些数据点的 accepted/rejected 标签可下降 78%。

  • 动态Google Threat Intelligence

    Google GTIG 发布 CI/CD 与代码流水线主动防御蓝图

    Google Threat Intelligence(GTIG)发布面向软件与平台架构师的 CI/CD 安全防御蓝图,围绕端点、IDE、AI 辅助安全等五个支柱给出加固措施。文中指出攻击者正通过 GitHub Actions 缓存投毒、OIDC token 提取和篡改可变 action 标签发布带合法来源证明的恶意包,并已开始向开源 MCP 包植入恶意代码、诱骗 AI 编码智能体。建议仅使用经批准的大语言模型与 AI 智能体做合并前漏洞分析,将 .env 文件排除出上下文窗口,并保留人工审核环节。

  • 动态Microsoft PyRIT 版本发布

    PyRIT v1.0.1 修复结构化拒答处理

    Microsoft PyRIT 发布 v1.0.1 补丁,修复 OpenAI Responses 与 Chat Completions 返回结构化拒答时被误判为解析/运行时失败的问题。此前目标模型的拒答会导致攻击目标未完成并抛出误导性的 ValueError,现在拒答会被正常记录和评分,真正的部分执行则抛出 ScenarioPartialFailureException。使用 OpenAIResponseTarget 或 OpenAIChatTarget 对接近期 OpenAI 与 Azure OpenAI 模型的用户应升级;该版本还调整了推理模型响应片段顺序,将 reasoning 排在 text 之后。

  • 动态NVIDIA NeMo Guardrails 版本发布

    NVIDIA NeMo Guardrails v0.21.0 发布:新增并行执行输入/输出护栏引擎 IORails

    NVIDIA NeMo Guardrails 发布 v0.21.0,引入优化后的输入/输出护栏引擎 IORails,支持并行执行 NemoGuard 的内容安全、话题安全和越狱检测三类护栏,并带日志记录与请求 ID。该版本还新增 LLMRails.check_async 方法实现独立的输入/输出护栏校验,使护栏服务器兼容 OpenAI(含新的 v1/models 端点),并通过 GuardrailsMiddleware 接入 LangChain 智能体。社区集成方面加入 PolicyAI 内容审核、CrowdStrike AIDR 及基于正则表达式的检测护栏,同时将嵌入索引初始化改为惰性加载以改善启动性能。

  • 动态NVIDIA NeMo Guardrails 版本发布

    NVIDIA NeMo Guardrails v0.22.0 发布:LangChain 解耦、IORails 里程碑 2

    NVIDIA NeMo Guardrails v0.22.0 将 LangChain 从核心依赖降为可选,OpenAI 兼容 LLM 改用内置 httpx 客户端,其他场景可通过 NEMOGUARDRAILS_LLM_FRAMEWORK=langchain 重新接入。新编排引擎 IORails 进入第二阶段,支持流式输出、OpenTelemetry 和推理模型,并在非流式模式下实现推测生成,让输入护栏与主模型响应并行以隐藏延迟。该版本还引入匿名使用统计,可通过 NEMO_GUARDRAILS_NO_USAGE_STATS=1、DO_NOT_TRACK=1 或配置文件退出。

  • 动态NVIDIA NeMo Guardrails 版本发布

    NVIDIA NeMo Guardrails v0.23.0 发布:IORails 扩展工具调用与可观测性

    NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。

  • 动态NVIDIA NeMo Guardrails 版本发布

    NVIDIA NeMo Guardrails v0.24.0 发布

    NVIDIA 发布 NeMo Guardrails v0.24.0,IORails 现可直接执行库内 67 项输入输出接口中的 59 项,并与 LLMRails 共享同一底层实现。该版本引入引擎中立的 RailOutcome 契约、声明式的 rail manifest 以及统一的对外 HTTP 客户端,同时新增 F5 Guardrails 集成、服务器健康检查端点及通过 `/v1/checks` 进行输出检查的功能。

  • 动态NVIDIA NeMo Guardrails 版本发布

    NVIDIA NeMo Guardrails v0.24.1 发布

    NVIDIA NeMo Guardrails 发布 v0.24.1 补丁版本,集中修复若干缺陷。该版本修正了 benchmark 中 Locust 并发测量与扫描、content-safety 对 Nemotron 3.5 响应的解析、server 在 IORails 准入丢弃时返回过载响应,以及 rails 对组合配置加载 config.py 的问题。

  • 动态NVIDIA garak 版本发布

    NVIDIA garak v0.15.0 发布:新增多轮 GOAT、Agent breaker 与系统提示提取探针

    NVIDIA garak 发布 v0.15.0,新增多轮 GOAT、Agent breaker 和系统提示提取三类探针,并加入同形异义混淆提示走私检测及 ModernBERT 拒答检测器。该版本还引入 NeMoGuardrails 服务器支持和带推理轨迹的测试生成器,改进 REST 生成器的 mTLS 客户端证书认证并为 Bedrock 生成器增加推理模型支持,同时修复编码检测逻辑翻转等问题。