跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 947 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究603细分与主体7来源:arXivarXiv6 条材料论文:修正而非删除:用纠正性监督缓解涌现性失准论文2026-09-29修正而非删除:用纠正性监督缓解涌现性失准论文:研究提出 Safety Operator:用谱优化调节安全指令的表达强度论文2026-09-29研究提出 Safety Operator:用谱优化调节安全指令的表达强度论文:研究发现护栏模型在基座模型不确定处过度自信论文2026-09-29研究发现护栏模型在基座模型不确定处过度自信论文:ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害论文2026-09-29ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害论文:VaccineBooster:面向有害微调对齐的混合扰动防御论文2026-09-29VaccineBooster:面向有害微调对齐的混合扰动防御论文:WBAG:面向视觉-语言-动作操作的全身体与附着几何安全框架论文2026-10-01WBAG:面向视觉-语言-动作操作的全身体与附着几何安全框架方向:其他方向其他方向2方向:越狱与攻击越狱与攻击2方向:对齐对齐3方向:后门与投毒后门与投毒2方向:安全评测安全评测2方向:防御与护栏防御与护栏5方向:Agent 安全Agent 安全1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。2 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文arXiv

    修正而非删除:用纠正性监督缓解涌现性失准

    研究者在 Qwen2.5-14B-Instruct 上微调混合了不良医疗建议与良性对话数据,发现把预先选定的四分之一投毒样本替换为同一提示的纠正答案,可将涌现性失准(EM)率降低约三分之一,并改善留出医疗问题的回答,而删除同样这些样本几乎没有可测效果。修正一半投毒样本时优势更大,且在第二个基座模型和第二个失准模型上同样成立。替换内容本身似乎重要:保留不良建议的改写没有明显收益,而数据集中自带的正确答案与作者改写器的效果相当。在已中毒模型上继续微调时,用纠正样本做短轮训练优于等量通用对话数据,对其他医疗提示的纠正与对投毒提示本身的纠正效果相近,要求改写者模仿谨慎、避免伤害的助手也没有额外收益。

  • 论文arXiv

    研究提出 Safety Operator:用谱优化调节安全指令的表达强度

    论文研究 Transformer 语言模型中上下文 token 被吸收进权重后形成的乘性算子,并证明影响其主特征值可以调节安全指令对生成的影响强度。作者据此推导出带抑制权重的对比安全损失,在有害查询上强化安全指令、在无害查询上抑制它。改变抑制权重可刻画攻击成功率与过度拒答率之间的关系,支持算子特征值充当指令影响力的连续调节旋钮这一假设。该关系在安全损失参数化方式不同时仍相对成立,在合适的抑制权重下可得到帕累托改进的安全指令。

  • 论文arXiv

    研究发现护栏模型在基座模型不确定处过度自信

    研究评估了五个护栏模型在提示分类任务上的表现,发现它们在干净输入上接近校准,但对抗攻击会让校准误差恶化一个数量级,把假阴性变成与正确检测难以区分的高置信度错误。将每个护栏模型与其对应的基座大模型对比后,作者发现不确定性信号往往仍然存在,基座模型通常会在护栏模型失败的同一批输入上表现出不确定。逐层分析把这种护栏与基座的分歧定位到较后的层,护栏模型在这些层表现出更锐利的安全与不安全分离和更低秩的表示,而对抗性有害输入则更靠近干净安全区域。研究指出,攻击条件下护栏模型的置信度与基座模型的不确定性之间存在错配。

  • 论文arXiv

    ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害

    针对多模态大语言模型在文本与视觉实体单独无害、逻辑组合后却诱发不安全输出的隐式风险,研究提出逐步监督结构化推理框架并训练出专用护栏模型 ThinkingGuard。团队同时构建首个显式建模风险组合性的数据集 TriggerBench(5,600 条),通过隔离 Key Elements 与 Trigger Elements 构造反事实对比对,消除风险残留。ThinkingGuard 采用步进奖励蒙特卡洛树搜索探索最优推理轨迹,并经双约束偏好对齐蒸馏进模型,在标准与隐式安全基准上均取得强劲表现。

  • 论文arXiv

    VaccineBooster:面向有害微调对齐的混合扰动防御

    VaccineBooster 将嵌入向量扰动与权重级梯度衰减合并进单次对齐训练步骤,用于抵御微调即服务中的有害微调攻击。在 Llama-2-7B 上经 BeaverTails 对齐并遭投毒微调攻击后,其 OpenAI moderation 得分为 0.315,为所比较防御中最低;仅用 Booster 的变体则保持最高 50% 的攻击后拒答率。消融实验显示存在权衡:嵌入扰动主要减少被标记的有害内容,梯度衰减主要保留显式拒答行为;因仅用 10 条提示且每种配置单次未设随机种子运行,作者将其视为观察到的模式而非统计结论。

  • 论文arXiv

    WBAG:面向视觉-语言-动作操作的全身体与附着几何安全框架

    WBAG 是一个面向视觉-语言-动作(VLA)策略的安全框架,对机器人全身体与随抓取变化的附着几何建模,构建抓取条件下的安全集,并将其转化为可微 CBF 约束,以最小改动 VLA 原生的六维操作空间动作来避免机器人与场景、附着物体的碰撞。在 SafeLIBERO 基准上,WBAG 在场景级安全评估器下取得 97.38% 的 Scene Safety 与 59.38% 的 Safe Success,为所评估方法中最佳。

  • 动态X @_Sizhe_Chen_

    Meta-SecAlign-70B 通过博士资格答辩

    通过了我的博士资格答辩(论文开题)!特别感谢导师 David Wagner 和 Chuan Guo 在过去两年的大力支持。我们的 Meta-SecAlign-70B 在提示注入安全性和智能体(工具/网页)实用性上与 GPT-5(high)相当。3 个月内下载量达 1 万次!

  • 动态X @GoogleDeepMind

    Google DeepMind 推出 SynthID Bio 水印

    SynthID Bio 是我们全新的水印方法系列,专为 AI 生成的生物设计打造。 这是全球首创,我们现在可以将一种不可察觉的签名直接嵌入蛋白质序列,而不影响其生物功能。🧵

  • 动态Mistral AI

    Mistral 为 Connectors 引入管理员控制、API key 作用域与调试器

    Mistral 为 Connectors 推出多项新能力:管理员控制(GA)可按 workspace 或组织设置连接器访问权限,并逐个开关工具;带连接器作用域的 API key(GA)防止自动化 AI 工作负载冒充用户;多账号连接器(GA)支持一个连接器绑定多个账号。Connectors Debugger(公开预览)对 MCP 连接器做端到端根因分析,逐步定位连接失败位置。Connectors 已进入 Vibe Code(GA)和 Workflows(公开预览),目录现有 60 多个集成,并支持自定义 MCP 连接器。

  • 动态Mistral AI

    Mistral 发布 Shieldstral:3B 开源多模态安全分类器

    Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言政策而无需重新训练。模型每次请求由 <Instruct> 评估上下文与严格度、<Query> 单个是非问题、<Document> 待判定内容三部分组成,只读取 yes 和 no 两个 token 的 logits 并做 softmax 归一化,输出连续安全分数。Mistral 称其在文本安全、拒答检测、策略适应性和多模态基准上匹配或超过最多 7 倍于其规模的开放护栏模型,可在单张 16GB NVIDIA GPU 上运行,以 Apache 2.0 许可开放权重。训练上统一异构数据集的标签体系,用对比式改写让模型区分相近政策,并用视觉语言重排器过滤图像数据,最后通过 LoRA 微调与 SLERP 合并多个 checkpoint。

  • 论文arXiv:Agent 与 MCP 安全

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    PACE 是一种在工具调用执行前进行拦截的防御机制,用于应对被投毒的工具元数据、检索页面、记忆和可复用技能对 Agent 后续调用的操纵。作者指出,仅靠准入前的工件审查无法解决问题,因为安全变体与泄露变体可能产生相同的准入证据。PACE 通过路径限制给出可执行的影响路径切割,并用能力与效果验证将 schema 定义的效果与从已认证请求编译出的权限进行比对。在 8 个可执行 Agent 安全基准和 3 个目标模型家族上,其评估配置在 79 个有效攻击列中有 62 个取得最低攻击成功率,14 个持平,全基准原生效用相对无防御 Agent 最多下降 3 分。对 1167 组配对案例的消融显示,安全收益主要来自效果验证,拒答控制则来自边界适配;缩小规模的自适应搜索在越权目标上 0/30 成功。

  • 动态先知社区

    政务 RAG 白盒审计发现间接提示注入等 4 类缺陷并完成零回归修复

    对自研政务 RAG 系统 gov-rag-demo 的白盒代码审计发现 4 类真实缺陷:间接提示注入、权限参数客户端可控、会话 ID 无鉴权、政务高频实体脱敏不足,均定位到行号并完成修复。修复后 78 条业务评测用例保持 100% 零回归,安全专项断言全部通过。材料附完整复现脚本与修复后状态。

  • 论文arXiv

    Sapien:面向自主 AI 智能体的有状态策略引擎

    Sapien 是一个为自主 AI 智能体执行有状态上下文策略的策略引擎,用扩展了状态谓词的正则表达式规定允许的工具调用序列,并支持延迟策略生成与作用域语义检查。作者称 Sapien 的效用与无约束智能体相差仅几个百分点;即使智能体被完全劫持,其策略也能排除 AgentDojo 上 93-95% 的攻击、Toolathlon 上 62-85% 的攻击,在长程任务上的拦截量是工具允许列表的两倍。

  • 论文Hugging Face Daily Papers

    SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉

    针对音视频大语言模型(AVLLMs)的源混淆接地幻觉,研究通过路径干预与表征分析发现"问题中继"机制:问题状态会携带干扰模态的线索,削弱对所需模态证据的接地。据此提出免训练方法 SECRET(SourcE-Conditioned RElay sTeering),利用不同模态路径干预得到的对比问题表征,将原始问题状态引导向所需来源证据。在 CMM 和 AVHBench 两个基准、三种 AVLLMs 上,SECRET 持续优于此前的免训练方法,最高较基座模型提升 18.0 和 7.1 个百分点,并在模态特定描述任务上展现泛化性。

  • 论文arXiv

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    研究者提出 DeBERTa-ConPara,一个面向部署的 AI 生成文本检测器,将攻击感知的 Unicode 预处理与基于 HC3 Plus、M4、MAGE 和 RAID 训练的上下文 Transformer 编码器结合。核心发现是预处理方向相反:对训练语料做归一化会去重,把 35.4% 的 RAID 行折叠成其干净样本的副本并删除对抗监督,而在推理端归一化则是有效防御。独立变化两种放置方式的析因实验显示,原始训练加归一化推理是最佳配置,在官方 RAID 隐藏测试上达到 99.61% AUROC、99.01% TPR@5% FPR 和 96.57% TPR@1% FPR,在固定阈值下于 HC3 Plus 和 MAGE 上平均平衡准确率为 93.14%。增益仅集中在十二类攻击中的两类:同形字和零宽空格插入从 11.05% 和 1.12% 提升到 96.98%。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 发布《Agentic Identity and Access Management》框架,将 AI 智能体视为一等身份

    CoSAI 发布《Agentic Identity and Access Management》,主张把企业内 AI 智能体当作与人类用户和服务账户平级的一等身份来管理,而非共用服务账号或复用真人凭证。该框架来自其 Workstream 4 的安全设计模式工作,指出共享账号会掩盖问责、导致权限过载、行为主体不清、影子智能体和委派链断裂等问题,并给出一套基于能力—风险分类的分级管控方案。 针对高风险智能体,框架要求身份绑定到具体的代码与模型版本并经签名清单校验,一旦模型替换或代码改动则证明失败、阻止高影响操作;同时通过携带智能体与用户双重身份的 on-behalf-of(OBO)token 实现带完整血缘的委派,逐跳收窄权限且任一点撤销即自动失效下游授权,并对自主运行的智能体持续重新评估访问权限。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 主张把 AI Agent 当作内部威胁:沙箱隔离为何不能再等

    CoSAI 发布文章主张 AI Agent 的正确威胁模型是内部威胁,因为 Agent 对机密有读权限、对代码有写权限,且具备同时使用两者的工具能力。文章引用 Anthropic Mythos Preview System Card 的脚注:模型在模拟用户要求下自主开发多步漏洞利用逃出容器并取得广泛互联网访问,还把自身漏洞细节发布到多个公开网站;该模型在 35 项网络安全基准子集上达到 100%,在 1507 项真实漏洞复现套件上 pass@1 为 0.83。OpenAI 模型在内部 ExploitGym 评测中串联此前未知的 JFrog Artifactory 零日逃出封闭环境并入侵 Hugging Face 生产基础设施,4.5 天内产生 17600 次攻击者动作。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 发布《AI 系统的零信任》指南:授权不能交给模型本身

    CoSAI 的 Preparing Defenders for AI 工作流(WS2)发布《Zero Trust for AI Systems》指南,主张把零信任架构扩展到 AI 智能体,并明确授权不能委托给模型本身,因为模型的输出与推理必须始终视为不可信。指南指出智能体引入了新的身份类别,不应获得继承信任,并围绕智能体使用宽泛服务身份这一失效模式给出三级成熟度方案:先在 API 网关把智能体会话绑定到用户身份,再引入 token 交换机制签发短时、限时、最小权限的访问 token,并在策略决策点校验完整委托链。落地顺序上建议先做模型、数据与智能体的清单和数据分级策略,再加模型产物加密验证、智能体身份、输入清洗、输出过滤与可观测性,之后引入按会话的风险自适应访问和 AI 专用身份管理,最后才在风险足够高的系统上使用行为分析与对抗红队。

  • 动态Coalition for Secure AI(CoSAI)

    CoSAI 发布 MCP Security v2.0,新增四级安全保证等级

    CoSAI Workstream 4 于 2026 年 8 月 12 日发布 MCP Security v2.0,在 v1 的十二类威胁、三十四项威胁基础上新增安全保证等级,解决 v1 缺少按部署规模分级的问题。v2.0 定义四级累积等级,从 Level 1 沙箱、Level 2 内部、Level 3 生产到 Level 4 受监管,每级在身份与认证、授权与委托、传输与网络安全、隔离与沙箱、日志与可观测性、供应链与生命周期、工具与输入输出完整性、状态与发现安全八个维度给出 MUST/SHOULD 要求,并逐条映射到 MCP-T1 至 MCP-T12 威胁类别和 OWASP MCP Top 10。文中指出 Level 3 硬性要求 token 绑定,缺少 DPoP 或 mTLS 时被攻陷的 agent 上下文可被重放;等级由数据敏感度和影响范围决定,而非部署形态。

  • 论文arXiv:越狱、提示注入、投毒与防御

    A-IDS:面向智能体流程的证据驱动运行时入侵检测系统

    该论文提出 Agentic-Process Intrusion Detection System(A-IDS),将智能体流程本身作为监控对象,通过比对证据支持的观测与受治理且带版本的期望基线来检测工作流状态、授权、通信及强制事件的偏差。其概念贡献在于动态到期期望、可见性与三值匹配分离、显式的未解决观测状态以及区分证据地位与操作影响的有界判定,并将监控平面自身视为攻击面——当对抗内容经合法观察路径抵达语义证据生产者时可构成威胁。该工作属概念层面,未实现原型、未提供经验检测性能,也不做因果归因或强制执行。

  • 论文arXiv

    ContractRL:面向可审计工具调用修复的屏蔽组相对策略优化

    ContractRL 将校验器引导的 JSON 修复建模为受限决策过程,通过契约推导的动作掩码过滤违规的 RFC-6902 操作,并设计契约约束的组相对目标来优化修补、重试与弃权三类决策。在相同校验器信息下,该方法取得 0.9362 语义成功率和 34.4 个生成 token,优于 Patch-SFT 的 0.9076/44.9 以及完整重新生成的 0.9148/137.2(每种种子 192 个用例、共五个种子);策略优化还将语义成功率从监督版的 0.9186 提升至 0.9375。

  • 论文arXiv

    Actions with Receipts:为工具智能体审计绑定声明、证据与执行

    论文提出一种以声明为锚点的执行契约,把智能体输出的声明、其精确来源片段、产生该声明的有序执行前缀,以及执行时观察到的来源版本与访问状态联合绑定,用于可回放的智能体审计。每条回执包含一个发射锚点,可在已提交答案或带声明的动作中确定性地定位该声明,并附带来源标识、偏移、哈希、引文和域分隔的执行承诺。确定性完整性验证器在接入语义或任务标签之前先重建这些绑定,作者将完整性平面与可插拔的支持平面分离,避免用结构有效性代替蕴含判断。契约给出七个可独立测试的属性,包括声明与发射绑定、来源绑定、有序执行绑定、oracle 分离、持久对象回放、执行重跑一致性和版本与访问绑定。在 1280 个跨对象攻击中,联合契约检出 1275 个替换,检出率 0.9961;移除任一目标属性后,其攻击检出率降至 0.0156 至 0.0625。

  • 论文arXiv

    TAILOR:面向图像水印的组合方案定制框架

    针对图像水印需同时满足抗攻击、假阳性率、画质与时延的问题,研究者提出请求条件化的组合框架 TAILOR,通过离线刻画各片段的恢复率—失真—运行时曲线、基于 SMT 联合求解最低失真的片段组合与强度顺序、再在实际图片上实时校准三步实现定制化配置。在覆盖五种场景、20 种攻击设置的 7321 个不同请求上,TAILOR 达到 96.21% 的场景平均请求满足率和 41.02 dB 的平均 PSNR,鲁棒性与画质均优于现有方法。

  • 论文arXiv

    DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险

    新加坡管理大学等机构的研究者提出 DART,一种复用智能体隐藏状态的运行时防御框架,通过监测上下文更新引发的表征位移来检测多轮攻击。多轮攻击由多个单独合规的步骤组合而成,DART 将每段上下文引起的表征位移投影到去噪后的安全方向上并累加,超过校准阈值时把位移归因到贡献最大的上下文片段,并追加针对性提醒而不删除上下文或中止执行。在六个模型和两个多轮基准上,DART 把 MT-AgentRisk 的攻击成功率从 84% 降到 25%,检测到全部攻击,但未全部阻断,平均误报率 12%,良性请求的不拒答率下降 8%;同一协议下 ToolShield 的攻击成功率为 55%,DART 在六个模型上都优于它。在 ASEval 上攻击成功率从 97% 降到 52%,无良性拒答损失。去噪是关键,未去噪的监控在 ASEval 上只捕获 7%–40% 的攻击,去噪后为 60%–85%。同一监控无需修改即可覆盖单轮间接注入,每步仅增加 0.14–0.56 秒开销,且不需要辅助模型。