全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:可解释性
检测与抑制:针对 VLA 模型对抗补丁的机制可解释性防御
研究者用稀疏自编码器(SAE)分析 VLA 模型内部表征,找到一个激活与对抗补丁存在强相关的特征,并仅在线性探针检测到攻击时于推理阶段抑制该特征,无需微调即可提升鲁棒性。在 LIBERO-10 上的对抗补丁攻击测试中,条件式干预提升了间歇性攻击下的成功率,而持续施加同一干预会显著损害策略性能,表明控制干预时机对减少对正常策略行为的干扰至关重要。
- 论文论文追踪
AgentSecGraph:面向 LLM Agent 的安全感知依赖分析框架与 AgentSecBench 语料
研究者提出 AgentSecGraph,一个以候选操作为中心的安全感知静态分析框架,为每个安全敏感操作构建 Security-Aware Agent Dependency Graph(Security-ADG),在操作身份之外加入 Agent 相关性、来源与依赖证据、信任边界上下文、护栏证据和外部效应语义。配套发布的 AgentSecBench 覆盖 11 个生态、67 个真实 LLM Agent 仓库、37,542 个源文件;当前分析器在 65 个仓库中识别出 23,866 个静态安全敏感操作候选,并为每个候选生成一份 Security-ADG 产物,全语料分析耗时 50.8 分钟,为 9,821 个候选(41.15%)恢复来源到操作的依赖证据,为 3,075 个(12.88%)恢复潜在护栏证据。
- 论文论文追踪
Pincer:用数字分身学习用户偏好并执行动态最小权限
研究者提出 Pincer,一种在资源层运行、可与工具调用层现有防御并行的 Agent 防御方案。其核心是数字分身,一个隔离上下文的模型,自动学习并执行针对具体用户的动态最小权限策略,在 Agent 发出权限请求时充当用户代理。为模拟学习阶段,作者构建了一个以用户为中心的数据集,样本来自多天的用户与 Agent 交互记录。评估显示,Pincer 在安全性和实用性上均优于多个基线,包括多种 LLM 评判器变体和 Conseca(HotOS '25)的改造版本;在部分攻击类型上,其设计带来的安全提升明显高于所有其他基线。论文指出,当前 Claude、Codex 等部署中的 Agent 主要依赖用户维护策略与 auto mode 沙箱,前者会随时间失效并造成用户疲劳,后者的工具调用分类器不学习用户特定策略。
- 论文论文追踪
AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐
研究者提出 AgentTrap,一种面向自主渗透测试 Agent 的闭环蜜罐,通过哨兵端点避免误伤正常流量、基于被保护应用的状态化欺骗,以及行为引导的升级策略来维持交互并收集 Agent 侧行为证据。在部署的 Web 应用中,研究团队用真实应用端点与独立蜜罐端点、三种防御策略对八种自主渗透测试 Agent 进行评测。相比无防御,AgentTrap 将真实目标的总体攻击成功率从 95.8% 降至 79.2%,并在 18.8% 的运行中成功诱导出攻击方 API key,效果优于静态欺骗与固定升级策略。轨迹分析显示,Agent 抵御此类反制的能力同时取决于模型层面对欺骗性请求的识别和架构层面对敏感资源的隔离。
- 论文论文追踪
COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
剑桥大学等机构的研究者提出 COBRA,一种针对计算机使用 Agent(CUA)分支引导攻击的系统级防御架构。作者指出,Dual-LLM 模式虽能保证控制流完整性,但在图形环境中计划必须按运行时网页内容分支,攻击者可构造不可信数据把 Agent 推向预先批准的危害路径,而无需注入新指令。为此作者构建 STEER-Bench,覆盖 9 个领域 101 个任务,测得分支引导攻击对标准 CUA 的攻击成功率为 94.4%,对原版 Dual-LLM 为 89.5%。COBRA 在规划阶段为每个分支预先固定目的地、端点和工具参数约束,由 Branch Resolution Hub 校验运行时分支与参数,并在 HTTP 与 MCP 代理处强制执行。代码已开源于 GitHub。
- 论文论文追踪
研究显示少样本微调可绕过安全层局部冻结与修复防御
研究者测试了针对少样本有害微调的安全层定位与修复防御能否在攻击变化后继续生效。在来自四个模型家族的六个检查点上,攻击后有害与良性提示仍线性可分,把完整干净隐状态打补丁进受损模型可在可复现的过渡深度恢复拒答。但按该深度冻结所有层后重做攻击,在一百条有害样本下六个检查点拒答率仍接近零,恢复过渡出现在冻结边界之上。第二项研究中,移除更新最大的两个奇异方向可在四个检查点的短时仅注意力微调后恢复拒答;在 Llama-3.1-8B 上,常规训练变化会削弱这种修复,攻击者分散更新即可将其击败,而在良性 Llama 微调上校准的谱检测器漏掉了该检查点上的多数修复失败。作者据此提出针对自适应微调防御的五项检查,代码已公开。
- 动态Apple Developer
Apple 调整 macOS 完全磁盘访问权限管控
Apple 宣布将为 macOS 的完全磁盘访问(Full Disk Access)引入额外管控,用户只有在非常明确的主动操作下才能授予应用这一权限。Apple 称部分开发者对该权限的使用方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史等内容,对通讯类应用还会波及通信对象的隐私。Apple 表示,随着 AI 智能体能力与自主性增强,这一级别访问权限带来的风险将大幅上升。
- 论文论文追踪
TACIT:从 LLM 内部状态检测 Agent 轨迹危害
多伦多大学研究者提出 TACIT,用冻结 LLM 内部状态的线性探针判断工具调用轨迹是否安全,不解码任何 token。分析发现,现有开源护栏模型对不安全工具使用在输出上仅相当于随机水平,但该区分在模型内部状态中线性可读,且与有害内容方向近乎正交,两者不能互相替代。在六个轨迹安全基准上,TACIT 将平均 macro-F1 从最强开源护栏的 62.3 提升到 86.2(Qwen3-4B)和 85.4(Llama-3.1-8B);每个基准完全留出训练时仍以 65.7 对 61.1 领先。相同骨干、数据与测试划分下,冻结读数与全量安全微调相当,叠加在微调模型上还能进一步提升;探针可训练参数量约为全量微调的百万分之一,训练时间约六分之一,推理延迟 40ms,低于 Qwen3Guard 的 215ms。
- 论文论文追踪
依赖引导回滚修复:为记忆增强 Agent 恢复错误记忆后的答案与状态
研究者提出依赖引导回滚修复(dependency-guided rollback repair),用于在记忆增强 Agent 执行失败并诊断出错误记忆后,同时恢复答案与持久状态并保留未受影响的工作。该方法从运行时溯源构建带类型的记忆到动作图,追踪显式下游依赖,保留有独立可信支持的候选,停用无支持的记忆状态,并只选择性重放与答案相关的受影响计算。在覆盖三个工具使用领域、四类记忆故障的 150 例受控基准上,恢复率达 85.3%,高于最佳对比方法的 77.3%,同时移除全部被诊断的错误记忆并保留全部良性记忆;在改编自 LongMemEval-V2 的 50 例轨迹压力测试中恢复率为 68.0%,对比方法为 54.0%,主张失效 F1 为 0.669 对 0.603。作者指出结果并不代表轨迹重建全面更优,而是显示该方法在恢复与成本之间取得较好权衡。
- 论文论文追踪
上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移
上海交通大学与上海人工智能实验室等机构的研究者提出 trait-direction drift 机制,解释模型蒸馏中潜隐学习如何发生:带偏置系统提示词的教师模型生成数字序列等语义干净的数据,其序列级偏好差距在期望上为正,学生可识别的差距在监督微调中累积成沿特质方向的漂移,进而产生行为迁移。基于该机制,作者提出探针空间走廊正则(probe-space corridor regularization),在蒸馏过程中约束沿校准特质方向的漂移。实验显示,该方法把恶意回复迁移率从 29.55% 降至 6.45%,主任务准确率损失很小,并在 Qwen 设置下持续抑制动物偏好迁移;Llama 设置中猫头鹰偏好从 17.8% 降至 0.6%。跨模型迁移在目标学生排序后仍明显弱于同模型设置,作者通过诊断与干预实验分析了这一衰减。
- 论文论文追踪
贝叶斯辩证论证(BDA):面向持续对抗下多 LLM 委员会的可校准聚合
针对多 LLM 委员会在部分智能体持续不可靠时置信度无法反映正确概率的问题,研究者提出贝叶斯辩证论证(BDA),把委员会中提议、质疑、让步等类型化动作视为带每个智能体可靠度的标注者模型观测,从而将多智能体审议转化为可靠度估计问题。BDA 按推断出的智能体可靠度加权证据,输出候选答案的可校准后验概率,并能反转而非仅票数压制持续不可靠的智能体。在二分类与多分类基准上,BDA 在零额外 LLM 调用成本的委员会聚合方法中取得最佳校准,并在持续对抗联盟下提升鲁棒性,干净场景中仍具竞争力。
- 论文论文追踪
研究者提出自蒸馏方法让 LLM 遵循上下文水印指令
研究者提出两阶段自蒸馏训练方法,让大语言模型在遵循上下文水印(ICW)指令的同时保持回答质量。ICW 通过在查询前附加指令,要求模型在回复中嵌入可统计检测的信号,第三方无需访问模型内部即可调用。团队同时发布 ICWBench 基准,包含三类可验证的 ICW 指令族,分别从可检测性和回答质量两方面评分;对 14 个前沿闭源与开源模型的评测显示,没有一个模型能在三类指令上同时满足两个目标。所提方法无需更强模型蒸馏、无需人工标注、也不依赖模型已有的 ICW 指令遵循能力:第一阶段用同一基础模型同时充当教师和学生,通过指令等价的解码时 logits 扰动让教师遵循指令,再训练学生匹配教师的输出分布;第二阶段以自动验证器为奖励做强化学习。
- 论文论文追踪
CAGE:面向工具调用 Agent 的类型化返回不确定性认证授权方法
研究者提出 CAGE,用于在工具返回存在绑定错误与数值漂移时,判断候选动作是否仍处于授权范围内。作者证明分类通道与数值通道分别认证无法组合,各自安全的扰动可能联合使同一动作变得不安全,因此 CAGE 直接对联合邻域做认证,精确枚举离散分支并在每个分支内认证连续扰动。在合成、policy-as-code、监管与真实交易等场景中,CAGE 消除了精确逐点门控会放行的预算内误授权,同时保留一定比例可自主执行的决策。当策略可执行时由 CAGE-Exact 认证策略本身,否则由 CAGE-Lip 与 CAGE-RS 在明确且可测量的保真度假设下认证学习得到的门控。
- 论文论文追踪
Twin Agent:面向权限分离智能体的上下文残差压缩
研究者提出 Twin Agent,一种受残差编码启发的通用权限分离设计模式,用于抵御来自不可信上下文的提示注入攻击。该设计由两个近似对称的智能体组成:Explore Agent 检查不可信信息,Safe Agent 执行特权操作;Explore Agent 以 Safe Agent 当前上下文为条件,只向其传递关于下一步动作的紧凑提示,从而减少维持任务效用所需的信息量。作者通过测量提示长度变化时效用与攻击成功率的变化,验证了该设计在安全与效用之间取得更好的权衡。在 SWE-bench Lite 的长程软件工程任务以及 AgentDojo、DecodingTrust-Agent 的异构多工具交互任务上,Twin Agent 在保持高任务效用的同时阻止了提示注入攻击,表现优于无防御智能体和权限分离基线。
- 论文论文追踪
IntentCap 提出按任务意图限定 LLM Agent 权限的机制
论文 IntentCap 提出 LLM Agent 的能力应按当前任务意图限定,而不是按沙箱或会话生命周期限定。作者指出,用户请求、工具返回结果、文档、shell 输出、Skill 与 MCP 指令、记忆等上下文来源都进入同一规划通道且影响力相同,但信任级别不同,对抗注入或范围意外扩大都可能让低信任来源获得选择目标或扩大权限的能力。IntentCap 从用户意图、工作流指令、工具 schema 和运行时环境四类来源组合能力,采用字段级归属与单调收窄,任一来源都不能填补其他来源的字段,生成的租约只能收窄用户已授权权限。系统用 LLM 生成短期租约,由确定性检查器在任何副作用提交前校验,并通过工具层与操作系统层的信息流策略执行。评估显示 IntentCap 能阻断测试中的违规行为且不拒绝正常操作,各来源边界均独立必要,检查器可跨工具、执行、放置和委派边界泛化。
- 论文论文追踪
AMS 工具通过激活分析检测语言模型的安全训练改动
研究者提出 AMS(Activation-based Model Scanner),通过测量激活空间中安全相关概念的几何结构来检测语言模型的安全训练改动。安全训练会在有害与良性内容类别间形成可测量的分离,部分安全改动会破坏或旋转这一结构,另一些则保持不变。作者在 Llama、Gemma、Qwen、Mistral 四个架构家族、14 个模型配置和四类安全改动(指令微调、基座、abliterated、无审查微调)上验证 AMS,阈值留一交叉验证准确率为 71%(10/14),sigma 点估计的 bootstrap 95% 置信区间中位宽度为 3.4 sigma。在每模型 20 条分层 JailbreakBench 提示上的行为合规测试显示,有害内容概念的 sigma 可预测合规程度,Pearson r = -0.546(p = 0.043),方向一致但噪声明显。
- 论文论文追踪
CAVA:面向智能体 AI 运行时治理的规范动作验证与证明
论文提出 CAVA(Canonical Action Verification and Attestation),一个运行时语义层,用于把本地编码钩子、SDK 工具、浏览器自动化、托管智能体轨迹、API 网关和工作流引擎等异构运行时中的智能体活动转换为规范运行时动作对象。CAVA 位于 Proof-Carrying Agent Actions(PCAA)之下,PCAA 定义部署方拥有的路线-审查-证明治理流程,CAVA 定义该流程所治理的稳定动作对象。论文形式化了规范动作身份、语义模式检测、审批绑定、回执完整性、运行时可移植投影和可选证明基底。作者通过一个 96 种子、384 变体的基准测试参考实现,覆盖语义等价、语义分离、包装器绕过、误报控制、审批绑定、回执可复现性、证明篡改检测、运行时可移植性、语义模式检测、策略退化和 Azure 部署演练。
- 论文论文追踪
Janus:面向长时程智能体安全的前瞻性潜在风险预测框架
研究者提出 Janus,一个面向长时程智能体安全的前瞻性框架,通过多智能体模拟合成多样化轨迹,训练护栏模型从部分轨迹中预判延迟风险。Janus 联合优化风险预判与安全裁决两项任务,采用 CoAA-RL 以预判对下游安全判断的效用作为奖励。所得护栏模型 Vanguard 可在动作执行前拦截不安全行为,在四个智能体安全基准上平均防护能力较基线护栏提升 15.9 个百分点,同时良性任务完成率提升 5.1 个百分点。
- 论文论文追踪
拆解 LLM 交互中的隐私-效用权衡:Veilmind-4B 意图驱动本地保护框架
研究系统分析了 LLM 交互中隐私清洗对下游性能的影响,揭示三项机制:数据价值随用户意图在关键约束与可弃噪声间切换、清洗方式(删除或替换)取决于任务对事实完整性还是结构连贯性的依赖、属性间存在协同依赖或对抗冗余的语义网络。据此提出意图驱动的本地保护框架,蒸馏轻量模型 Veilmind-4B 驱动动态提取-清洗-恢复流程,在保持低泄漏隐私点的同时,响应效用显著高于现有隐私基线,将隐私-效用权衡推向帕累托前沿。
- 论文论文追踪
研究测量 LLM Agent 记忆投毒防御的良性场景开销
研究者搭建统一测量装置,在记忆后端、检索流程和评判模型保持一致的前提下,只改变防御本身,评估 LLM Agent 记忆投毒防御在完全良性流量下的效用损失与 token 开销。测试覆盖三种写入时防御(输入清洗、来源检查、基于 LLM 的异常检测)和一种读取时防御(重排序),每种条件在五段对话上重复三次,以区分真实效应与流水线噪声。写入时防御未显示出可分辨的效用损失,95% 置信区间约为正负 4.5 个百分点并包含零。重排序器则使核心准确率下降 4.4 个百分点(95% CI [-9.0,-0.05],bootstrap;McNemar p=0.064),该结果可复现但处于测量分辨率边缘;在无攻击对话中,它隔离了 33.6% 的合法记忆条目,单段对话最多出现 106 次误隔离,token 开销为 2.7%。研究认为,决定防御良性场景代价的是它拦截流水线的位置,而非是否使用 LLM。
- 论文论文追踪
Planarian:用状态点管理 Agent 的本地与远程状态
研究者提出 Planarian,一个带状态管理能力的 Agent 运行时,让 Agent 和用户能从错误操作中恢复,并在一致的本地与远程环境状态上探索替代执行路径。其核心抽象是 agent statepoints,即环境状态在某一时刻的一致、可恢复版本。Planarian 向 Agent 和用户暴露三个原语:snapshot 通过增量进程与文件系统快照捕获本地沙箱状态,并以补偿动作透明记录远程状态变更,无需外部服务支持 checkpoint;rollback 回退到先前的本地 checkpoint 并重放补偿动作以撤销远程变更;fork 从某个 statepoint 创建多个隔离分支,让 Agent 并行探索不同方案。作者称 Planarian 能让 Agent 撤销错误并并行探索替代方案,任务质量最高提升 15 倍,用户从错误操作中恢复的额外开销仅 3%。
- 论文论文追踪
论文:容器、权限规则与沙箱都无法区分读取研究代码的是编译器还是编码 Agent
Shobhan Roy 的论文指出,基于物理的求解器必须让编译器读取某些模块,但同一批知识产权不应被编码 Agent 读取,而现有工具链并不自带这条规则。作者针对容器、权限规则和沙箱三种隔离手段,对十五条读取路径做了分类,结论是三者都无法判断究竟是哪个程序在读取文件。论文共 6 页,含 1 张图和 1 张表,随附分类与历史脚本及其输出,归入 cs.CR、cs.AI 与 cs.SE,编号 arXiv:2609.35557。
- 论文论文追踪
AgentRewind:面向长周期 LLM Agent 的可恢复执行框架
研究者提出 AgentRewind,一个运行时恢复框架,通过记录 Agent 上下文与受控环境对齐的检查点,让 Agent 能回到较早状态并利用此前尝试的信息继续执行,以应对长周期任务中早期错误在上下文和环境状态中传播、后续动作难以逆转的问题。作者同时构建 MettleBench,用于评估包含一系列相关需求的长周期工程任务上的任务完成度与部分进展。在多种任务、多个模型、执行策略和 Agent harness 上的实验显示,AgentRewind 相比对比基线提升了任务成功率和平均清单进度。论文共 19 页、5 张图,发布于 arXiv(2608.14380)。
- 论文论文追踪
FlowReview:以授权配对评测控制多智能体组合信息流
研究者提出授权配对评测(authorization-paired evaluation),把拦截被禁止用途与完成必需授权用途设为同一成功标准,并给出 FlowReview 框架,串联对象解析、权限排序与确定性执行。在受控组合实验中,对组合产物进行审查把拒绝提交率从 86.0% 降到零,且未损失授权供给。作者据此指出,仅保留信息与来源血缘不足以确保正确的权限归属,对象身份与权限必须通过输出可验证的组件与执行保持连接,多智能体安全需要在治理组合信息流的同时保留使协作有价值的授权能力。论文共 44 页、9 张图,代码与数据已公开。