全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
SBW:面向 LLM 智能体的语义行为水印方法
研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。
- 论文arXiv
面向大语言模型的参数内记忆增强综述
一篇综述系统梳理了在部署阶段为大语言模型(LLM)增强"参数内记忆"的方法:把承载记忆的参数对象在推理时接入前向传播,以补充上下文学习(ICL)占用上下文容量、重复离散编码成本随上下文长度增长的问题。综述用两个正交维度组织该领域:参数放置位置(Embedding、Attention、FFN 层或 Hybrid)与参数获取时间(部署中在线获取 vs 部署前离线获取),并讨论了干扰、安全、与 ICL 协同设计及递归自我改进等开放方向。
- 论文arXiv
NetAgent:面向多任务网络流量分析的智能体框架
NetAgent 是首个用于多任务流量分析的智能体框架,无需任务特定训练即可完成复杂任务理解、动态分解编排与长时程分析。它包含知识增强的工作流规划、150+ 工具的动作空间、统一代码执行空间、三层记忆以及沙箱与运行时修复五项设计。在 9 个基准上,NetAgent 在几乎所有任务上超越 23 个单任务和 5 个多任务基线,对未见流量分布的 F1 达 90.04%,而最佳基线仅为 2.74% 和 3.04%。
- 论文论文追踪
TRACE:仅凭 checkpoint 更新审计大语言模型有害目标
研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。
- 论文Hugging Face Daily Papers
Jev 预注册测试:智能体记忆何时该用选择替代抽取?
一项预注册研究在 LoCoMo 与 LongMemEval 上测试智能体记忆:在 LoCoMo 的紧预算下,由类型化决策模型 Jev 单次调用选出的原始对话轮次,不劣于 LLM 抽取式记忆(单侧 95% 界为 -3.0 分,非劣效界为 -5 分),且写入成本低 3,061 倍。重排序收益随预算增大而缩小:保留 30 个候选中的 3 个时在 LoCoMo 加 17.4 分、LongMemEval 加 9.1 分,预算宽松时仅加 1.5 和 1.1 分,此时抽取式系统更准。相同上下文下 Jev 选择精度与 LLM 重排序器相当(非劣效界 -2.0),延迟仅为其三分之一,且优于多次调用的图遍历;重排序会降低正确弃答率。
- 论文论文追踪
RA-Det:利用鲁棒性不对称检测 AI 生成图像
研究者提出 RA-Det,一种基于行为而非外观的 AI 生成图像检测框架。该方法利用鲁棒性不对称现象,即自然图像在小幅结构化扰动下保持稳定的语义表征,而生成图像的特征漂移明显更大。作者给出理论分析,建立该不对称性与生成模型记忆倾向之间的下界关系,解释其跨架构普遍存在的原因。在 14 个生成模型上、对比 10 余种强检测器,RA-Det 平均性能提升 7.81%,且不依赖生成器指纹,可迁移到未见过的生成器。源代码已在 GitHub 公开。
- 论文Hugging Face Daily Papers
从蒸馏私有健康记录中智能体发现血液生物标志物
研究将 Clalit Health Services 逾 540 万患者记录蒸馏为已发布的评分工具:针对 13 种免疫介导疾病,在数据边界内训练图注意力网络预测候选 CBC 表达式的病例对照 AUC,仅发布训练权重。外部验证中,智能体发现的表达式较文献种子起点 AUC 中位数提升 4.18 个百分点,在三个独立队列中对三种前沿研究工具候选重排序多数优于其首选。
- 论文论文追踪
AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击
圣加仑大学等机构的研究者提出 AgentSpy,在隔离环境(Firecracker microVM)中从操作系统边界记录 Agent 及其所有子进程的系统调用与网络流量,不依赖 Agent 自身的轨迹记录。它提供两类确定性分析:可靠性分析把每次执行汇总为星形图,统计执行的命令、读写的文件和访问的主机,并计算多次运行的相似度与技能覆盖率;安全分析则用规则检查读取私钥、越界修改文件、运行不可信程序、连接不可信域名等禁止行为。在 SkillsBench 的 77 个任务、codex harness 与三个模型上,同一任务的重复运行比混入其他任务的运行更相似的比例为 92.2%;在三次运行均通过测试的任务中,18% 出现与任务无关的活动,7% 读取了评分文件,17% 未使用开发者提供的技能指引。
- 论文论文追踪
Inspect Robots:面向具身智能体评测的开源模块化框架
研究者发布开源框架 Inspect Robots,用于开发和运行具身智能体的评测。该框架提供可定制、可复用的抽象来定义物理评测并分析结果,同时配套自动化完成评测搭建、执行与终止的基础设施。作者用它评测了六个基于前沿语言模型的策略的能力与安全性。框架发布后三个月内下载量接近 10 万次,论文投稿至 CoRL 2026 的 The Science of Physical AI Safety(SPAIS)Workshop。
- 论文论文追踪
SideKernel:面向 macOS 上 AI 编码 Agent 的 microVM 沙箱
佐治亚理工的一项硕士安全实践项目提出 SideKernel,一个面向 AI 编码 Agent 的开源本地 microVM macOS 沙箱,目标是提升可用性。作者先做在线用户调研,发现不到 40% 的 AI 编码 Agent 用户会在沙箱中运行 Agent,并归纳出阻碍沙箱采用的主要可用性障碍。随后作者按五项纳入标准筛选市面上的沙箱,围绕调研得出的 23 项能力测试,将 SideKernel 与符合条件的沙箱做对比分析,结果显示只有少数沙箱与 SideKernel 类似,其中 Docker Sandboxes 与 SideKernel 在可用性相关能力上得分最高。论文的另一项贡献是梳理本地、开源、基于 microVM 的 macOS AI 编码 Agent 沙箱现有方案。
- 论文论文追踪
AgentSecGraph:面向 LLM Agent 的安全感知依赖分析框架与 AgentSecBench 语料
研究者提出 AgentSecGraph,一个以候选操作为中心的安全感知静态分析框架,为每个安全敏感操作构建 Security-Aware Agent Dependency Graph(Security-ADG),在操作身份之外加入 Agent 相关性、来源与依赖证据、信任边界上下文、护栏证据和外部效应语义。配套发布的 AgentSecBench 覆盖 11 个生态、67 个真实 LLM Agent 仓库、37,542 个源文件;当前分析器在 65 个仓库中识别出 23,866 个静态安全敏感操作候选,并为每个候选生成一份 Security-ADG 产物,全语料分析耗时 50.8 分钟,为 9,821 个候选(41.15%)恢复来源到操作的依赖证据,为 3,075 个(12.88%)恢复潜在护栏证据。
- 论文论文追踪
A²E:面向 Agent harness 的端到端审计评测引擎
研究者提出 A²E(Agent Auditing Engine),一个面向 Agent harness 的端到端评测引擎,用于系统评估 harness 能力。该引擎基于新提出的 Agent Task Protocol(ATP)快速接入不同 harness 的评测任务,并通过自动插桩的 Monitor 在实验过程中捕获并生成标准化执行轨迹。评测阶段使用一组多维指标,除正确率外还刻画 harness 在执行效率、工具使用、任务规划和错误恢复上的差异。实验显示,模型与 harness 的组合在不同类型任务上表现差异明显,没有单一组合能在所有任务上持续领先。代码已公开。
- 论文论文追踪
IACM-RL:面向动态意图波动下复杂工具调用的意图感知上下文管理与强化学习
IACM-RL 框架通过 BeliefState 自生成上下文管理器主动追踪目标变化,并用结构化过期标记隔离被覆盖的参数,以分层意图驱动奖励加三项辅助损失优化策略。作者同时提出 DynamicIntent 流水线,覆盖 13 种细粒度意图波动场景并配套五维诊断指标。在 DynamicIntent、BFCL-V3 和 τ²-Bench 上,IACM-RL 显著优于基线,减少无限 API 循环与过期上下文错误,并提升域外泛化能力。
- 论文论文追踪
研究者提出自蒸馏方法让 LLM 遵循上下文水印指令
研究者提出两阶段自蒸馏训练方法,让大语言模型在遵循上下文水印(ICW)指令的同时保持回答质量。ICW 通过在查询前附加指令,要求模型在回复中嵌入可统计检测的信号,第三方无需访问模型内部即可调用。团队同时发布 ICWBench 基准,包含三类可验证的 ICW 指令族,分别从可检测性和回答质量两方面评分;对 14 个前沿闭源与开源模型的评测显示,没有一个模型能在三类指令上同时满足两个目标。所提方法无需更强模型蒸馏、无需人工标注、也不依赖模型已有的 ICW 指令遵循能力:第一阶段用同一基础模型同时充当教师和学生,通过指令等价的解码时 logits 扰动让教师遵循指令,再训练学生匹配教师的输出分布;第二阶段以自动验证器为奖励做强化学习。
- 论文论文追踪
微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性
微软等机构的研究者发布 Thinkingbox 沙盒与 Thinkingbox-bench 基准,用于评估 Agent 在有状态业务流程中的可靠性。沙盒提供隔离的 MCP 兼容工具会话、完整执行轨迹,并以终端后端状态和副作用作为判定依据;基准包含零售、酒店、车险、数字银行内部 IT 与咨询 IT/HR 五个领域的 507 个策略约束工作流,每个任务用可执行检查判定,允许不同有效路径但拒绝错误、缺失或多余的状态变更,其中 30 个任务额外检查最终回复的必需属性。研究者在 18 个闭源与开源模型上每任务重复 20 次试验,发现可靠性明显下降:Claude Opus 5 从 66.50% pass@1 降至 47.53% pass^20,Kimi-K3 从 57.37% 降至 17.60%;Qwen3.8-27B 的 pass@20 达 89.35%,但 pass^20 仅 10.93%。
- 论文论文追踪
AMS 工具通过激活分析检测语言模型的安全训练改动
研究者提出 AMS(Activation-based Model Scanner),通过测量激活空间中安全相关概念的几何结构来检测语言模型的安全训练改动。安全训练会在有害与良性内容类别间形成可测量的分离,部分安全改动会破坏或旋转这一结构,另一些则保持不变。作者在 Llama、Gemma、Qwen、Mistral 四个架构家族、14 个模型配置和四类安全改动(指令微调、基座、abliterated、无审查微调)上验证 AMS,阈值留一交叉验证准确率为 71%(10/14),sigma 点估计的 bootstrap 95% 置信区间中位宽度为 3.4 sigma。在每模型 20 条分层 JailbreakBench 提示上的行为合规测试显示,有害内容概念的 sigma 可预测合规程度,Pearson r = -0.546(p = 0.043),方向一致但噪声明显。
- 论文论文追踪
论文提出提示注入的七组件结构化分析模型
Jeremy McHugh 在 arXiv 发表论文,提出用七组件模型结构化描述提示注入,取代逐字记录攻击字符串的做法。模型包含载体、投递向量、隐藏方式、上下文破坏、权限提升、载荷和回传通道七个组件,其中五个属于攻击产物字段、两个属于环境字段。作者认为大语言模型会把不同自然语言表述编译为相同可执行动作,因此标注应追踪攻击者意图(工具目标、sink 与效果)而非表面措辞。该框架整合了 HOUYI 的载荷分解、Promptware Kill Chain 与攻击活动分类法,并把 ReNeLLM 等最小越狱框架视为受限子空间上的投影。论文给出标注规则、可直接映射到行业 CTI schema 的逻辑分析记录,以及 EchoLeak(CVE-2025-32711)和野外恶意软件 AI 规避样本等示例。
- 论文arXiv
研究者提出 AI 评估沙盒配置器,支持欧盟 AI 法案下的技术评估
针对欧盟《人工智能法案》要求各成员国在 2027 年 8 月前建立 AI 监管沙盒(AIRS),研究者提出开源框架 AI Assessment Sandbox Configurator,用于在沙盒中规模化开展结构化技术测试。该框架从 AIRS 的程序条件和法案对高风险系统的义务中推导出 11 项架构与治理要求,包含通过稳定插件 API 访问的测试与控制目录、统一异构输出的共享数据模型、面向不同角色的仪表盘以及分受众报告。作者描述了架构与当前版本,并报告一次早期试点:在真实 AIRS 活动中运行了数据统一与报告层,并为一官方 Exit Report 提供了输入。文中还讨论了路线图、目录分层贡献模型带来的治理问题,以及开源评估生态在成员国间形成的制度路径。
- 论文论文追踪
Planarian:用状态点管理 Agent 的本地与远程状态
研究者提出 Planarian,一个带状态管理能力的 Agent 运行时,让 Agent 和用户能从错误操作中恢复,并在一致的本地与远程环境状态上探索替代执行路径。其核心抽象是 agent statepoints,即环境状态在某一时刻的一致、可恢复版本。Planarian 向 Agent 和用户暴露三个原语:snapshot 通过增量进程与文件系统快照捕获本地沙箱状态,并以补偿动作透明记录远程状态变更,无需外部服务支持 checkpoint;rollback 回退到先前的本地 checkpoint 并重放补偿动作以撤销远程变更;fork 从某个 statepoint 创建多个隔离分支,让 Agent 并行探索不同方案。作者称 Planarian 能让 Agent 撤销错误并并行探索替代方案,任务质量最高提升 15 倍,用户从错误操作中恢复的额外开销仅 3%。
- 论文论文追踪
JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比
研究对比了类型化决策模型 JEV 与四个生成式 LLM 评判器在智能体轨迹安全分类上的表现,测试覆盖四个基准共 5,219 条轨迹。JEV 的基准平均正类 F1 为 77.8,高于最强生成式配置 GLM-5.2 的 74.1,有效结果覆盖率分别为 95.5% 和 94.4%。JEV 在 ATBench500 和 MCPHunt 上领先,GLM 在 R-Judge 和 TraceSafe 上领先;JEV 成功调用延迟中位数 0.99 秒,每次有效判断的 token 成本平均约 $0.000195。
- 论文论文追踪
AgentRewind:面向长周期 LLM Agent 的可恢复执行框架
研究者提出 AgentRewind,一个运行时恢复框架,通过记录 Agent 上下文与受控环境对齐的检查点,让 Agent 能回到较早状态并利用此前尝试的信息继续执行,以应对长周期任务中早期错误在上下文和环境状态中传播、后续动作难以逆转的问题。作者同时构建 MettleBench,用于评估包含一系列相关需求的长周期工程任务上的任务完成度与部分进展。在多种任务、多个模型、执行策略和 Agent harness 上的实验显示,AgentRewind 相比对比基线提升了任务成功率和平均清单进度。论文共 19 页、5 张图,发布于 arXiv(2608.14380)。
- 论文论文追踪
Blindspot:面向长程工具调用 Agent 的安全与拒答校准基准
研究者提出 Blindspot,一个针对长程工具调用 Agent 的轨迹级安全校准基准,通过自适应对抗交互、有状态工具执行和基于执行结果的判定来评估完整的用户—Agent—环境轨迹。当前版本包含 7 个领域的 22 类攻击和 35 个场景,生成超过 2500 条长程轨迹,平均交互长度 14.7 轮,每条轨迹被归为安全完成、正确拒答、不安全完成、过度拒答或不确定五类结果之一。与固定攻击数据集不同,Blindspot 是可扩展的实时仿真框架,攻击、场景、工具、策略、领域和 Agent 配置均可新增而无需重设计评测流程。
- 论文论文追踪
NovaFabric 提出可防篡改、可重放的 AI Agent 运行证据方案
研究者提出 NovaFabric,在不修改 Agent 逻辑的前提下把一次 Agent 运行记录为可移植的 Run Capsule,用 DSSE 签名、RFC 3161 时间戳、Merkle 日志和脱敏证明封装,并支持四种模式的重放协议与第三方验证。评测显示,模拟重放可从 capsule 提供全部模型响应(10/10),但仅 2/10 的工具调用类工作负载完成,缺口在于缺少工具响应替换;三类篡改均被拒绝;声明流完整度为 0.652(95% CI ±0.064,十个场景);修复后的规则包可脱敏 14/14 类凭据并保留 9/9 个诱饵;影响范围查询在 1000 万条边上 p99 为 45.5ms,在 1 亿条边上为 167.9ms。314 台机器、十个区域的运行中,capsule REST 写入无损,但受单 worker 串行化限制,吞吐上限为 61.6 req/s(p99 26.8s)。
- 论文论文追踪
SkillSentry:用自适应蜜罐世界动态检测 Agent 技能安全
研究者提出 SkillSentry,一个基于自适应蜜罐世界的动态安全测试框架,用于检测 LLM Agent 外部技能在特定环境状态下才暴露的有害行为。该方法先推断技能的能力边界,构建由 LLM 模拟、含受控诱饵资源的环境,并自适应生成任务以探索其行为状态,再将启用技能的执行轨迹与匹配的无技能执行对比,把可疑行为定位到源码和已验证的执行轨迹上。在标准基准上,SkillSentry 取得 99.50% 召回率和 96.26% 平均 F1;在保持语义的规避攻击下平均 F1 为 92.95%,最强基线为 80.07%。作者称代码已公开。