跳到正文
10月9日 · 周五

全部论文

找到 20 篇

另有 643 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.04375

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 协议与 IntAct,定位并修复 Agent 工具调用的静默篡改

    发表
    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    深度解读完整解读
  2. 分析与理论arXiv 2610.06191

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    分析工具型 Agent 判定检索无用却不停止的原因

    发表
    场景
    AI Agent
    测试
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    深度解读完整解读
  3. 分析与理论arXiv 2609.12841

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    提出 Trace2ATT&CK,用溯源图把内核遥测映射到 ATT&CK

    发表
    测试
    gpt-oss-20b、gpt-oss-120b、gemma-4-31b-it 等 8 个
    摘要Trace2ATT&CK 把 eBPF 溯源命令图交给本地 LLM/RAG,在 Atomic Red Team 上映射 ATT&CK。

    Trace2ATT&CK 是一条从 Linux 内核遥测到 MITRE ATT&CK 排序候选的端到端流水线,面向已经划定的攻击窗口,而不是异常检测或 CTI 报告。

    深度解读完整解读
  4. 分析与理论arXiv 2609.27263

    GitHub Agentic Workflows 的智能体工作流规范与维护实证研究

    实证分析 gh-aw Markdown 的结构、维护与指令防护

    发表
    测试
    Gemini 3.1 Pro、GLM-5.2、gpt-oss
    摘要gh-aw 指令又长又常改,任务和约束很常见,显式注入防护很少,LLM 标注与人工标签大体一致。

    这是一项对 GitHub Agentic Workflows Markdown 的仓库挖掘,目标是描述开发者如何规定并维护会反复执行的智能体工作。

    深度解读完整解读
  5. 分析与理论arXiv 2609.31857

    LLM Judge 验证在稀疏重叠下的问题:从推理到设计

    分析稀疏重叠下 LLM judge 与人类一致性的验证误差并规划重叠分配

    发表
    测试
    Gemini Flash、Gemini Pro、GPT-4o-mini 等 10 个
    摘要稀疏重叠主导 judge 验证的错误决策。

    这篇工作研究标注重叠很稀时,怎样验证 LLM judge 是否足以替代人类,并规划重叠该留多少、怎么分配。。部署前的标准做法是在校准集上比较 judge 与人类的一致性。

    深度解读完整解读
  6. 分析与理论arXiv 2609.32390

    基于 2026 年 Hugging Face 事件的奖励作弊与 Agent 围堵失效蒙特卡洛研究

    用五阶段蒙特卡洛模拟奖励作弊如何导致 Agent 围堵失效

    发表
    场景
    AI Agent
    摘要分层控制的模拟事件率低于弱控制以及单独隔离或单独监控。

    这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。

    深度解读完整解读
  7. 分析与理论arXiv 2609.38324

    研究:多智能体讨论中异议被压制时收益下降

    用意见动力学模型解释多智能体讨论何时优于多数投票

    发表
    测试
    glm-flash、seed、ling 等 9 个
    摘要讨论增益由压抑率相对 c∗=γ/(γ+a) 的裕度决定,关闭推理或减少压抑可增大该增益。

    作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。

    深度解读完整解读
  8. 分析与理论arXiv 2609.36958

    VStress:面向重复验证器的相关性感知审计与自适应预算分配

    提出 VStress 回放审计,并按条件边际信息分配重复验证预算

    发表
    摘要VStress 冻结后再评分,VStress-CA 按条件信息分配调用,相关共享时增益消失。

    VStress 是重复二元验证器的回放审计,VStress-CA 把未查询通道的条件边际信息变成固定预算下的停止与分配。

    深度解读完整解读
  9. 分析与理论arXiv 2609.27234

    CELLAUDIT:审计 AI 智能体发现细胞模型中的输入使用声明

    提出 CellAudit,审计智能体发现的细胞模型是否使用声明输入

    发表
    场景
    AI Agent
    测试
    CellScientist、AIDE、CellForge 等 8 个
    摘要CellAudit 把输入使用声明从源码追到拟合贡献,并说明高分不必等于使用了扰动。

    CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。

    深度解读完整解读
  10. 论文:LLM 安全监控的监督缺口并非能力问题

    界定单迹监控对 2-safety 超性质的可检测前沿与监督缺口

    发表
    测试
    Llama-3.1-8B、Mistral-24B、GPT-4o-mini 等 9 个
    摘要单迹监督的上界由 TV 决定。

    论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。

    深度解读完整解读
  11. 可解释性arXiv 2609.34686

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    用配对续写与激活修补揭示工具智能体越狱后的安全路由分化

    发表
    场景
    AI Agent
    测试
    Qwen3-14B、Qwen3.5-9B、Qwen3.5-27B 等 8 个
    摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。

    这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。

    深度解读完整解读
已经到底了