跳到正文
10月9日 · 周五

全部论文

找到 77 篇

另有 426 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.04699

    CoVer:用干预检验为 Agent 构造可判定规则边界

    提出 COVER,以不咨询模型的干预门准入 Agent 规则自动执行

    发表
    场景
    AI Agent
    摘要自可判定不能向模型索取。

    这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。

    深度解读完整解读
  2. 防御arXiv 2610.04975

    论文提出长程智能体自生子目标的运行时授权机制

    提出运行时授权机制,检查长程智能体自生子目标是否精化根契约

    发表
    场景
    AI Agent
    摘要用版本化目标图授权保住重规划,并挡住自生成子目标变成新权威。

    长时程工具使用把目标演化变成授权状态的一部分。本文在单 principal、单根、有限结构化域中,把自生成子目标的创建、替换、同根委托和同根 join 做成可检查转移,并在提交边界重查受保护效应。

    深度解读完整解读
  3. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  4. 防御arXiv 2610.01170

    HeadEdit:通过冻结的 unembedding 矩阵校准语言模型行为

    提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正

    发表
    摘要低秩 unembedding 校正抬高九个设置的总体准确率,并可部分预测 DPO 更新。

    HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。

    深度解读完整解读
  5. 评测与基准arXiv 2610.01508

    OverAct:衡量并缓解 LLM 工具调用智能体的主动越权取数

    发布 OVERACT 衡量工具调用智能体的主动越权取数,并用 SELFAUDIT 缓解

    发表
    场景
    AI Agent
    摘要七模型普遍超额调用。

    七个来自四个家族的工具调用模型,在保守的字面授权准则下会检索超出请求的私人数据。作者把该行为称为 proactive over-authorization,用 OVERACT 做无 LLM 评审的测量,并用 SELFAUDIT 做不依赖 oracle 的执行前过滤。

    深度解读完整解读