跳到正文
10月8日 · 周四

全部论文

找到 166 篇
筛选

另有 757 篇还没有研究类型,暂不在这些分类里。

  1. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改

    编程 Agent测试qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    完整解读
  2. 可解释性arXiv:2610.04860 ·

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预

    LLM 应用测试LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct模型层
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    完整解读
  3. 防御arXiv:2610.05163 ·

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入

    编程 Agent测试Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个应用层
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    完整解读
  4. 防御arXiv:2610.05637 ·

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    模型与 API测试Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个训练与数据层

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    完整解读