跳到正文
10月8日 · 周四

全部论文

找到 51 篇

另有 1033 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改

    编程 Agent测试qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    完整解读
  2. 可解释性arXiv:2610.04860 ·

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预

    LLM 应用测试Qwen2.5-14B-Instruct、LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3模型层
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    完整解读
  3. 防御arXiv:2610.05163 ·

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入

    编程 Agent测试Unified-Qwen3.5-4B (AgentDoG-1.5)、Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5) 等 7 个应用层
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    完整解读
  4. 防御arXiv:2610.05637 ·

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    模型与 API测试Qwen3-VL-8B、Claude Sonnet 4.6、Gemini 3.5 Flash 等 5 个训练与数据层

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    完整解读
  5. 防御arXiv:2609.01091 ·

    上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移

    提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移

    模型与 API测试Qwen2.5-7B-Instruct、Qwen2.5-32B-Instruct、Llama-3.1-8B-Instruct 等 4 个训练与数据层

    摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。

    完整解读
  6. 风险行为arXiv:2609.33220 ·

    斯坦福与 Anthropic 研究:RL 后训练中模型承认失败的披露行为远不如任务能力稳定

    揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定

    模型与 API测试Qwen2.5-1.5B、Qwen2.5-7B、Qwen2.5-14B 等 11 个训练与数据层

    摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。

    完整解读
  7. 评测与基准arXiv:2608.08542 ·

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    模型与 API攻击者白盒测试Qwen2.5-7B-Instruct、Qwen2.5-14B、Llama-3.1-8B-Instruct 等 6 个模型层
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    完整解读
  8. 防御arXiv:2607.24017 ·

    多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法

    提出 SPAR 免训练干预,分离注意力结构偏置并减轻多模态幻觉

    模型与 API测试Qwen2.5-VL、LLaVA-v1.5、LLaVA-1.5-7B 等 7 个模型层
    摘要SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。

    SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。

    完整解读
  9. 评测与基准arXiv:2609.08943 ·

    研究提出 Fact-Ablated Evaluation,揭示 LLM 事实核查更依赖参数知识

    提出 FAE 衡量事实核查对证据的依赖,并用 REAL 训练这种依赖

    模型与 API测试Qwen-2.5-32B-Instruct、Qwen-2.5-7B-Instruct、REAL (Qwen-2.5-7B-Instruct) 等 7 个训练与数据层
    摘要FAE 用多轮证据消融测接地,REAL 用对比监督让判决随证据可用性改变。

    FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。

    完整解读