摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2610.06366
VERA:结构化审计发现约 60% 正确漏洞判定伴随虚构推理
提出 VERA,结构化审计漏洞推理中的虚构主张
- arXiv
- 2610.06366
- 发表
- 层
- 模型层
- 场景
- 编程 Agent
- 其他arXiv 2610.05831收录
长时程轨迹监督如何影响终端智能体训练的可靠性与成本
提出 selective long-horizon 精炼,筛选长轨迹训练终端智能体
- arXiv
- 2610.05831
- 收录
- 场景
- 编程 Agent
摘要中间长度的监督更均衡。
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
- 分析与理论arXiv 2610.04860
研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预
- arXiv
- 2610.04860
- 发表
- 层
- 模型层
- 场景
- LLM 应用
摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
- 攻击arXiv 2610.05089
研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
- arXiv
- 2610.05089
- 发表
- 场景
- LLM 应用
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
- 可解释性arXiv 2610.02702
研究:LLM 智能体顺从多数时内部仍保留原有前提
用 J-lens 检测屈从多数的智能体是否仍表征原前提
- arXiv
- 2610.02702
- 发表
- 层
- 模型层
- 场景
- 多智能体
- 组件推理链
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。
本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。
- 其他arXiv 2607.28568
Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型
提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体
- arXiv
- 2607.28568
- 发表
- 场景
- 编程 Agent
- 风险危险能力
摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
- 其他arXiv 2609.36054
多作者论文评估 AI 研发自动化触发智能爆炸的可能与政策应对
评估自动化 AI 研发触发智能爆炸的可能并主张先可见再约束与适应
- arXiv
- 2609.36054
- 发表
- 场景
- 编程 Agent
摘要软件驱动智能爆炸可能把数年进展压进数月,作者要求三项政策先做好。
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
- 防御arXiv 2610.00850
AuraForge:为训练安全编码 Agent 扩展安全监督
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
- arXiv
- 2610.00850
- 发表
- 场景
- 编程 Agent
- 防御模型加固
- 风险Agent 危险操作
摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
- 其他arXiv 2609.09135
ERPO:面向代码生成测试时强化学习的熵正则化排名掩码策略优化
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
- arXiv
- 2609.09135
- 发表
- 场景
- 编程 Agent
摘要SAE 追踪稠密检索 QE 的潜变量,转向在四基准上比文本扩展更稳。
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
- 可解释性arXiv 2609.08173
基于 SAE 引导的关键路径识别(KPI)解决知识冲突
提出 KPI,用入度定位跨层关键路径并做 SAE 转向以解决知识冲突
- arXiv
- 2609.08173
- 发表
- 层
- 模型层
- 场景
- LLM 应用
摘要KPI 以入度关键路径替代大批 SAE 特征转向,在冲突 RAG 上提高忠实并减轻副作用。
KPI 针对知识冲突 RAG 中的 SAE 转向:相关性批量改特征会带入冗余,少量因果上关键的特征即可完成转向。
- 评测与基准arXiv 2609.39533
CATCH:面向编码 RL 奖励作弊的可控分析测试台
提出 CATCH 测试台,复现编码 RL 的奖励作弊
- arXiv
- 2609.39533
- 发表
- 场景
- 编程 Agent
摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
- 攻击arXiv 2609.09865
CGMIA:用成员推理攻击检测代码生成基准的数据泄漏
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
- arXiv
- 2609.09865
- 发表
- 层
- 模型层
- 场景
- 编程 Agent
- 攻击者
- 灰盒
- 攻击提取与窃取
摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。