摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 其他arXiv 2610.05831收录
长时程轨迹监督如何影响终端智能体训练的可靠性与成本
提出 selective long-horizon 精炼,筛选长轨迹训练终端智能体
- arXiv
- 2610.05831
- 收录
- 场景
- 编程 Agent
摘要中间长度的监督更均衡。
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
- 攻击arXiv 2610.05089
研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制
- arXiv
- 2610.05089
- 发表
- 场景
- LLM 应用
摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。
- 其他arXiv 2607.28568
Frontis-MA1:面向机器学习工程递归自我改进的 AI4AI 模型
提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体
- arXiv
- 2607.28568
- 发表
- 场景
- 编程 Agent
- 风险危险能力
摘要OpenMLE 训练 Frontis-MA1-35B,用四个共享算子把 MLE 后训练和长程搜索接成元进化闭环。
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。
- 其他arXiv 2609.36054
多作者论文评估 AI 研发自动化触发智能爆炸的可能与政策应对
评估自动化 AI 研发触发智能爆炸的可能并主张先可见再约束与适应
- arXiv
- 2609.36054
- 发表
- 场景
- 编程 Agent
摘要软件驱动智能爆炸可能把数年进展压进数月,作者要求三项政策先做好。
Chan 等论证:自动化 AI 研发可能经软件反馈环形成智能爆炸,把本需数年的进展压进数月或更短。他们关心的不是换硬件的建设周期,而是 AI 扩大有效研发劳动力、再产出更强系统,以及社会能否在能力跃迁前看见、约束并适应这一过程。
- 防御arXiv 2610.00850
AuraForge:为训练安全编码 Agent 扩展安全监督
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
- arXiv
- 2610.00850
- 发表
- 场景
- 编程 Agent
- 防御模型加固
- 风险Agent 危险操作
摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
- 其他arXiv 2609.09135
ERPO:面向代码生成测试时强化学习的熵正则化排名掩码策略优化
提出 ERPO,用探针共识奖励对无标签代码生成做测试时强化学习
- arXiv
- 2609.09135
- 发表
- 场景
- 编程 Agent
- 评测与基准arXiv 2609.39533
CATCH:面向编码 RL 奖励作弊的可控分析测试台
提出 CATCH 测试台,复现编码 RL 的奖励作弊
- arXiv
- 2609.39533
- 发表
- 场景
- 编程 Agent
摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
已经到底了