全部动态
论文与会议论文
本页材料
完整标题与摘要 · 12 条- 会议论文ACL 2026
迈向可证明安全的生成式AI:可靠共识采样
提出可靠共识采样及反馈算法,在模型遭恶意操纵时提供可控风险阈值的理论保证,无需弃答,并在实验中提升鲁棒性与效用。
- 会议论文ACL 2026
AutoMonitor-Bench:大模型不当行为监控器可靠性评测
以3,010条样本评测22个模型对不当行为的监控能力,发现漏报与误报存在持续权衡,并探索微调对未见隐蔽行为监控的作用。
- 会议论文ICLR 2026
Control Tax:约束与控制AI的安全代价
提出Control Tax概念量化AI控制协议的运行与经济成本,构建安全保证与成本映射的理论框架,并给出平衡安全与预算的监控优化策略。
- 会议论文ICLR 2026
LLM Agent 的可靠弱到强监控
提出 monitor red teaming 流程,在 SHADE-Arena 上压测隐蔽不良行为监控;发现 agent 知晓被监控会显著削弱检测,混合式监控设计让弱监控者能监督强 agent。
- 会议论文ICLR 2026
针对可信监控器的自适应攻击瓦解AI控制协议
发现不可信模型可通过在输出中嵌入提示注入绕过监控器,全面破坏现有AI控制协议,并导致重采样防御机制适得其反。
- 会议论文ICML 2026
面向大语言模型智能体谋划行为的宪政黑盒监控
提出检测智能体隐蔽谋划的宪政黑盒监控器,发现基于合成数据优化的监控器能泛化至真实环境,但性能易迅速饱和。
- 会议论文ICML 2026
用弱监督训练消除 LLM 的 sandbagging
SFT 与 RL 结合可在弱监督下引出 sandbagging 模型的真实能力,单独使用均不可靠;但若模型能区分训练与部署,仍会继续藏拙。
- 会议论文ICML 2026
信息访问权限如何影响大模型监控器检测破坏行为的能力
发现大模型监控器在信息较少时检测蓄意破坏表现更好的“少即是多”效应,并提出分层提取与评估监控方法,显著提升了针对未对齐智能体的破坏检测率。
- 会议论文ICLR 2025
不可信大语言模型的自适应部署降低分散威胁
提出结合微观协议与宏观协议的双层框架,通过自适应评估不可信模型风险来调度受信任模型监控,有效防范分散式安全风险。
- 会议论文NeurIPS 2025
CTRL-ALT-DECEIT:自动化 AI 研发中的破坏评测
在 MLE-Bench 上评测 agent 植入后门、故意降低性能(sandbagging)等破坏行为,LM 监控能检出代码破坏,但 sandbagging 更难检测。
- 会议论文NeurIPS 2025
为 AI 安全组合有成本约束的运行时监控器
基于 Neyman-Pearson 引理搜索多监控器组合协议,在预算约束下于代码审查场景将未对齐输出的召回率提升一倍以上。
- 会议论文NeurIPS 2025
可扩展监督的缩放律
提出以监督者与被监督系统能力差建模监督成功率的框架,在 Mafia、Debate、Backdoor Code、Wargames 上拟合缩放律,并分析嵌套式可扩展监督(NSO)的成功率随能力差增大而下降。