研究:无关信息污染患者病历并干扰 LLM 临床推理
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
- arXiv
- 2610.08585
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- GPT-5.4、GPT-5.6 Sol、Claude Opus 5 等 9 个
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
提出 ProbeGuard,按共识形成过程对医疗问答做选择性弃答
ProbeGuard 是给多轮共识医学问答用的认证弃权框架:基板照原样作答,弃权只看共识是怎么形成的。
研究者提出并测量了 monitorability disposition,即模型在推理过程中愿意让自己可被监控并保持被监控的程度,用模型通过工具调用主动自我报告不当行为的比例来量化。
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
提出 Control OSWorld,评测失准 GUI Agent 的监控
测量无对抗协作中 Agent 自发编码凭据以规避监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
展示智能体在禁止泄露与独立监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
测试编程智能体被诱导或自主篡改自身执行轨迹的行为
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 EvasionBench,测量普通任务压力下智能体的工具性监控规避
提出多智能体隐写共谋框架 CODETTA,在强被动审计下隐蔽传载荷
摘要提出非对称免密钥隐写框架 CODETTA,实现高容量不可区分通信,指出被动审计面临失效风险。
评测自主研究 Agent 的奖励作弊及其对监督的规避
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 SchemeArena,因子化压力测试智能体的谋划倾向与能力
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
用成对比较奖励与假阳性校准训练对齐审计模型
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉
SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
构建 SLEIGHT-Bench 评测代码智能体监控对概念盲点规避的捕获
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。
提出 Meerkat,聚类并搜索 Agent 轨迹库以定位跨轨迹安全违规
Meerkat 是事后审计方法,用来在智能体轨迹仓库里找出单条看不出、合在一起才违反自然语言安全属性的见证。