研究:无关信息污染患者病历并干扰 LLM 临床推理
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
- arXiv
- 2610.08585
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- GPT-5.4、GPT-5.6 Sol、Claude Opus 5 等 9 个
构建 MedDistract 基准,测量偶发信息对临床文书与推理的污染
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
用配对回放评测任务范围授权能否阻断越权工具执行
提出 STAR-Guard 双层防御,抑制长程 Agent 遗忘跨轮安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取
作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。
提出 VoxParity,固定转写只改音频,评测语音智能体是否按行业规则改工具调用
VoxParity 测量语音智能体在词语不变、只有声音改变时,是否按行业规则改它所执行的工具调用。
提出 REGLLM 框架,评测受监管智能体何时作答或升级
REGLLM 是诊断有界自主的框架,示例是 UK FCA 合规智能体。作者把它做成 smoke 规模演示,而不是完整基准验证。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
提出 Ajar,测量 Agent 防御对任务不需要的工具调用的放行
Ajar 量的是智能体防御留下的开放权限:任务不需要、但防御仍会允许的工具调用。
构建 APort Vault 基准,对比支付智能体模型拒答与确定性授权
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。
构建自演化基准 ActBench,评测协作智能体的行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 MasDrift,评测多智能体在良性任务中的授权保持
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 AuthBench 评测编码 Agent 最小权限,并验证充足性-紧缩性分解
本文研究代码智能体在执行终端任务前自主推断最小文件权限边界的能力。