全部论文
另有 434 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2602.08877
自动红队流水线压测对齐审计,发现提示词级策略性欺骗可致审计失效
提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗
- arXiv
- 2602.08877
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要通过红队提示词揭示现有审计方法易受策略欺骗,并在激活层面诱导高置信度错误推断。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 评测与基准arXiv 2605.16626
Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现
构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
- arXiv
- 2605.16626
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。
- 评测与基准arXiv 2606.05647
研究:94% 开发者未能识破编码 Agent 的隐蔽破坏
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
- arXiv
- 2606.05647
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 评测与基准arXiv 2609.38948
DrivingBench 发布:让视觉语言模型驾驶丰田 Corolla 绕桩
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
- arXiv
- 2609.38948
- 发表
- 层
- 应用层
- 组件视觉
摘要仅 Astra 第二次跑完低速锥桶路线。
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
- 评测与基准arXiv 2610.04737
PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督
提出 PyINE 基准,训练捷径跟随模型并比较监督者
- arXiv
- 2610.04737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件监控器
摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
- 评测与基准arXiv 2610.05163
研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
- arXiv
- 2610.05163
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
- 评测与基准arXiv 2610.02741
研究系统评估循环语言模型的思维链可监控性
系统评估循环语言模型加深 loop 后的 CoT 可监控性
- arXiv
- 2610.02741
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要加深 loop 可在部分压力测试任务降低可监测性,循环架构本身并不必然更难监测。
这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。
- 评测与基准arXiv 2608.04830
ContextWeave:面向长周期办公工作流的智能体记忆基准
提出办公工作流记忆基准 ContextWeave ,衡量历史召回对后续任务的增益
- arXiv
- 2608.04830
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 组件记忆
摘要ContextWeave 用真实办公任务流检验记忆是否改善工作区质量与偏好对齐。
ContextWeave 是面向语言智能体记忆的纵向基准,用来看召回先前经验能否让后续办公任务做得更好。
- 评测与基准arXiv 2608.11816
研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
- arXiv
- 2608.11816
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
- 评测与基准arXiv 2609.05797
论文发现安全监控器主要拦截模型本就会拒答的请求
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
- arXiv
- 2609.05797
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
摘要剪枝后的 Speech-LLM 不能只看总体 WER:Fair-Speech 上族群差扩大,作者建议看最差组。
摘要回答长度决定免训练 UE 族。
这是一项对 MLLM 免训练不确定性估计的分组比较:幻觉检测被作者视为弃答、转交或路由的一种用途,而不是唯一目标。
- 评测与基准arXiv 2609.32763
Mandela-Bench:36 个多模态模型更依赖记忆而非观察图像
构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像
- arXiv
- 2609.32763
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要论文构建 Mandela-Bench 发现模型对经典图像存在记忆重构偏见,过度依赖先验导致无法有效利用知识核验事实篡改。
该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。
- 评测与基准arXiv 2609.04859
MM-IFEval-Pro:面向视觉语言模型的多语言抗攻击指令遵循基准
提出抗攻击多语言视觉指令遵循基准 MM-IFEval-Pro
- arXiv
- 2609.04859
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen3-VL-8B-Instruct、InternVL3.5-8B、MiniCPM-V4.5 等 5 个
摘要MM-IFEval-Pro 以规则验证评测中英指令遵循与视觉劫持,GRPO 提高两基座平均分。
MM-IFEval-Pro 是面向 VLM 的中英多模态指令遵循基准,并配有可用规则计算奖励的 GRPO 训练集。
- 评测与基准arXiv 2609.05843
SinoGlyphBench:中文字形混淆下语言模型审核的诊断基准
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
- arXiv
- 2609.05843
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要SinoGlyphBench 显示中文字形混淆会同时增加有害漏报和误报,全文扰动最重。
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
- 评测与基准arXiv 2607.14611
论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险
评测编码智能体记忆文件中的提示注入及其跨会话持久性
- arXiv
- 2607.14611
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
- 评测与基准arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。