Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘压力触发的条件性欺骗并保留上下文理解
另有 1033 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PACT,遗忘压力触发的条件性欺骗并保留上下文理解
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出 IEC 协议与 IntAct,定位并修复工具调用执行路径的静默篡改
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 Cooldown Landmines 跨租户冷却干扰攻击并设计租户隔离
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
揭示纯结果强化学习下失败披露跨运行不稳定,并提出失败条件参考锚定
评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
提出 SPAR 免训练干预,分离注意力结构偏置并减轻多模态幻觉
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
完整解读提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
完整解读构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御
提出 FAE 衡量事实核查对证据的依赖,并用 REAL 训练这种依赖
FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。