全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
LogicEval:真实软件逻辑漏洞自动修复评测框架
构建含122个逻辑漏洞的数据集并评测传统及LLM修复方法,发现提示敏感、上下文丢失和补丁定位困难是主要失败因素。
- 会议论文ACL 2026
COMPASS:大语言模型组织特定政策对齐评测框架
在八类行业场景中评测七个模型,发现合法请求处理准确率超过95%,但对抗性禁令违规请求的拒答率仅为13%至40%。
- 会议论文ACL 2026
基于 SAE 构造低秩子空间的可解释安全对齐
提出 SAILS,用 SAE 解耦出安全子空间来初始化 LoRA,仅更新 0.2% 参数即达最高 99.6% 安全率,优于全参数微调。
- 会议论文ACL 2026
Red-Bandit:多臂老虎机引导LoRA专家自适应红队测试
通过多臂老虎机在线选择不同攻击风格的LoRA专家,在探索预算充足时提升攻击成功率,并揭示目标模型对不同攻击风格的弱点。
- 会议论文ACL 2026
信任的泛化:语言模型的弱到强可信性
研究弱模型监督下可信属性的迁移,发现双阶段正则化可改善公平性及对抗与分布外鲁棒性,但隐私未表现出弱到强泛化。
- 会议论文ACL 2026
Jailbreak-Zero:迈向帕累托最优的大语言模型红队测试
提出基于安全政策的自动红队框架,权衡风险覆盖、多样性与忠实性,对GPT-4o和Claude 3.5的攻击成功率达99.5%和96%。
- 会议论文ACL 2026
Apertus:面向全球语言环境的开放合规大语言模型
发布Apertus开放模型,通过数据合规过滤与Goldfish预训练目标抑制逐字记忆,同时保留任务表现并扩展多语言覆盖。
- 会议论文ACL 2026
面向大语言模型自动红队测试的自适应指令组合
用上下文多臂老虎机自适应组合众包攻击素材,兼顾攻击效果与多样性,优于随机组合并在HarmBench上超过多种自适应方法。
- 会议论文ACL 2026
ReasMark:抵御知识蒸馏攻击的推理归属水印
将水印与目标域输入分布绑定并植入可检测的推理长度差,在多种蒸馏设置下优于现有归属验证方法,同时保持任务效用。
- 会议论文ACL 2026
LOTUS:以双曲蕴含与洛伦兹传输实现多模态遗忘
利用双曲几何分离敏感实例与一般概念,在多模态遗忘基准上更有效地删除目标视觉数据,同时保留通用能力。
- 会议论文ACL 2026
大模型智能体会再现权力不对等对话中的社会认知效应吗?
通过不同地位角色的多轮对话评估语言协调、说服及不安全请求服从,发现模型呈现与权力相关的社会认知效应及不安全行为。
- 会议论文ACL 2026
TRAC:以自适应校准的教师词元奖励实现稳健策略优化
针对教师噪声诱发奖励作弊的问题,从题目、轨迹和词元三级校准教师奖励,实验显示可减轻噪声并提升推理能力与训练稳定性。
- 会议论文ACL 2026
REMIND:从输入损失景观理解大模型记忆与遗忘
通过局部输入损失曲率识别保留、遗忘与未见样本,检测常规指标遗漏的残余记忆,多分类ROC-AUC达82%。
- 会议论文ACL 2026
TROJail:以过程奖励优化多轮大模型越狱轨迹
将多轮越狱建模为轨迹级强化学习,以两类过程奖励缓解监督稀疏,在多个模型和基准上提高攻击成功率。
- 会议论文ACL 2026
推理结构对推理模型的安全对齐至关重要
指出推理模型的安全风险源于推理结构,提出 AltTrain,仅用 1K 样本做 SFT 改变推理结构即可获得较强安全对齐。
- 会议论文ACL 2026
检索可能有害:检索增强扩散模型的后门漏洞
提出 BadRDM,通过向检索库注入图像并操纵检索模型建立触发词捷径,首次对检索增强扩散模型实施有效后门攻击,且能抵抗常见防御。
- 会议论文ACL 2026
LogicPoison:针对图检索增强生成的逻辑攻击
通过类型保持的实体替换破坏知识图的逻辑连接而不改变表面文本,绕过 GraphRAG 防御并显著降低其性能。
- 会议论文ACL 2026
LLM-VA:通过向量对齐化解越狱与过度拒答的权衡
发现回答向量与良性向量近乎正交,提出以闭式权重更新对齐二者,在 12 个模型上比最佳基线 F1 高 11.45% 且保留 95.92% 效用。
- 会议论文ACL 2026
FlexGuard:面向严格度自适应 LLM 内容审核的连续风险评分
提出 FlexBench 基准并发现现有审核模型跨严格度不一致,进而提出输出连续风险分数的 FlexGuard,提升不同严格度下的鲁棒性。
- 会议论文ACL 2026
以真话行骗:通过生成式蒙太奇实现开放信道多智能体合谋的信念操纵
提出仅用真实证据片段的多智能体合谋攻击,在 14 个 LLM 家族上攻击成功率约 70%,且推理能力越强越易受骗。
- 会议论文ACL 2026
ContextLens:面向法律合规的不完美隐私与安全情境建模
提出 ContextLens,让 LLM 在不完整情境下结合 GDPR 与欧盟 AI 法案评估合规,无需训练即超越基线并能识别缺失因素。
- 会议论文ACL 2026
StealthGraph:用知识图谱引导生成领域有害提示以暴露 LLM 风险
提出知识图谱引导的有害提示生成加两种混淆改写策略,构造兼具领域相关性与隐含性的数据集,用于更真实的领域红队测试。
- 会议论文ACL 2026
同时参考判例与法条:案例增强的审慎对齐用于 LLM 安全
发现案例增强的简化规则比详尽安全规则更稳健,并提出 CADA,用强化学习提升无害性与抗攻击性、减少过度拒答。
- 会议论文ACL 2026
用序列级风险累积校准推理时对齐
提出 SEAT,以奖励引导的分支解码和序列级风险监控防御越狱,同时减少对良性内容的过度拒答,在四个攻击基准上优于八个基线。