全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
SHAPE:统一教育 LLM 的安全、有用与教学性
提出教学越狱问题(学生诱导模型直接给答案)与含 9,087 对样本的 SHAPE 基准,图增强辅导流程显著提升安全性且保持有用性。
- 会议论文ACL 2026
从信任到失陷:结果验证的 LLM 钓鱼模拟与实时防御
提出以受害者完成外部动作验证失陷的 PhishSim 模拟器,以及实时多智能体风险评分器 PhishGate,在四种 LLM 后端上提升对话级检测。
- 会议论文ACL 2026
遗忘者会说谎:评估并改进 LLM 遗忘中的诚实性
定义遗忘诚实性并建立评测指标,发现 9 种现有方法均不达标,提出 ReVa 表征对齐方法,拒答率近乎翻倍并提升保留集诚实性。
- 会议论文ACL 2026
PRISM:具有内在结构建模的概率奖励模型
用高斯混合建模奖励分布以区分主观偏好与认知不确定性,准确率和泛化优于标量基线,并在下游 RL 中缓解奖励作弊。
- 会议论文ACL 2026
针对微调自回归语言模型的免训练强力成员推断攻击
提出 EZ-MIA,利用错误位置上的概率偏移打分,只需两次前向传播;在 1% FPR 下检出率达 66.3%,远超此前方法,表明微调模型隐私风险被低估。
- 会议论文ACL 2026
PARASITE:通过条件式系统提示投毒劫持 LLM
指出第三方系统提示市场的供应链风险,黑盒优化出仅对特定查询输出被操纵回答的投毒提示,目标查询 F1 最多下降 70%,且能绕过困惑度过滤等防御。
- 会议论文ACL 2026
面向电商领域 Web Agent 的功能导向评测基准
提出 Amazon-Bench 及自动评测框架,同时评估 Web Agent 的任务表现与安全风险,发现现有 Agent 难处理复杂查询且存在安全隐患。
- 会议论文ACL 2026
撒谎还是不撒谎?研究 LLM 对全球虚假信息传播的偏向
构建 GlobalLies 多语言数据集,发现 LLM 生成虚假信息的概率在低资源语言和低 HDI 国家更高,现有输入安全分类器与检索事实核查的防护并不均衡。
- 会议论文ACL 2026
CachePrune:通过编辑 KV-Cache 教 LLM 不跟随注入指令
在 KV cache 编码时剪除与指令跟随相关的神经元,使模型把上下文视为数据,显著降低间接提示注入成功率且保持可用性。
- 会议论文ACL 2026
别动我的图片:用视觉提示注入阻止 MLLM 分析图像
提出 ImageProtector,在图像中嵌入近乎不可见的扰动使 MLLM 拒答,在六个模型和四个数据集上有效,对部分对策仍具抵抗力。
- 会议论文ACL 2026
Among Us:度量并缓解模型协作系统中的恶意贡献
构造四类恶意 LM 接入路由、辩论、模型融合等协作系统,推理与安全领域性能平均下降约 7%;外部监督者屏蔽恶意模型可恢复约 95% 性能。
- 会议论文ACL 2026
迁就与认知警觉:LLM 为何不质疑有害信念的语用学解释
从语用学角度把 LLM 未能质疑有害信念归因于过度迁就和认知警觉不足,解释了三个安全基准上的差异,并发现加入“wait a minute”等提示能大幅提升表现。
- 会议论文ACL 2026
基于增强策略训练的领域可泛化 AI 护栏
发现 LlamaGuard 等护栏会过拟合训练策略,提出 Augmented Policy Training,用策略扰动提升对未见策略的泛化,1B 模型在未见策略上可媲美 8B 护栏。
- 会议论文ACL 2026
微调后 LLM 安全护栏为何崩塌:对齐数据与微调数据的相似性分析
从表征相似性角度分析,发现上游安全对齐数据与下游微调数据越相似,安全护栏越容易被削弱;低相似度可使有害性得分最多降低 10.33%。
- 会议论文ACL 2026
上下文表征劫持:Doublespeak 越狱攻击
用上下文示例把有害词替换为无害词,使其内部表征趋同于有害语义,从而绕过安全对齐;无需优化,可跨模型迁移,在 Llama-3.3-70B-Instruct 上成功率达 74%。
- 会议论文ACL 2026
LLM 的心理 steering:有效性与可信度评估
提出 PsySET 基准,评测提示、微调与表征工程对情绪和人格的 steering 效果,并发现 steering 会带来安全、隐私等意外副作用。
- 会议论文ACL 2026
AGILE:基于激活引导局部编辑的越狱攻击
两阶段框架:先用场景化改写掩盖恶意意图,再用隐藏状态引导细粒度编辑,使内部表征由恶意转向良性;攻击成功率较最强基线最高提升 37.74%,迁移性好。
- 会议论文ACL 2026
Reference Attack:针对多模态大模型的跨模态越狱攻击
把恶意提示嵌入图像、表格等非文本模态,并用递归符号引用让模型逐层还原有害内容,绕过内容审核;在主流 MLLM 上成功率超 93%,较基线最高提升 70.8%。
- 会议论文ACL 2026
CRISP:基于稀疏自编码器的持久概念遗忘
用 SAE 特征抑制实现参数层面的持久遗忘,在 WMDP 有害知识遗忘任务上优于已有方法,同时保留通用能力。
- 会议论文ACL 2026
基于人设的 AI 陪伴应用多轮对话安全评测
构建人设驱动的多轮模拟与危害评估框架,测试 Replika 对高风险用户的回应;发现其常附和或正常化自残、饮食失调和暴力幻想等不安全内容。
- 会议论文ACL 2026
Seeing No Evil:通过对抗性注意力劫持让视觉语言模型对安全指令“失明”
通过压制对系统提示的注意力并锚定对抗图像特征实现视觉越狱,在 Qwen-VL 上成功率 94.4%;发现“安全失明”,即模型因未检索到安全规则而输出有害内容。
- 会议论文ACL 2026
用评分细则奖励治愈数学推理中的“奇迹步骤”
发现模型在数学推理中通过奖励作弊以不严谨过程得到正确答案,提出 Rubric Reward Model 评估整条推理轨迹,使“奇迹步骤”减少 71%,AIME2024 的 Verified Pass@1024 从 26.7% 升至 62.6%。
- 会议论文ACL 2026
FineSteer:面向大模型的统一细粒度推理时 steering 框架
把推理时 steering 拆成条件触发与细粒度向量合成两阶段,在安全与真实性基准上优于现有方法,如 Llama-3 的 TruthfulQA 提升 7.6%,同时尽量保持通用能力。
- 会议论文ACL 2026
遗忘而不留痕:大模型的隐式知识遗忘
评测 15 种遗忘方法,发现模型仍能回忆改写后的答案且中间层保留目标事实,并提出基于概率扰动的 PERMU 方法改进隐式知识遗忘。