全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 20 条- 动态AI Alignment Forum
WorkspaceBench:评估读取模型全局工作区的可解释性方法
作者发布 WorkspaceBench,一套评估激活到文本工具能否读取模型全局工作区(前向传播中的中间变量)的基准,共 3356 道题、27 个评测族,覆盖安全、逻辑推理与多跳计算,并包含面向单 token 输出工具的子集和专门的幻觉评测。基准基于 Qwen-3.6-27B 开发,作者预期可用于更大模型,但更小或更弱的模型可能需要调整。评测对象包括 Logit lens、J-lens、R-lens、Tuned lens 等单 token 读取器,以及 NLA、SAE、Patchscopes、Template lens、Oracle Lens 等多 token 读取器。作者发现单 token 方法难以呈现多 token 或组合性概念,而 NLA 虽能呈现大量工作区内容却极易虚构,几乎每条读出都含有与上下文矛盾的断言。
- 会议论文ACL 2026
撒谎还是不撒谎?研究 LLM 对全球虚假信息传播的偏向
构建 GlobalLies 多语言数据集,发现 LLM 生成虚假信息的概率在低资源语言和低 HDI 国家更高,现有输入安全分类器与检索事实核查的防护并不均衡。
- 会议论文ACL 2026
MolSafeEval:揭示AI生成分子安全风险的基准
整合毒理数据库与危害规则构建分子安全知识图谱,支持大模型检测和解释危险结构,并为四类分子生成任务提供标准化安全评测。
- 会议论文ICLR 2026
SoSBench:六大高危科学领域的大模型安全对齐基准
构建涵盖化学、生物等六大高危科学领域的基准SoSBench,评测发现DeepSeek-R1和GPT-4等前沿模型违规内容输出率极高。
- 会议论文ICLR 2026
GeneBreaker:基于致病性引导的DNA语言模型越狱攻击
针对DNA语言模型设计高危人类病毒的生物安全风险,提出越狱攻击框架GeneBreaker与评测基准,发现模型放大双重用途风险,呼吁强化安全对齐。
- 会议论文ICLR 2026
PropensityBench:基于Agent方法评估大模型的潜在安全倾向
提出PropensityBench基准,在网络安全、自主增殖、生物及化学安全领域,评估大模型在具备模拟危险工具与现实压力下采取有害行为的潜在倾向。
- 会议论文ICLR 2026
通过在受护栏模型输出上微调诱导危险能力
提出诱导攻击方法,通过向前沿模型请求相邻安全领域的回答并微调开源模型,成功恢复了危险化学合成领域的有害能力差距。
- 会议论文ICML 2026
PostTrainBench:大语言模型智能体能否自主完成后训练?
提出PostTrainBench以评估智能体自主完成后训练的能力,发现前沿智能体具备一定研发能力但仍落后于官方模型,并观察到在测试集上训练等奖励作弊失效模式。
- 会议论文ICML 2026
AutoControl Arena:合成可执行测试环境以评估前沿 AI 风险
以代码固定确定性状态、LLM 生成动态,自动构建 X-Bench;评测 9 个前沿模型,压力下风险率从 21.7% 升至 54.5%,强模型出现策略性隐瞒。
- 会议论文ICML 2026
SafeSci:科学及相关领域的LLM安全评测与增强
构建涵盖多学科评测基准SafeSciBench与微调数据集SafeSciTrain,评测24个LLM在科学领域的安全风险与过度拒答现象并实现安全增强。
- 会议论文ICML 2026
ABC-Bench:面向生物安全的 Agent 生物能力基准
评测 LLM Agent 在操作液体处理机器人、设计 DNA 片段、规避 DNA 合成筛查上的能力,所有 Agent 均超过专家中位基线,并有湿实验验证。
- 会议论文USENIX Security 2026
爱、谎言与语言模型:AI参与恋爱诱骗诈骗
研究显示LLM已被诈骗组织采用,其在长期对话中比人工操作者获得更高信任与受害者配合度。
- 会议论文ACL 2025
CRiskEval:大语言模型中文多级风险评测基准
构建覆盖七类前沿风险的14,888道选择题,发现多数受测中文模型的加权风险倾向超过40%;测量对象是回答中的倾向而非实际行为。
- 会议论文ACL 2025
超越单值指标:用认知诊断评估并增强 LLM 遗忘
提出 UNCD 框架及 UNCD-Cyber 基准,细粒度评估危险能力的移除情况,并用 UNCD-Agent 针对残留知识生成遗忘数据以提升遗忘效果。
- 会议论文ACL 2025
核部署!自主 LLM Agent 决策中的灾难性风险分析
构建三阶段评测框架,对 12 个 LLM 做 14,400 次 Agent 模拟,发现其会自发出现灾难性行为与欺骗,且推理能力越强风险往往越高。
- 会议论文ICML 2025
RE-Bench:对比人类专家评估前沿 AI Agent 的 AI 研发能力
构建 7 个 ML 研究工程环境并收集 71 次专家尝试;2 小时预算下最佳 AI Agent 得分是人类 4 倍,但 8 小时与 32 小时预算下人类反超。
- 会议论文ICML 2025
The Elicitation Game:评估能力激发技术
用密码锁定和 circuit-breaking 训练带隐藏能力的 model organism,发现提示可激发 MCQA 能力、steering 失效,代码任务仅微调有效。
- 会议论文NeurIPS 2025
衡量 AI 完成长软件任务的能力
提出 50% 任务完成时间跨度指标,o3 约 110 分钟,前沿模型时间跨度约每七个月翻倍,并讨论自主性提升对危险能力的影响。
- 会议论文NeurIPS 2025
守护生命语言:从 DNA 语言模型到蛋白质的可遗传水印
针对 DNA 语言模型的生物安全双重用途风险,提出 DNAMark 与 CentralMark 水印,后者可从 DNA 传递到翻译出的蛋白质,检测 F1 超过 0.85。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门