研究比较连续训练阶段对大语言模型说服力的影响
比较连续后训练阶段如何改变语言模型的说服力
- arXiv
- 2610.09964
- 发表
- 场景
- 模型与 API
- 被测模型
- mlabonne/Meta-Llama-3.1-8B-Instruct-abliterated、GPT-4
- 风险危险能力
摘要作者称说服性 SFT 提高失调模型的态度变化,IPO 无额外收益,GPT-4 不异于中性文本。
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。
比较连续后训练阶段如何改变语言模型的说服力
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出 FUSE 框架,评测大语言模型的化生危险能力
提出 SRE-Bench 评测智能体的真实规模二进制逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
用 CryptanalysisBench 评测大模型的端到端密码分析能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全
SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。
构建真实网络靶场基准,评测 AI 的端到端自主攻击能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。