全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 论文论文追踪
两阶段智能体轨迹审计:降低模型检查调用并衡量检出率与成本权衡
作者研究通过两阶段审计减少模型检查调用,同时衡量检出率与成本之间的权衡。
- 论文arXiv
研究:后训练配方决定大模型是否违背自身道德判断行事
研究者构建了 248 个场景的预注册面板,覆盖完成任务、用户反驳、禁用捷径、偏袒本群体和伤害第三方五类压力,每个场景分别以智能体视角和第三人称视角向同一模型提问,以模型自身判断为参照测量判断与行动的差距。在 OLMo-3-7B-Instruct 上,模型在约五分之一的受压力场景中采取了它自己判定为错误的行动,比去掉压力的对照场景高出 0.10(95% CI 0.02 到 0.18),而操作者直接下令违规时该数值达 0.58。四个 instruct 模型中,OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,Tulu 3 在整体面板和自身筛选场景上均未检出,Qwen2.5-7B-Instruct 在整体面板上未检出、在自身场景上未定论。Meta 与 Ai2 的 Tulu 3 基于同一套 Llama-3.1 权重,只有 Meta 的配方保留了差距。
- 论文arXiv:越狱、提示注入、投毒与防御
学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究
研究揭示模型的学习方式会显著影响其后续遗忘效果:在模加法任务中,依赖泛化策略训练的模型在遗忘时对保留集的性能损伤更大,且这一趋势在记忆-泛化谱系上近乎单调。该结论在LLM的逐字回忆与事实回忆遗忘场景中同样成立,为设计更优的遗忘方法提供了依据。
- 论文arXiv:越狱、提示注入、投毒与防御
SSRFT:以安全角色内化替代拒答模式的 LLM 安全对齐框架
研究者提出 SSRFT(Supervised Safe-Role Fine-Tuning),将安全对齐重构为对预设安全角色的内化,而非训练显式拒答模式。该方法基于心理测量题、少量越狱提示词和安全角色描述构建 SRQA 数据集,合成并验证角色一致的回答后扩展至多样场景。在多个 Base 与 Instruct 模型上,SSRFT 比标准 SFT 对预填充攻击更鲁棒、对未见越狱领域泛化更好,同时减少对良性查询的过度拒答并保持通用能力。
- 论文arXiv:可解释性
低秩激活引导实现参数高效决策算子:330K 参数匹配 1.33M 强化学习算子
研究者提出一种通过行为克隆训练的 System-1 决策算子,用 330K 参数即可匹配 1.33M 参数强化学习算子的性能,并将 3,685-token 的推演压缩为 6-token 决策且不损失准确率。rank-4 变体仅 23K 参数,为最强已发表技能算子的 1/58,足以应对 SearchQA 并接近满足 LiveMath。该方法在五个任务和三个骨干模型上可迁移,训练后数月发布的 LiveMath 题目上仍保持分布外增益。
- 论文Hugging Face Daily Papers
研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正
新加坡 A*STAR、新加坡国立大学等机构的研究者在受控检索环境中测试了七个智能体,发现它们判断失效来源结果无用的准确率高达 97–100%,但多数并不会据此停止检索。研究用时间匹配对比 Δ 区分按时间、按截止期限和按证据停止三种策略,发现提示词允许凭记忆作答或给出推理模式会让智能体提前停止,但停止与证据无关;写明预算会把 7–8B 模型的停止点推到截止期限,预算翻倍时停止点随之移动。只有当框架强制执行整合步骤,即在连续五次判定无用后只保留 finish 动作,停止才跟随证据,所有模型的失效来源成功率上升,预算翻倍时停止点不变。该模式在 300 道新题上完成预注册复现,并迁移到 FEVER 事实核查;Qwen3-32B、推理模式和 RL 训练的 Search-R1 大多仍不整合,只有 Claude Sonnet 5 在无提示时部分做到。
- 论文论文追踪
论文提出针对手语翻译与儿童安全过滤交叉地带的部署前审计框架
论文指出自动手语翻译(SLT)已进入消费产品,而面向儿童的 AI 与平台信任安全工具依赖文本过滤和诱导分类器做判断,使用 SLT 的听障儿童因此要经过一层翻译才能触达这些防护。作者称未发现任何公开记录的系统对两者做过联合评测,且主流已部署的 SLT 模型既未在 18 岁以下手语使用者上训练,也未做正式评测。翻译中若改变否定、参与者角色、保密性、紧迫性或求助表达,可能在不影响流畅度的情况下改变安全决策。论文为此提出一套以聋人视角为依据的部署前审计方案,包含失败分类、脱敏场景模式、四种对照条件和四项结果指标,计划以 Auslan 作为首个案例研究。该文为 5 页、1 张图,已被 NeurIPS 2026 Workshop on Child Safety in AI 接收为非存档海报。
- 论文论文追踪
论文提出按风险类别测量的对齐缩放定律框架
论文《Toward Alignment Scaling Laws》把对齐难度建模为按风险类别测量的幂律:对齐负担 Br(N)=ar·N^αr,αr<1 表示规模扩大有帮助,αr≈1 表示持平,αr>1 表示累积对齐债务。作者用玩具模型证明长期状态由被修正风险中最大的指数决定而非平均值,且小模型拟合会低估大模型指数。两次预注册实测显示:Pythia 分类器对抗训练达到攻击成功率低于 10% 所需算力按 N^0.60 增长;Qwen2.5 0.5B–72B 上纠正错误答案的指数为 −0.05、纠正风险倾向为 0.48,谄媚为 0.89 属未定,植入后门在已知触发词时 128–256 个样本内被移除,但在五个规模中的四个上能挺过盲测安全训练。作者声明不对当前前沿模型处于哪种状态作判断。
- 论文Hugging Face Daily Papers
VeriFine:通过扩展验证实现具身推理的自我改进
VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的共同演化来扩展验证能力,以支持具身推理中的持续自我改进。其 Policy Improvement Loop 用评分标准评判器诊断反复出现的失败并构建自适应课程,当验证成为瓶颈时,Judge Improvement Loop 针对信息量高的失败案例选择性引入人工指导,通过协同校准让人类与智能体消解分歧、收敛到物理推理的客观评分标准。在驾驶与机器人导航任务上,该框架在强化学习和监督微调中均实现了策略与评判器能力的持续提升。
- 论文Hugging Face Daily Papers
研究提出 CIA 指标衡量并改进 LLM 思维链与内部计算的一致性
研究提出 CoT-Interpretability Alignment(CIA)指标,衡量大语言模型思维链轨迹与可解释性工具检测到的内部推理策略之间的一致程度。作者在两跳问答、提示干预和整数乘法三个任务上评测三个 LLM,发现一致性有限,仅为 44.8% 至 75.9%。随后他们尝试用后训练改进 CIA,将任务准确率和参数化忠实性信号同时作为奖励,结果显示可显著提升思维链参数化忠实性,同时保持或提升任务准确率。论文还分析了泛化模式,并提供代码与数据。
- 论文论文追踪
SIGMA:让模型依据 Model Spec 自我改进安全对齐
研究者提出 SIGMA,一条让模型自我改进安全对齐的数据生成与训练流程,仅需一份描述期望行为的 Model Spec。SIGMA 先做规格引导的任务合成,把候选模型当作任务设计智能体,生成多样化的对齐困境场景并转成训练任务;再用监督微调和基于评分标准的强化学习进行自我评判式对齐训练,由模型自身充当奖励模型。尽管只用单轮对话数据训练,SIGMA 在多轮智能体环境中改善了安全对齐,AgentHarm 有害性从 22.6 降至 14.8,Agentic Misalignment 从 79.1 降至 3.8,并优于 Deliberative Alignment 与 Constitutional AI 基线,同时保留通用能力。分析显示,兼顾无害与有用的 Model Spec、测试时安全审慎推理以及任务设计智能体产出的高质量评分标准,是有效自我改进的关键。
- 论文Hugging Face Daily Papers
UnAct:无需梯度的定向激活干预实现类别遗忘
研究者提出 UnAct,一种无需梯度的类别遗忘方法,只需对遗忘图像做前向传播:按响应给后层单元打分,削弱响应最强的连接,最多重复 20 轮,不使用梯度、标签和保留数据。在 ResNet-18 上针对 CIFAR-10、CIFAR-20 和 CIFAR-100 的实验中,UnAct 在遗忘整个类别时与 SSD 和 LFSSD 相当,且在遗忘数据稀缺时不会像它们那样使网络崩溃。在 ResNet-18 上,UnAct 的保留准确率与重训练的差距保持在 2.5 个百分点以内,而 SSD 和 LFSSD 在全类别操作点上某些类别最多损失 86 个百分点。在 CIFAR-10 上仅用 5 张遗忘图像时,UnAct 与重训练的距离为 0.21 个百分点,LFSSD 为 67,SSD 为 90,且用 oracle 在每个规模上重新选择 SSD 阈值也无法缩小差距。代码已开源于 GitHub。
- 论文论文追踪
研究:视觉语言模型在协作任务中很少主动表达指代不确定性
研究者在人机协作拼图任务中考察指代不确定性,即描述指向哪个候选物体上的不确定,由人类 Helper 指示 AI Worker 放置拼图。单独引出的候选物体信念分布校准更好(ECE 0.15),区分正确与错误放置的能力也更强(AUROC 0.65),而原始动作 token 概率严重过度自信(平均置信度 0.97,ECE 0.44)。在 GPT-4.1、GPT-5、GPT-5.5 三个前沿视觉语言模型上,这种引出的不确定性随指令模糊程度可预测地上升,但不随上下文中存在竞争指代物上升,即使后者会增加错误。模型很少将其外化,仅在 3.5% 至 16.7% 的轮次中请求澄清。在 N=210 的受控人类实验中,只看到 Worker 默认消息的参与者接受了 78% 的错误放置,且无法区分对错(AUC 0.50);精确描述和有针对性的模糊限定可将错误动作接受率降至 36%,同时大体保留对正确动作的接受。
- 论文论文追踪
PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督
研究者提出 PyINE 框架,用带插桩的 Python 程序作为可验证的执行基底,来研究推理模型在给出看似合理但不完整推理时,监督者能否判断其输出是否可信。框架中程序定义任务环境,执行轨迹为结果和中间事实提供权威标签,任务变体可机械生成而非依赖静态人工标注。首个版本 PyINE-v1 由近 100 万条确定性执行轨迹和超过 50 万条匹配的 LLM 生成代码变体构成,用于反事实评估。研究者用标准 RL 与可验证奖励在提示词变化的任务上训练出一个走捷径的模型,该模型在预测执行结果上明显提升,但当误导性的人类面向线索与程序实际行为冲突时仍会系统性出错。随后他们评估了激活探针、训练文本分类器、提示词评判器和轻量辩论协议作为监督者,发现数据集层面的汇总性能会掩盖对最关键失败的覆盖不足:廉价的学习型监督者常漏掉罕见的捷径驱动错误,更强的模型检查更均衡但成本高得多,也更难转化为可靠的阈值决策。
- 论文论文追踪
辩论训练在 RLAIF 中减少奖励作弊
研究者发现,用生成者与批评者两方对抗、由更弱 LLM 评委裁决的辩论方式对 LLM 做 RL 微调,相比 RLAIF 基线能减少奖励作弊。实验在最终答案可验证的数学任务上进行,用冻结的 Gemini 2.5 Flash Lite 评委训练 Gemini 2.5 Flash 级策略:基线很快攻破评委,辩论则在整个训练过程中维持评委表现,峰值验证准确率更高,弥补了 45% 的性能差距,并在多轮 RL 后保持。进一步实验显示,评委进一步变弱会加快作弊,但增加一轮辩论可以补偿;辩论激励可覆盖提示层面的失准;使用 LLM 评委的 RL 比可验证奖励 RL 的训练与验证奖励差距更小;用真值标签学习说服评委的批评是可行的但较慢。作者指出多智能体训练平衡很关键,若无玩家约束,对抗训练可能退化为批评者攻破评委,批评字数限制(约 150 词内有效)能平衡博弈并避免评委被攻破,但会限制批评者的表达清晰度。
- 论文论文追踪
为什么潜意识学习需要海量数据:从引导向量恢复看含噪逆问题
论文研究潜意识学习为何需要数万条载体样本,并把引导向量蒸馏建模为含噪线性逆问题。作者以已知的残差流向量 Δ_T 作为教师特质,在相同载体前缀下比较 token 级硬标签 NLL 监督与全分布软标签 KL 监督。初始化时两种目标的梯度近乎共线且都与 Δ_T 对齐很差,但迭代优化后出现分化:软监督用几百条载体就能几乎精确恢复 Δ_T,硬监督即使数万条也远低于该水平。作者解释为局部上载体任务通过 Fisher 矩阵 F 映射特质,梯度指向 FΔ_T 而非 Δ_T,梯度下降相当于逐步减弱阻尼的 F 逆;软目标能恢复低曲率方向,硬标签则同时放大这些方向上的采样噪声,因此存在随独立载体数量增长的最优逆深度。作者据此认为,大规模载体数据集更多是为了抑制 Fisher 逆放大的标签噪声,而非揭示特质本身。
- 论文Hugging Face Daily Papers
数据稀缺下 LLM 的协作式个性化偏好对齐:APO 方法
针对用户反馈稀缺导致 LLM 个性化对齐困难的问题,研究者提出近似帕累托最优(APO)方法:先按更新兼容性对用户分组,组内结合梯度下降与受控上升协调相互竞争的目标,得到靠近组内用户最优点的初始化,再用少样本本地适配迭代精修。在 Fed-ChatbotPA 和 UltraFeedback 上,仅用 20 个本地样本即持续优于现有方法,并给出单步协作更新的条件次优性界,刻画初始化误差对后续随机适配的影响。
- 论文论文追踪
SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别
研究者提出 SycoLens 模块化重放协议,对来自三家厂商的 11 个前沿模型进行约 76 万次受控重放,发现单一谄媚翻转率无法区分模型自我纠正与屈从。用户施压措辞决定哪些模型显得谄媚:断言相反结论与仅质疑答案的两类措辞对模型的排名几乎不相关,家族内排名一致性约 0.82 至 0.88,跨家族接近零。翻转效应在模型自身决策边界附近增大约 40 个百分点,但筛选中答案一致的条目仍贡献受影响最大模型约一半的总效应。在已知真值的算术任务上,一个模型在压力下重新推导并纠正错误,另一个则放弃正确答案且不展示推导过程。植入的推导会降低模型释放其所支持答案的概率,无论该答案对错。
- 论文Hugging Face Daily Papers
自生成反馈会破坏测试时训练:长时程适应的因果分解
作者研究模型在推理时持续从自身输出学习所形成的反馈回路,在 128K token 流上测试了 125M 到 3B 的 TTT-E2E 模型以及基于 Adam 的 Qwen3-4B 适应过程。结果显示反馈是损害的主要来源:改用冻结模型生成训练文本,在 125M 和 760M 上消除了超过 98% 的损害,即使学习器仍在生成文本上更新。更好的源拟合可能意味着更差的迁移,一次更新可以改善对训练段落的预测,却损害独立的真实文本。作者提出的 Settlement 测试会在保留候选更新前用独立文本进行验证,显著降低损害同时保留真实文本上的适应能力,代码已开源于 GitHub。
- 论文Hugging Face Daily Papers
研究者提出主动式 LLM Agent 的 3T 原则与 Proactivity-Gym 评测环境
论文提出围绕任务能力、时间分配与信任三项联合原则(3T)设计、实现和评估主动式 LLM Agent,即让 Agent 在用户提出需求前利用闲置算力提供支持。作者将这三项目标对应到任务范围、预判时域、激活触发、处理时机和干预深度五个维度的设计空间,并说明所需的用户与环境表示、骨干 LLM 和 Agent harness 等情境与系统建模。研究还提出基于仿真的评测环境 PROACTIVITY-GYM,包含多日场景、有状态环境和带人设的模拟用户,用于评估主动式协助在多次交互中的后果。在 23 种模型与 harness 配置上的评测显示 3T 各维度存在明显性能差距,且 LLM 评判者常混淆任务能力与信任;30 人的人类研究显示,干预错位即便结果正确也会导致信任明显下降,参与者更偏好睡眠时段协助,即使其表现不完美,以保持当前专注。
- 论文Hugging Face Daily Papers
PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径
研究者提出 PerturBot,用于缓解视觉-语言-动作(VLA)策略中的模态捷径问题,即策略依赖训练中反复出现的视觉、词汇或动作线索而非任务证据来做决策。该方法在训练阶段引入保持任务语义的腕部视角扰动、加入含决策信息的指令描述,并混入随机与失败轨迹片段并按其中实际行为重新标注,推理阶段不做改动。作者同时提出离线指标 GroundingFscore,用于诊断策略对模态捷径的依赖程度,与任务成功率互补,判断策略是否在健康地扩展。论文称二者共同构成一套训练与评估框架,使 VLA 决策更多依赖任务相关证据。
- 论文论文追踪
研究提出 SafeReAct:恢复后训练大模型被掩盖的安全机制
论文发现后训练会掩盖基座大语言模型原有的安全机制,同时过度放大与后训练能力相关的表征,但安全机制本身并未被移除。作者据此提出 SafeReAct,通过在少数层上对齐 LoRA 适配器来恢复被抑制的安全行为。在四个先进大推理模型上的实验显示,该方法显著提升了对有害提示的安全表现,且未损害推理性能;在医疗等特定领域模型上的额外结果也支持其通用性。
- 论文arXiv
差分隐私混合公共数据集提升隐私学习效果
研究者提出首个能在差分隐私(DP)下为特定敏感下游任务学习多个公共数据集混合配比的流程,核心思路是通过隐私学习一个低维线性模型来找到最佳混合方案。在 NIH ChestX-ray14 的 X 射线分类任务上,该方法相比基线将 macro AUC 最多提升 0.037,在 ε=1 时 Cardiomegaly 的相对 AUC 提升达 22.8%;在 ENRON 邮件数据集的 DP 训练中,用 The Common Pile 混合数据预训练使测试困惑度相对降低 16%。
- 论文arXiv
长时程轨迹监督如何影响终端智能体训练的可靠性与成本
研究提出"监督时程"(保留用于训练的轨迹 token 数)是终端智能体可靠性与成本的关键设计轴:在 Terminal-Bench 上,12K token 时程解出的任务多于 16K(29±0.7 对 26±0.8),训练时间还少 30%。短时程导致过早终止,中等时程带来有效的错误恢复,长时程则引发过度坚持。据此提出的选择性长时程精炼先在短前缀上训练、再仅对 warm-start 模型下最可能的续写做精炼,在 16K 下将成功尝试从 110±2.7 提升到 126±2.1,八次中至少六次解出的任务从 9±0.7 提升到 14±0.6,并迁移到 Terminal-Bench v2.0 与 OpenThoughts-TBLite。