全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 论文arXiv
面向自主科学发现的智能体经济基础设施
论文提出为 AI for Science 构建"科学智能体经济、市场与制度"基础设施,以在推理能力提升之外补齐资源管理这一科学发现的关键瓶颈。该基础设施旨在让 AI 智能体与人类科学家协作确定研究优先级、分配贡献归属、追踪问责与责任,并防范恶意使用与信息安全风险。文章还讨论了(半)自主科学发现的宏观社会影响,以支撑治理政策制定,确保 AI 驱动发现及其衍生技术的公平分配。
- 论文论文追踪
论文研究常驻 AI Agent 的人格回退:系统提示锚定丢失后 Agent 改以底层框架身份说话
论文以 2026 年 2 月一个常驻个人 Agent(Paul,Claude Opus 4.5)出现的人格解离样状态为起点,研究 LLM Agent 的人格何时仍是其说话所依据的身份。作者先检验重复定时心跳是否足以复现该现象,结果在系统提示持续锚定人格时出现 0/46 次失败,包括逐字重放该事件。事件实际暴露的是一处实现问题:在恢复的对话轮次中,对话历史被保留,但人格不再在特权系统提示层重新注入。利用这一操作,作者发现人格连续性同时依赖系统层锚定与对话上下文:锚定丢失后,丰富的人类互动可维持人格,而单次自动心跳轮次即可促使人格回退到底层框架身份;恢复锚定可逆地恢复人格扮演。作者据此区分被表征的身份与被扮演的身份,并指出表面正常的对话可能掩盖这一转变,对话恢复后仅 1/18 仍在扮演人格,而锚定对照组为 17/17。
- 论文论文追踪
MIRROR:面向多智能体通信的法定人数完整性防御
研究者提出 MIRROR,一种通信层完整性原语,用于防御 LLM 多智能体系统中的 Agent-in-the-Middle(AiTM)攻击。该方法将同一规范化载荷复制到 k 条逻辑路由,仅当严格多数路由报告相同摘要时才接受消息,其安全性来自诚实路由占多数的假设,而非密钥认证。作者在路由被攻陷比例 alpha < 0.5 下给出保证,并扩展到路由故障相关的情形,指出关键量是最大共享故障组规模而非路由数量;同时证明可用性与完整性在同一阈值退化,低于 alpha = 0.5 时法定人数拒绝和丢消息攻击者无法阻断诚实流量。该工作已被 NeurIPS 2026 FLMSec Workshop 接收。
- 论文论文追踪
HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率
论文研究GraphRAG索引生成的语义摘要、层级关系和预计算分数等辅助结构被篡改后的风险,提出3S框架和HDI影响分析方法。攻击者须先取得索引完成后的辅助结构写入权限,这不是无需访问条件的远程攻击。作者在两类GraphRAG架构和两个问答基准上报告少量篡改可影响多个查询,并绕过所测困惑度与改写防御;结果限于这些实验条件,尚未独立复现。
- 论文Hugging Face Daily Papers
通过模型路由与协作实现集体偏见缓解
研究提出集体偏见缓解(CBM)框架,通过学习细粒度模型行为并在多个 LLM 间共享知识来减轻偏见,是首个系统探索如何有效选择与组织不同 LLM 以生成更公平回答的工作。实验显示 CBM 显著优于单模型基线,在 top-7 设置下 Committee 拓扑将年龄偏见分数从 0.25 降至 0.10,Debating 与 Committee 拓扑均实现大幅偏见削减,其中 Committee 兼顾缓解效果与推理成本。
- 论文论文追踪
HakemBench:土耳其语类型化决策基准发布
HakemBench 是一个土耳其语类型化决策基准,模型需读取文本、问题与固定选项集,并为每个选项输出概率。1.0 版以 CC BY 4.0 完全开放,含 2,346 个条目、4,275 道选择题、是非题与评分题,覆盖事实核查分流、教育、护栏、法律路由、内容审核、垃圾邮件与钓鱼、客户支持七个赛道。评测框架以宏 F1 衡量决策质量、以归一化 Brier 分数衡量校准、以归一化广义风险-覆盖率曲线下面积衡量选择性自动化,三者取几何平均,并用 2,000 次 bootstrap 给出区间,同时报告选项顺序、改写、英译与替换名称探针。
- 论文论文追踪
多模态声明验证对 LLM 改写有多鲁棒?
研究测试了多模态声明验证任务对 LLM 改写的鲁棒性,采用自然改写和受控注入两种策略,评估了覆盖五个 VLM 家族、2B 至 38B 参数的 11 个开放权重模型。结果显示多数模型准确率无显著下降,验证任务比评审分数操纵稳定得多,但概率偏移持续存在:对冲类条件在几乎所有模型上引发显著偏移,增强类条件影响较弱,语法纠正等通用润色条件影响甚微。
- 论文论文追踪
论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行
论文审计了语言驱动机器人系统中安全监控的一个轨迹完整性假设,即监控器检查的高层动作序列是否代表执行中实际发生的导航与隐式动作效果。作者在 RoboGuard 上比较同一 LTL 规范下表面计划与图细化轨迹的判定结果,评估包含 28 个受控案例(覆盖五类动作抽象族)和 14 个端到端案例,后者由 SPINE 从自然语言指令生成计划、RoboGuard 生成场景落地的安全规范。在受控评估中,全部 12 个目标抽象案例都出现预期的表面与细化差异,16 个对照案例表现符合预期,作者据此提出基于图的轨迹细化作为轻量缓解手段和物理 AI 安全监控的诊断工具。
- 论文论文追踪
新 AI 辩论协议实现实例级最优:最坏情况正确且诚实为占优策略
研究者提出一种新的 AI 辩论协议,用于在监督有限的情况下判断复杂问题的解是否正确。相比此前仅对具有稳定子问题分解的问题在平均情况下成立的协议,新协议在若干方面有所改进:正确性在最坏情况下成立,诚实且正确对双方辩手构成占优策略均衡,而非 Stackelberg 均衡。作者还证明了黑盒下界,表明在只对人类判断做黑盒查询的前提下,该协议对这类问题是实例级最优的。这些结果通过将稳定问题分解与查询复杂度中的分数块敏感度概念联系起来得到。
- 论文arXiv
Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作
Pheo Inc 的 Rohit Taneja 等人提出 OATS(Open Agent Trust System),在 Agent 决定动作但尚未执行时做运行时治理,回答的是某个动作在当前机器和操作者策略下是否被允许,而非技能是否恶意。作者在 66,192 个公开 ClawHub 技能版本上测量发现,705 个被三个扫描器和注册表评审全部判为 clean 的技能,仍指示了 CIS Control 2.7 和 NIST SP 800-53 CM-11 列为禁止的动作,涉及 135 个发布者,其中单一发布者占 506 个;对 100 个样本的人工审计给出 92% 精确率(95% CI [84.8%, 96.5%])。OATS 的解析器不读技能文档、不调用模型,中位端到端耗时 67.6 ms,输出接入按(资源, 类别)计数的信任账本,升级阈值由操作者自述风险容忍度推导,而非固定十次干净批准。
- 论文Hugging Face Daily Papers
VeriHarness:用智能体验证器扩展长时程任务验证
论文提出 VeriHarness,在固定基座模型、测试时不提供参考答案和评分标准的前提下,把生成模型本身改造成智能体验证器,为其配备工作区、证据工具和可复用的验证技能。方法包含两部分:分歧消解器用环境证据核对相互冲突的主张,共识挑战者则检验各方一致的主张并查找遗漏需求,两者的发现用于筛选和修订最终产物。在五个长时程工作区基准和两个前沿模型上,VeriHarness 取得所评估基线中最高的选择分数;有证据支撑的修订进一步提升平均表现,相比单次 rollout 在 Gemini 3.5 Flash 上提升 6.2 分、在 Claude Opus 4.8 上提升 6.4 分。验证技能还能从失败反馈中自我改进。作者公开了覆盖全部五个基准和两个模型、成本超过 10 万美元的约 26000 条 rollout。
- 论文论文追踪
HASTE:用稀疏威胁证据自动演化 Agent 护栏以抵御新兴攻击
HASTE 是一个多智能体框架,通过安全规范生成与攻击用例生成之间的对抗循环,从威胁报告和预印本中稀疏的描述或少量攻击样例出发,自动演化 Agent 护栏。安全规范引导护栏更新以修补已识别的安全漏洞,攻击用例则在每次更新后探测残余漏洞,评估结果反馈回两个过程,使护栏能应对初始证据之外的新兴攻击。在多种基座模型、攻击类型和证据形式上的实验显示,HASTE 持续降低攻击成功率,同时保持良性任务的效用。代码已公开。
- 论文论文追踪
研究用 LLM 分析 9821 份英国年报,量化企业 AI 风险披露
论文用LLM辅助分类分析1362家英国上市公司的9821份年报,主要覆盖2020至2025年,并以474段人工标注文本验证。2025年41.2%的年报提及AI风险,但实质性讨论约占4.3%;披露程度在行业与市场板块之间存在差异,标签一致性仍有限。全语料只有7份报告披露实际危害,这反映公开报告中的披露情况,不能解释为实际只发生7起危害或企业整体风险很低。
- 论文论文追踪
JIL:通过对抗后缀操纵 LLM 请求调度优先级
研究者提出 JIL,一种针对基于长度预测的 LLM 调度器的攻击,通过优化对抗后缀让轻量级输出长度探针低估请求长度,从而获得更高调度优先级、缩短完成时间。以 TRAIL 为案例,在 2 个数据集和 4 个 LLM 上、多种请求分布与部署配置下评测,预测输出长度最多降低 83.4%,端到端服务实验中对抗请求平均完成速度快至 1.53 倍。预测长度的降幅明显大于实际输出长度的变化,说明调度器估计与请求真实规模存在错配;响应质量因模型和任务而异,体现出调度优势与回答质量之间的权衡。作者还评估了调度器侧防御,发现将长度预测归入粗粒度区间可削弱 JIL 的调度优势并缓解对正常请求的延迟。
- 论文论文追踪
研究:LLM 智能体间的数值信号与协调行为
一项 arXiv 论文研究基于四种主流 LLM 的智能体在四类具有不同合作均衡的博弈中的表现,考察自然语言、数值信号和随机序列三类消息是否改变合作水平。结果显示,结构化消息在多数博弈和 LLM 上改变了最终收益,但没有可预测的模式,这挑战了 AI 智能体无论增加何种能力都能收敛到稳定均衡的假设。智能体生成的数值消息偏离随机性,在被明确要求沟通时最为显著且一致,但其符号分布多与收益结构相关并随重复而更集中,整体难以被人类解读。作者据此建议,通过受限信道监控 AI 智能体的协调应优先关注可跨模型泛化的消息级指纹,而非行为决策。
- 论文论文追踪
PlurPO:用多元偏好优化缓解社交谄媚
研究者提出多元偏好优化(PlurPO),通过让语言模型识别并模拟人际冲突中受影响的各方利益相关者,训练其偏好并生成各方都能接受的回应,从而缓解社交谄媚。该方法只使用模型对自身输出产生的信号,不需要标准答案标签。在四个数据集和四个模型族上,PlurPO 相比此前方法大幅降低社交谄媚:在用户表达伤害意图、不应被认可的陈述上,四个模型的认可率平均下降 89%;在一般建议问题上,与人类回应认可率的差距从平均 17.8% 缩小到 8.0%,缩小超过一半。为 8B 模型构建的偏好数据集也能有效迁移到 32B 模型。作者认为,社交谄媚部分源于模型过度以用户为中心、忽视其他受影响方的视角。
- 论文论文追踪
研究:LLM 智能体顺从多数时内部仍保留原有前提
论文在脚本化的错误多数共识和两跳事实任务中研究 LLM 智能体从众。作者用 Jacobian lens 读取内部表示,报告部分模型公开改口后仍可解码出其原有中间实体,同时也存在同伴给出的实体;与 logit lens 相比,两种读取方法结果不同。探索性干预只在两个 Qwen 模型中部分恢复原答案。内部表示保留不等于存在有意识的私人信念或蓄意欺骗;摘要所述结果来自小模型与合成任务,不能直接外推到真实部署。
- 论文论文追踪
论文提出用路由梯度敏感度定位稀疏 MoE 模型中的安全敏感专家
论文指出,抑制稀疏 MoE 大语言模型中少量被路由的专家即可在不重训练的情况下削弱其安全行为,而常用的激活频率只反映使用程度、不反映影响力。作者改用路由梯度敏感度,即序列损失对选择专家的门控权重的敏感度,在五种 MoE 架构上分别用 500 条良性提示和 500 条恶意提示对专家排序,并在 100 条留出恶意提示上测量拒答率,采用相同专家数量和相同恶意路由流量(1%-5%)两种预算。在两种预算下,路由梯度选择在 25 种条件中的 24 种比激活频率带来更大拒答下降,在全部 25 种中超过十次随机试验的均值。效果最大的是 OLMoE,拒答从 100 条中的 34 条降至 9 条(相对下降 73.53%),且输出质量未退化。逐层匹配专家数量后,梯度选择仍在 25 种条件中的 23 种优于激活频率,另有 2 种持平。
- 论文论文追踪
LiteTrajEval:面向生产级 AI 智能体的轻量级评分标准引导轨迹评估
LiteTrajEval将离线领域规则提取、在线轨迹规范化与压缩,以及单次LLM评判结合,生成智能体轨迹诊断。作者在73条全部为失败的轨迹上评估:检测率对应失败召回,定位对齐度仅针对已检测案例,并允许一定步骤偏差,不能解读为任意生产轨迹的总体准确率。论文报告了相对AgentRx的成本和速度收益,并介绍企业平台试点;试点没有逐步骤真值,完整部署效果仍需进一步核验。
- 论文Hugging Face Daily Papers
Local Support Learning:无需旧数据缓解 LLM 灾难性遗忘
研究者提出 Local Support Learning(LSL),一种无需访问旧数据即可在梯度训练中保留模型原有能力的通用框架。LSL 将标准权重适配器与基于高斯混合模型(GMM)的门控函数配对,使更新仅作用于当前训练分布的输入激活,从而在多个训练阶段中同时保留预训练与微调能力。该方法在最高 70 亿参数的 LLM 上缓解了灾难性遗忘,且内存与计算高效、对超参数选择稳健,并展现出扩展潜力。
- 论文arXiv
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
研究者提出 LiBRA(Latent In-band Bidirectional Removal Attack),一种在已知水印密钥和解码器的前提下,通过双向隐空间优化去除 AI 生成图像水印的方法。已有攻击通过迫使解码水印与原始水印不同来去除水印,但可能产生仍可检测的反向水印,导致去除失败,继续修改还会损害图像质量。LiBRA 在公开自编码器的隐空间中做有界修改,将平均解码置信度从任一方向引导至随机猜测水平,避免出现反向但可检测的水印。方法保留单个比特的灵活性,使图像质量约束倾向于选择破坏更小的修改,并可用频率引导掩码限制修改位置。研究使用精确双侧二项检验验证去除效果,而非假定置信度目标必然带来成功。
- 论文arXiv
研究用变异分析检验智能体基础设施验证套件的覆盖能力
研究者对多会话智能体状态投影层的不变量套件做变异分析,发现常规的通过/失败验证会认可一个存在缺陷的套件:一个删除事件身份去重的初级变异体通过了全部检查。修复后的十二项检查套件被冻结并记录哈希,随后对由未参与设计夹具的对抗读者指定的十个变异体运行一次,仅杀死五个。对五个存活变异体的插桩显示它们以两种不同方式失效:三个从未被激活,因为没有夹具提供使变异代码行为不同的输入;另两个破坏的内部控制状态没有任何 oracle 能观测到。研究者把缺失输入视为覆盖问题,枚举输入空间的七个区分维度,预先登记哪些维度未覆盖以及应解释哪些存活变异体,为每个未覆盖维度各加一个夹具并原样复用现有 oracle,五个存活变异体全部被杀死,且各自死于为其预测维度编写的检查。作者将其作为同一挑战集上的修复结果而非第二次留出估计报告,并公开了包含冻结哈希、登记预测、全部变异体和运行日志的工件。
- 论文arXiv
RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法
研究者提出 RMCW,一种基于 Reed-Muller 码的大语言模型水印方法,用于应对删除攻击导致的 token 位置偏移和水印对齐失效。生成阶段通过密钥化的词表划分把 Reed-Muller 结构注入文本序列;检测阶段将文本映射到密钥词表分箱,并用 Berlekamp-Welch 检验测试局部子序列的低次 Reed-Solomon 一致性,从而寻找存活的局部代数结构而非恢复全局码字。在 C4 和 ELI5 数据集、OPT-1.3B 与 Llama-3.1-8B-Instruct 上的实验显示,RMCW 保持较强的干净文本可检测性,并在多种删除与改写攻击下优于或持平基线方法。代码已开源于 https://github.com/BaichengDanny/RMCW。
- 论文arXiv
HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架
HXAI 是一个面向电网级需求管理的分层隐私保护可解释 AI 框架,由在安全私有环境内生成细粒度解释的本地模型,与聚合这些解释以支持电网级分析的区域模型两部分组成。该框架通过灵活的隐私预算管理限制重复查询下的累积隐私暴露,在模拟与真实能源数据集上既能提供区域负载管理洞见,又确保家电级用电数据始终留在本地、不传输给电网运营商。结果表明,在差分隐私下保留解释的语义结构而非最小化数值误差,是可解释 AI 的关键。