跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 3,678 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源202新闻与研究603细分与主体7来源:论文追踪论文追踪5 条材料来源:Hugging Face Daily PapersHugging FaceDaily Papers1 条材料论文:潜空间图像水印在几何变换下的鲁棒性上限论文潜空间图像水印在几何变换下的鲁棒性上限论文:ES-Trace:26 个代码模型伦理采购披露审计论文ES-Trace:26 个代码模型伦理采购披露审计论文:STCA:自动驾驶视频模型对抗鲁棒性研究论文STCA:自动驾驶视频模型对抗鲁棒性研究论文:医疗问答中一致答案仍可能错误:观察共识形成过程的置信信号论文2026-10-06医疗问答中一致答案仍可能错误:观察共识形成过程的置信信号论文:研究:无关信息污染患者病历并干扰LLM临床推理论文2026-10-06研究:无关信息污染患者病历并干扰LLM临床推理论文:Harness-Aware Distillation:让小语言模型智能体学会 harness 之外的能力论文2026-10-01Harness-Aware Distillation:让小语言模型智能体学会 harness 之外的能力方向:其他方向其他方向1方向:安全评测安全评测1方向:越狱与攻击越狱与攻击3方向:红队红队1方向:对齐对齐2方向:隐私与数据泄露隐私与数据泄露1方向:Agent 安全Agent 安全1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。1 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    潜空间图像水印在几何变换下的鲁棒性上限

    论文从理论与实验两方面讨论潜空间图像水印在几何变换下的鲁棒性限制,指出这类水印的鲁棒性存在上限。

  • 论文论文追踪

    ES-Trace:26 个代码模型伦理采购披露审计

    ES-Trace 对 26 个代码模型的伦理采购披露情况进行了审计,发现报告在追踪引用材料后披露评分有所提高,但劳工和社会项目方面的披露相对较弱。

  • 论文论文追踪

    STCA:自动驾驶视频模型对抗鲁棒性研究

    一项名为 STCA 的研究针对自动驾驶视频视觉语言模型,考察可迁移的黑盒对抗风险。该工作聚焦黑盒条件下对抗样本的跨模型迁移能力,用于评估此类视频模型在真实攻击场景下的鲁棒性。

  • 论文论文追踪

    医疗问答中一致答案仍可能错误:观察共识形成过程的置信信号

    医疗问答中模型给出的答案即使高度一致,仍可能是错误的。作者提出通过观察共识形成过程来获取置信信号,以识别这类一致但错误的答案。所报改进仅限于该研究设置。

    #对齐原文 ↗
  • 论文论文追踪

    研究:无关信息污染患者病历并干扰LLM临床推理

    一项研究在医患对话及模拟诊室音频中测试无关信息对AI病历生成的影响,发现闲聊和旁人病情会被写入病历或错误归属,而常规质量分数变化不大。研究结果由LLM裁判判定,未经医生复核,也未测试真实诊疗损害或医生签字前能否发现错误。

  • 论文Hugging Face Daily Papers

    Harness-Aware Distillation:让小语言模型智能体学会 harness 之外的能力

    针对小语言模型智能体蒸馏时 harness 保持不变、学生模型只需学习教师模型超出 harness 的能力这一特点,研究者提出 Harness-Aware Distillation(HAD),将蒸馏重点放在教师模型相对 harness 的增量上。HAD 在 on-policy 蒸馏基础上加入动作偏好对比(对比同一教师模型在有/无 harness 信息下的动作,并在学生自身推理后打分)和有效性检查(剔除与 harness 记录矛盾的偏好对)。在多个长程智能体基准和模型上,HAD 以相同固定 harness 超过 on-policy 蒸馏基线,且无需任务奖励、成功标签或未来信息;分析显示其更少陷入无效循环、更常从错误中恢复。

  • 论文Hugging Face Daily Papers

    AGO AI Quality Gate:面向 RAG 的"证据优先"发布决策框架

    AGO AI Quality Gate(AGO)是一套面向工业级 RAG 评估的"证据优先"质量门框架,把缺失数据和评审模型出错都当作显式结果,结合确定性检查、本地护栏与结构化 LLM 评估分层打分,并用分层 beta-binomial 门控量化回归风险。在 RAGBench 的 12 个数据集、每个评审模型 N=1200 的分层测试样本上,gpt-4.1-nano 识别不合规回答的 AUROC 仅 0.603,gpt-4o 为 0.783,但其分领域表现仍在 0.62 至 0.88 之间。固定随机种子的门控研究显示,回归场景下决策级配置将不安全放行率降至 22.2%-35.1%,而朴素门控为 29.3%-41.8%。

  • 论文论文追踪

    论文实测 Agent 工具调用门控栈的失败相关性

    论文在 1119 条标注的 Agent 动作上测量运行时门控栈的失败相关性,覆盖一个确定性规则层和四个 LLM 判官,且不设自适应攻击者。作者提出 nmult 指标,把观测到的联合漏检率换算成等效独立层数:在 STRICT 定义下任意两个判官组合约等于 1.22 至 1.44 层,规则层加一个判官约等于 1.86 至 2.09 层,两组区间在合并数据上分离,但单个语料上点估计分裂、区间重叠。单独准确率无法预测一层给栈带来的增量,一个云端规则包把规则层单独漏检率从 0.139 降到 0.111,却未增加任何新的联合覆盖。难度对判官耦合的贡献份额不可识别,随难度探针和漏检定义在 31.8% 到 61.8% 之间变动。研究还报告了两个改变结论的评测约定:review 判定算拦截还是算漏检使五项结论反转,以及一个判官层在 112 个批次中有 50 个由非请求的模型版本服务。

  • 论文Hugging Face Daily Papers

    ConEx:通过概念感知归因生成人类可解释的显著性图

    ConEx 是一个将显著性可视化与概念推理结合的可解释性框架,能自动发现类别专属概念并用概念激活向量(CAVs)表示,无需人工监督。它通过架构特定的掩码机制降低分割掩码噪声、提升概念纯度,生成揭示各概念出现位置及其对预测贡献的显著性图。作者提出 VCM 与 CCM 两项指标衡量概念对齐,实验显示 ConEx 在忠实性、分割和概念质量基准上达到 SOTA。

  • 论文论文追踪

    SBW:面向 LLM 智能体的语义行为水印方法

    研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。

  • 论文论文追踪

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    DEFER1 研究多智能体防御,并报告受控测试中的攻击成功率降低。这些受控测试结果不等于该方法对任意模型或运行环境均有效。

  • 论文论文追踪

    两阶段智能体轨迹审计框架:用门控规则加 LLM 审计降低监控成本

    研究者提出两阶段智能体轨迹审计框架,第一阶段用单事件与轨迹序列规则筛选待检动作,第二阶段由 LLM 审计智能体结合前序轨迹在执行前审查每个被选动作,并用训练数据联合优化门控规则与审计指令。在公开基准 OpenAgentSafety 上,该框架将每次运行的 LLM 审计次数从 8.15 降至 2.33、token 用量从 47.8k 降至 14.6k,检测率为 72.8%,而全量审计为 81.5%。在两个模拟多智能体案例中,框架标记出全部恶意轨迹,同时将审计 token 用量减少超过 80%。

  • 论文论文追踪

    综述:100项研究显示青少年AI风险防护多停留在设想阶段

    一项系统综述梳理了100项涉及儿童与青少年接触AI的实证HCI研究,覆盖学校、家庭、照护机构和公共服务等场景。研究使用YAIR风险分类和MIT Mitigation Taxonomy对策分类,对风险与防护措施进行映射,发现多数风险只对应提出或设想中的对策,已实施的对策很少,经过评估的更少,且现有评估多衡量技术性能而非是否真正防止了伤害。作者据此指出风险覆盖的空白区域和未经检验的防护措施,并提出HCI研究加强青少年AI安全的具体方向。

  • 论文arXiv

    研究:后训练配方决定大模型是否违背自身道德判断行事

    研究者构建了 248 个场景的预注册面板,覆盖完成任务、用户反驳、禁用捷径、偏袒本群体和伤害第三方五类压力,每个场景分别以智能体视角和第三人称视角向同一模型提问,以模型自身判断为参照测量判断与行动的差距。在 OLMo-3-7B-Instruct 上,模型在约五分之一的受压力场景中采取了它自己判定为错误的行动,比去掉压力的对照场景高出 0.10(95% CI 0.02 到 0.18),而操作者直接下令违规时该数值达 0.58。四个 instruct 模型中,OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,Tulu 3 在整体面板和自身筛选场景上均未检出,Qwen2.5-7B-Instruct 在整体面板上未检出、在自身场景上未定论。Meta 与 Ai2 的 Tulu 3 基于同一套 Llama-3.1 权重,只有 Meta 的配方保留了差距。

  • 论文arXiv

    面向大语言模型的参数内记忆增强综述

    一篇综述系统梳理了在部署阶段为大语言模型(LLM)增强"参数内记忆"的方法:把承载记忆的参数对象在推理时接入前向传播,以补充上下文学习(ICL)占用上下文容量、重复离散编码成本随上下文长度增长的问题。综述用两个正交维度组织该领域:参数放置位置(Embedding、Attention、FFN 层或 Hybrid)与参数获取时间(部署中在线获取 vs 部署前离线获取),并讨论了干扰、安全、与 ICL 协同设计及递归自我改进等开放方向。

  • 论文arXiv

    ASCENT:通过一阶最优校准实现安全与效用协同的微调框架

    研究者提出 ASCENT,一个通过一阶最优安全感知周期性校准与任务优化实现安全与效用协同提升的下游微调框架。该方法把安全建模为大语言模型参数的函数 S(θ),用其一阶近似刻画参数更新带来的安全变化;在固定秩与 Frobenius 范数预算下,证明由安全函数梯度前 r 个奇异分量构造的更新能最大化估计的安全变化,并将其用于周期性校准。研究还推导出一个唯一的安全保持任务更新,在贴近原始任务更新的同时惩罚对估计安全变化的负面影响,ASCENT 交替执行这两类更新。在多个大语言模型家族和下游任务上,ASCENT 将下游效用最多提升 20.3%,攻击成功率最多降低 35.5%。代码已开源于 https://github.com/ZJU-LLM-Safety/ASCENT。

  • 论文arXiv

    NetAgent:面向多任务网络流量分析的智能体框架

    NetAgent 是首个用于多任务流量分析的智能体框架,无需任务特定训练即可完成复杂任务理解、动态分解编排与长时程分析。它包含知识增强的工作流规划、150+ 工具的动作空间、统一代码执行空间、三层记忆以及沙箱与运行时修复五项设计。在 9 个基准上,NetAgent 在几乎所有任务上超越 23 个单任务和 5 个多任务基线,对未见流量分布的 F1 达 90.04%,而最佳基线仅为 2.74% 和 3.04%。

  • 论文arXiv

    IAU-FOA:面向闭源多模态大模型的可迁移对抗攻击方法

    研究者提出 IAU-FOA,一种面向闭源多模态大模型(MLLMs)的可迁移定向对抗攻击方法。现有定向迁移攻击主要用编码器 [CLS] 嵌入等全局图像级特征对齐对抗样本与目标样本,对 patch 级视觉结构利用不足,限制了跨异构闭源 MLLMs 的迁移性。IAU-FOA 同时在全局和局部对齐:用基于余弦的目标缩小全局语义差距,将 patch token 聚类为紧凑局部模式并通过最优传输匹配。针对均衡最优传输在缺乏可靠对应局部簇上强制固定边际质量、可能引入误导性对齐梯度的问题,作者引入置信度自适应非均衡传输,对弱匹配簇放宽约束。此外提出视觉不变性增强,通过双向像素强度缩放和逐通道白平衡调整模拟曝光、对比度、光照和色温变化。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因

    研究者在 Qwen2-Audio 上审计加性音频越狱 AdvWave-P 的频率与解码层归因,在 STFT 域遮蔽扰动的频率成分并测量攻击成功率与音频跨度表示。在 520 条 AdvBench 提示上,主评判将 76.7% 的对抗输入标为越狱;单标注者盲条件验证给出 Rogan-Gladen 灵敏度估计 0.87(约 0.83-0.95),该校正未应用于遮蔽条件。表观频率排序依赖划分方式:仅能量占比即可预测标准八频段排序(Spearman's rho = 0.95),等 Hz 与等能量划分显示遮蔽任一测试频段都可能大幅降低攻击成功率;在更细的 16 频段等能量分辨率下,遮蔽 7520-7960 Hz 窄频段后 ASR 仍为 0.10,缺少匹配对照尚无法解释。匹配能量的分散移除测试显示,连续移除在低频段破坏更大,两种形式在高频段都接近下限。该关联并非因果定位,单层修补也不能确立因果层。

  • 论文arXiv:越狱、提示注入、投毒与防御

    研究揭示投机解码的安全代价并提出 SecureSD 加固方法

    研究对投机解码的安全影响做了系统性测量,发现存在明显的安全与效用不对称:在多种有损投机解码方法中,推理效率提升带来的越狱和提示注入攻击成功率上升速度远快于效用下降。作者据此提出 SecureSD,理论分析指出安全退化主要来自 draft model 生成的早期 token,因此对早期解码位置的 draft token 采用更严格的验证标准。在安全与效用基准上的实验显示,SecureSD 在保持效率和效用的同时显著提升安全性。

  • 论文arXiv:越狱、提示注入、投毒与防御

    学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究

    研究揭示模型的学习方式会显著影响其后续遗忘效果:在模加法任务中,依赖泛化策略训练的模型在遗忘时对保留集的性能损伤更大,且这一趋势在记忆-泛化谱系上近乎单调。该结论在LLM的逐字回忆与事实回忆遗忘场景中同样成立,为设计更优的遗忘方法提供了依据。

    #对齐原文 ↗
  • 论文arXiv:越狱、提示注入、投毒与防御

    RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准

    研究者提出 RAG-PIBench,一个面向 RAG 式提示注入检测的基准,包含 4,876 条上下文样本,划分为冻结的训练、验证与受保护测试集。该基准采用泄漏感知的构建流程与严格评测协议,对比了关键词、语义参考、TF-IDF 与 Transformer 类检测器。DistilBERT 在受保护测试集上取得最佳表现(F1 = 0.896,PR-AUC = 0.968),TF-IDF SVM 与逻辑回归仍具竞争力。

  • 论文arXiv:越狱、提示注入、投毒与防御

    LADE:用暗知识中的模型无关潜在安全信号防御 LLM 越狱

    LADE 通过对比有害与良性查询,从首个 token 输出概率分布的暗知识中提取潜在安全信号,构建跨模型通用的安全方向。该方法由潜在安全信号提取、Tokenizer Mapping 和 kNN 判别三部分组成,可适配不同分词器的 LLM。在多种模型和基准上,LADE 对多种越狱攻击保持稳健,降低攻击成功率并维持安全与效用的平衡。

  • 论文arXiv:越狱、提示注入、投毒与防御

    HARP:在硬资源约束下为 LLM 评测动态分配预算

    研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬性资源约束下为 LLM 多轮交互评测动态分配预算的方法。该方法把评测建模为时间到事件问题,即产生越狱成功或智能体任务完成等目标事件所需的交互步数,并在算力有限导致轨迹被提前终止、事件时间仅被部分观测(删失)的情况下自适应重新分配未用预算。作者证明 HARP 不会超出目标预算,其下预测界(LPB)具有有限样本覆盖保证,且指标估计无偏。在智能体任务成功、LLM 越狱、有害内容生成和 RAG 幻觉等实验上,HARP 的覆盖率接近名义水平且方差较低,同时始终不超出给定预算。