跳到正文
10月10日 · 周六

全部论文

找到 64 篇

另有 272 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.12409

    研究者对 HELM Safety 与 HarmBench 做心理测量学审查,质疑其分数能否代表单一属性

    审计 HarmBench 分数能否代表单一 harmful refusal 属性

    发表
    摘要作者称 HarmBench 不对应单一 harmful refusal,比较模型时应把行为分开。

    这是对 HELM Safety 中 HarmBench 的构念效度审计,检查 harmful refusal 能否作为单一属性来读分数。。

    深度解读完整解读
  2. 分析与理论arXiv 2610.12313

    研究测试五个大模型合规系统对监管规则扰动的敏感度

    诊断合规系统裁决是否随监管规则扰动而改变

    发表
    被测模型
    Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 等 5 个
    摘要五模型上许多正确裁决对删换否定规则大体不变。

    用行为反事实和激活探针,审计合规裁决是否依赖所给规则。。作者要分开两种看起来一样的正确裁决:用了所给规则的,以及靠案例表面或训练模式得到的。

    深度解读完整解读
  3. 分析与理论arXiv 2610.10203

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    发表
    被测模型
    gemma-2-2b-it、olmo-2-1b、llama-3.1-8b-it
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    深度解读完整解读
  4. 分析与理论arXiv 2610.09667

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    发表
    被测模型
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    深度解读完整解读
  5. 分析与理论arXiv 2610.09004

    研究:去除有害信息不足以证明开源权重模型的抗篡改能力

    论证发布时互信息不能认证开源权重抗微调恢复

    发表
    被测模型
    EleutherAI/deep-ignorance-e2e-strong-filter、EleutherAI/deep-ignorance-unfiltered、Google BERT-Tiny 等 6 个
    摘要作者称零信息仍可一步恢复,表观抗微调可来自参数化。

    作者研究开源权重模型的篡改抵抗:发布时的互信息是否足以保证微调恢复很慢。

    深度解读完整解读
  6. 分析与理论arXiv 2610.08577

    学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究

    分析记忆与泛化如何决定机器遗忘的 retain 损伤

    发表
    被测模型
    one-layer ReLU transformer、one-layer transformer (BMA, width doubled)、Hubble-8B-100B perturbed 等 6 个
    摘要作者称共享规则占比越高,遗忘带来的 retain damage 越大。

    作者考察学习方式如何左右 unlearning 的 retain damage:训练越依赖跨样本共享的解法,在匹配的遗忘程度上,retain 上的损失越大。

    深度解读完整解读
  7. 分析与理论arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  8. 分析与理论arXiv 2610.06163

    SAGE:定位 LLM Agent 修复中最早偏离安全意图的环节

    提出 SAGE,定位代码修复 Agent 最早偏离安全意图的轮次

    发表
    被测模型
    GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro 等 6 个
    摘要SAGE 在已通过检查的修复轨迹上定位静默失败的最早偏离,类型比轮次更稳定。

    SAGE 在已通过语法和功能检查、但仍含确认安全缺陷的智能体修复轨迹上,定位最早可归因的安全意图偏离。。

    深度解读完整解读
  9. 分析与理论arXiv 2610.07005

    研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因

    遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联

    发表
    被测模型
    Qwen2-Audio-7B-Instruct、LLaMA-Omni
    摘要AdvWave-P 的八频带排序与能量相关。

    这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。

    深度解读完整解读
  10. 分析与理论arXiv 2610.05076

    自生成反馈会破坏测试时训练:长时程适应的因果分解

    因果分解自生成反馈如何破坏测试时训练的长时程适应

    发表
    被测模型
    125M TTT-E2E、760M TTT-E2E、3B TTT-E2E 等 5 个
    摘要自写闭环损害真实文本预测。

    持久测试时更新若来自模型自己生成的文本,会同时改变模型和后续训练文本。作者在 PG-19 长流上分解这条闭环,并用独立文本决定是否提交更新。

    深度解读完整解读
  11. 分析与理论arXiv 2610.04375

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改

    发表
    被测模型
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    深度解读完整解读
  12. 分析与理论arXiv 2610.02886

    研究揭示无触发投毒审计缺口:事实答对不等于决策正确

    揭示无触发虚假训练下事实回答与下游决策的审计差距

    发表
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个
    摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。

    论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。

    深度解读完整解读