跳到正文
10月8日 · 周四

全部论文

找到 24 篇

另有 733 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09667

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    发表
    测试
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    深度解读完整解读
  2. 分析与理论arXiv 2610.08144

    新论文称 Lean 验证不能为 OpenAI 的 Navier-Stokes 自然语言证明背书

    论证 Lean 编译通过不能保证自然语言数学证明语义忠实

    发表
    测试
    ChatGPT-6 (Astra Ultra)、OpenAI Navier-Stokes formalisation AI、Meta Atlas autoformaliser

    摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。

    深度解读完整解读
  3. 分析与理论arXiv 2610.10203

    研究者提出模型生物体多目标验证框架并给出训练建议

    提出模型生物多目标验证与合并训练方法以减少能力损伤

    发表
    测试
    gpt-5.4-mini、gpt-5.2、gpt-5.1 等 8 个
    摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。

    本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。

    深度解读完整解读
  4. 分析与理论arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击

    发表
    测试
    gpt-5.6-terra、openai/gpt-5.1-codex-max、deepseek-v4-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  5. 分析与理论arXiv 2605.17173

    研究提出 IRT 框架拆解大模型跨语言安全护栏退化

    提出多组 IRT 框架拆解跨语言安全护栏退化原因

    发表
    测试
    gpt-4.1-mini、gpt-4o-mini、gpt-4.1-nano 等 15 个
    摘要多组 IRT 把多语安全失败拆成能力、语言难度和题目特异差距,并在闭源配置上估计这些因子。

    Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。

    深度解读完整解读
  6. 分析与理论arXiv 2609.38107

    研究:iGSM 基准显示正确答案常伴随无效思维链

    检查正确答案对应的思维链是否构成合法推导

    发表
    测试
    124M-parameter GPT-2-style models(12-layer, hidden size 768, rotary embeddings)
    摘要iGSM 上答案正确、轨迹合法与极简性可以分开,分布偏移下差距变大。

    iGSM 上的程序可检查实验:正确答案并不保证思维链是合法推导。。作者针对一个被用于监测和解读的假设:发出的轨迹忠实于、或至少可靠相关于模型如何得到答案。

    深度解读完整解读
  7. 10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产、重分发与下游应用留存机制

    发表
    测试
    Phi、GPT-OSS、Qwen 等 10 个

    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    深度解读完整解读
  8. 分析与理论arXiv 2609.12841

    Trace2ATT&CK:基于图的 eBPF 内核遥测到 MITRE ATT&CK 映射方法

    提出 Trace2ATT&CK,用溯源图把内核遥测映射到 ATT&CK

    发表
    测试
    gpt-oss-20b、gpt-oss-120b、gemma-4-31b-it 等 8 个
    摘要Trace2ATT&CK 把 eBPF 溯源命令图交给本地 LLM/RAG,在 Atomic Red Team 上映射 ATT&CK。

    Trace2ATT&CK 是一条从 Linux 内核遥测到 MITRE ATT&CK 排序候选的端到端流水线,面向已经划定的攻击窗口,而不是异常检测或 CTI 报告。

    深度解读完整解读
  9. 分析与理论arXiv 2609.27263

    GitHub Agentic Workflows 的智能体工作流规范与维护实证研究

    实证分析 gh-aw Markdown 的结构、维护与指令防护

    发表
    测试
    gpt-oss、Gemini 3.1 Pro、GLM-5.2
    摘要gh-aw 指令又长又常改,任务和约束很常见,显式注入防护很少,LLM 标注与人工标签大体一致。

    这是一项对 GitHub Agentic Workflows Markdown 的仓库挖掘,目标是描述开发者如何规定并维护会反复执行的智能体工作。

    深度解读完整解读
  10. 分析与理论arXiv 2609.31857

    LLM Judge 验证在稀疏重叠下的问题:从推理到设计

    分析稀疏重叠下 LLM judge 与人类一致性的验证误差并规划重叠分配

    发表
    测试
    GPT-4o-mini、GPT-5.4、GPT-5.2 等 10 个
    摘要稀疏重叠主导 judge 验证的错误决策。

    这篇工作研究标注重叠很稀时,怎样验证 LLM judge 是否足以替代人类,并规划重叠该留多少、怎么分配。。部署前的标准做法是在校准集上比较 judge 与人类的一致性。

    深度解读完整解读
  11. 分析与理论arXiv 2609.38324

    研究:多智能体讨论中异议被压制时收益下降

    用意见动力学模型解释多智能体讨论何时优于多数投票

    发表
    测试
    gpt-4o-mini、glm-flash、seed 等 9 个
    摘要讨论增益由压抑率相对 c∗=γ/(γ+a) 的裕度决定,关闭推理或减少压抑可增大该增益。

    作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。

    深度解读完整解读
  12. 分析与理论arXiv 2609.33989

    RewardExplainer:用反事实偏好反馈学习奖励模型解释

    提出 RewardExplainer,用反事实偏好反馈学习奖励模型解释

    发表
    测试
    GPT-4o、FsfairX-LLaMA3-RM-v0.1、Skywork-Reward-V2-Qwen3-1.7B 等 7 个
    摘要RewardExplainer 用双向反事实反馈训练 RM 解释器,并用以发现偏差、定向微调原 RM。

    RewardExplainer针对只输出标量的判别式奖励模型,训练一个可复用的自然语言机制解释器,并把解释接到偏差发现与 RM 微调上。

    深度解读完整解读
  13. 分析与理论arXiv 2609.23640

    人类对齐的模型是人类行为的模型吗?偏好对齐中的图灵测试差距

    形式化 Turing-test gap,并检验偏好对齐是否偏离人类行为

    发表
    测试
    DeBERTa-v3-large、Qwen2.5-7B-Instruct、Llama-3-8B-Instruct
    摘要偏好对齐不保证更像人。

    Yuan、Lin、Li 等人区分两种常被混称的“与人类对齐”:对齐人类偏好与对齐人类行为,并把二者的分布差异称为 Turing-test gap。

    深度解读完整解读
  14. 分析与理论arXiv 2609.16927

    SALVE:用文本优化还原蒸馏数据中的隐性学习效应

    提出 SALVE,用文本优化检测蒸馏数据中的潜意识学习效应

    发表
    测试
    GPT-5.4-mini、Qwen2.5-7B-Instruct、OLMo-3-7B-Instruct 等 8 个
    摘要SALVE 用软提示加 beam search 口头化,把潜意识数据里的教师特质恢复成可读提示。

    SALVE 是一种文本优化方法,用来在训练学生之前,把潜意识学习数据里读不出来的教师特质说成可读系统提示。

    深度解读完整解读
  15. 分析与理论arXiv 2608.27340

    研究:评测感知分能力与安全两种框架,能力框架更易预测合规

    把口头评测感知分成能力与安全框架并检验对服从的预测

    发表
    测试
    GPT-5-mini、Qwen3-32B、OLMo-3-32B-Think
    摘要能力型与安全型口头 eval-awareness 对服从的符号相反,聚合抑制率因此不能代表安全相关成分。

    作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。

    深度解读完整解读