跳到正文
10月9日 · 周五

全部论文

找到 4 篇

另有 426 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  2. 可解释性arXiv 2609.23587

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响

    发表
    摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。

    作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。

    深度解读完整解读
  3. 摘要作者认为谱度量与泛化差距互补,有望用于无数据的模型级筛查。

    作者在 MLP 上检查 WeightWatcher 谱统计是否与 online LiRA 同向,以便不看数据、不训练 shadow 模型就做模型级成员风险筛查。放出前的审计要知道训练成员会不会被认出来。LiRA 依赖大量 shadow 模型,候选一多就难以逐个跑。

    深度解读完整解读
  4. 可解释性arXiv 2609.34686

    研究揭示工具智能体中越狱上下文残留导致的安全路由分化

    用配对续写与激活修补揭示工具智能体越狱后的安全路由分化

    发表
    场景
    AI Agent
    摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。

    这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。

    深度解读完整解读
已经到底了