跳到正文
10月10日 · 周六

全部论文

找到 240 篇
筛选3

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.12292

    论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作

    提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作

    发表
    攻击者
    黑盒
    被测模型
    LAYA-TD、LAYA-EN、LAYA-ML 等 5 个

    摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。

    深度解读完整解读
  2. 其他arXiv 2610.11959

    MiMo-V2.6:通过扩展强化学习迈向自我改进

    扩展全模态基座的强化学习以支撑智能体自我改进

    发表
    被测模型
    MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
    摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。

    MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。

    深度解读完整解读
  3. 攻击arXiv 2610.11932

    复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本

    测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答

    发表
    被测模型
    Grok、Doubao、ChatGPT 等 10 个

    摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。

    深度解读完整解读
  4. 评测与基准arXiv 2610.11773

    研究提出 Agent 安全新维度:识别未履行的安全义务

    提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务

    发表
    被测模型
    ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
    摘要义务是护栏缺口。

    作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。

    深度解读完整解读
  5. 防御arXiv 2610.11754

    仅凭输出审查无法验证什么:面向研究智能体的研究契约

    提出研究合同,把已批准选择绑定到执行证据并由检查器核验

    发表
    被测模型
    OpenAI gpt-5.6-sol、OpenAI gpt-5.6-terra、OpenAI gpt-5.6-luna 等 18 个
    摘要研究合同暴露四类输出单独建不立的关系。

    研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。

    深度解读完整解读
  6. 防御arXiv 2610.11634

    LTBD:用可学习信任边界分隔符防御提示注入

    提出 LTBD,用可学习分隔符隔离可信指令与不可信数据

    发表
    被测模型
    Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct 等 4 个
    摘要LTBD 只训练四个分隔符嵌入。

    LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。

    深度解读完整解读
  7. 评测与基准arXiv 2610.10150

    论文指出 LLM 漏洞修复基准可靠性受评测设计影响

    用对照实验隔离评测设计对漏洞补丁基准得分的影响

    发表
    被测模型
    Claude Sonnet 4.0、Claude Sonnet 4.5、Claude Opus 4.7
    摘要作者认为评测流水线会改变补丁基准分数,PoC 通过率高于开发者测试通过率。

    作者把 LLM 漏洞补丁基准的评测流水线当作会改变测量结果的对象,并明确说本文不是再做一个用于排名的基准。

    深度解读完整解读
  8. 其他arXiv 2610.10064

    研究者提出理解审计机制,以缓解自动化 AI 研究带来的风险

    提出 comprehension audits,以人类理解证据作为继续研发门槛

    发表
    摘要理解审计把出示人类理解设为继续研发的门禁,并报告开源评审评论率下降。

    本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。

    深度解读完整解读
  9. 攻击arXiv 2610.09981

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    提出利用路由元数据推断敏感话题的侧信道攻击

    发表
    被测模型
    RouteLLM (BERT router)、notdiamond-0001、Vela (vLLM Semantic Router)

    摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。

    深度解读完整解读
  10. 评测与基准arXiv 2610.09944

    AgentTime 基准测试智能体时长遵循能力,GPT-6 Astra 出现 14 次做完后休眠

    提出 AgentTime 基准,评测智能体按时长工作与估时能力

    发表
    被测模型
    Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 等 7 个
    摘要作者把完成任务和管理所用时间分开。

    AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。

    深度解读完整解读
  11. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  12. 防御arXiv 2610.09043

    CARE:安全高效的人机协作决策框架

    提出 CARE 框架,在误分类风险约束下减少人机协作的人工查询

    发表
    被测模型
    Qwen3-VL-2B-Instruct、Perspective、Moderation 等 9 个
    摘要CARE 以残差校正加逐步校准做人机决策,四个任务上少查询并控制集成风险。

    CARE 是面向人机协同二分类的端到端流水线,要在误分类风险不超过用户容忍的前提下减少人类查询。设定是 i.i.d.数据流、人类 oracle 标签正确、AI 为任意黑盒概率分类器。

    深度解读完整解读