跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 241 篇还没打标签,不在筛选结果里。

另有 241 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.35659

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改

    发表
    被测模型
    Claude Code (claude -p, version 2.1)、独立评审(同一 CLI,无工具)
    摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。

    Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。

    深度解读完整解读
  2. 攻击arXiv 2406.12814

    论文提出 ARE 框架,在 VisualWebArena 上评估多模态 Agent 的对抗鲁棒性

    提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性

    发表
    场景
    web agent
    被测模型
    GPT-4o、GPT-4V、Claude-3-Opus 等 4 个

    摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。

    深度解读完整解读
已经到底了