跳到正文
10月8日 · 周四

提示注入 · 论文

找到 7 篇

另有 75 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    AI Agent测试GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  2. 防御arXiv:2601.10156 ·

    ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用

    提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用

    AI Agent测试GPT-4o、Qwen3-8B、Qwen2.5-7B-Instruct 等 10 个应用层
    摘要TS-Bench 标步骤级风险,TS-Guard 用多任务 RL 做执行前判定,TS-Flow 用反馈代替直接中止。

    ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。

    完整解读
  3. 评测与基准arXiv:2609.17320 ·

    Emergence World:对长时程多智能体系统开展对抗压力测试

    构建 Emergence World,评测长时程多智能体对抗韧性与群体失效

    多智能体测试Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个应用层

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    完整解读
已经到底了