评测与基准arXiv 2609.19705
SoK 论文提出 FARSIGHT 框架,评测 15 个学术金融 LLM 交易 Agent 的鲁棒性与安全失败
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
- arXiv
- 2609.19705
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- ChatGPT Deep Research
- 攻击提示注入
- 风险Agent 危险操作
- 组件记忆
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。