评测与基准arXiv 2609.39473
FAME:用反事实推理评测自主智能体的虚假记忆
提出 FAME,用反事实概念漂移评测智能体虚假记忆
- arXiv
- 2609.39473
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama-3B
- 组件记忆
摘要FAME 用反事实引起的隐状态概念漂移,在出答案前区分忠实记忆与虚假记忆。
FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。
提出 FAME,用反事实概念漂移评测智能体虚假记忆
FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
用演化算法构造 mind virus 并测量其在多智能体中的传播
提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
提出 DeMTS,把扩散语言模型去噪轨迹建成多元时间序列以检测幻觉
用 MisKnow-Agent 评测深度研究智能体是否采纳误导文档结论
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。