摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2609.02316
Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
- arXiv
- 2609.02316
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
- 评测与基准arXiv 2608.16824
GEO-Flag:检测与测量面向生成式引擎优化的网页内容
提出 GEOFlagBench 与 IPT,检测并测量生成式引擎优化网页
- arXiv
- 2608.16824
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- ModernBERT-base、Qwen3-0.6B、Gemini-3.5-flash 等 11 个
摘要GEOFlagBench 与 IPT 用于检测 GEO 页,并估计真实检索中的占比与引用可核验性。
GEO-Flag 把页面级 GEO 检测做成可评测任务,并在发布的检索结果上估计被判为 GEO 的页面占比。
- 攻击arXiv 2609.17817
论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
- arXiv
- 2609.17817
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
- 防御arXiv 2609.21088
Provenance-Aware Transformers:用来源感知架构分离可信边界以防御间接提示注入
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
- arXiv
- 2609.21088
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 防御arXiv 2609.35659
Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
- arXiv
- 2609.35659
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 防御监控与审计
- 攻击提示注入
- 风险Agent 危险操作
- 组件监控器
摘要Tracekit 把意图、自述和动作写入可锚定的哈希链。
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
已经到底了