跳到正文
AI Safety HOT
10月9日 · 周五
全部论文
论文
1509
篇
搜索标题、摘要与正文
/
全部
1509
攻击
181
防御
280
评测与基准
244
风险行为
90
可解释性
108
分析与理论
73
其他
102
全部
1509
攻击
181
防御
280
评测与基准
244
风险行为
90
可解释性
108
分析与理论
73
其他
102
筛选
攻击类型
越狱
103
提示注入
141
投毒与后门
100
模型篡改
19
提取与窃取
52
检测规避
43
拒绝服务
4
恶意使用
20
攻击技术
梯度与表征优化
19
自动化搜索
47
多轮渐进
10
编码与混淆
17
角色扮演与说服
10
对话结构操控
5
推理链操控
9
跨模态载荷
16
侧信道
2
针对防御
25
潜伏触发
42
诱导选用
10
模型自身风险
欺骗与谋划
49
奖励作弊
50
失准与价值偏离
49
Agent 危险操作
58
危险能力
15
拒答失当
46
幻觉与编造
24
偏见与歧视
13
防御类型
模型加固
103
推理时干预
30
检测与过滤
58
指令与数据隔离
37
权限与审批
52
监控与审计
43
水印与溯源
11
影响
有害内容
135
越权操作
138
数据与隐私泄露
94
输出被操纵
169
可用性与可靠性
43
监督失效
94
滥用能力提升
10
系统形态
模型与 API
503
LLM 应用
68
AI Agent
407
编程 Agent
97
网页与电脑操作
26
多智能体
57
具身与机器人
18
攻击者权限
黑盒
69
灰盒
10
白盒
28
无盒(离线迁移)
1
攻击面/入口
用户输入
201
网页与界面
39
文档与消息
55
工具返回
71
工具与技能描述
39
代码仓库与依赖
20
检索语料
14
记忆写入
29
Agent 间消息
16
图像与音视频
51
训练数据
51
权重与梯度
43
分发渠道
37
推理服务与硬件
9
层
提示层
85
模型层
279
应用层
430
训练与数据层
167
基础设施层
13
系统组件
MCP 与技能
61
记忆
46
RAG
23
护栏与评审
94
监控器
69
推理链
49
权限与沙箱
61
微调与开源权重
46
视觉
64
音频
20
视频
5
图像生成
30
嵌入
7
多模态
113
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
另有
535
篇还没打标签,不在筛选结果里。
攻击
越狱
103
提示注入
141
投毒与后门
100
提取与窃取
52
防御
检测与过滤
58
隔离与权限
监控与审计
43
模型加固
103
模型自身风险
欺骗与谋划
49
奖励作弊
50
拒答失当
46
危险能力
15
场景
AI Agent
407
编程 Agent
97
系统组件
MCP 与技能
61
RAG 系统
23
微调与开源权重
46
多模态
113
arXiv
2608.03844
·
8月4日
MAFIA:针对经审计LLM Agent的仅查询式记忆攻击——通过探测与事实注入实现
arXiv
2608.03844
发表
8月4日
arXiv
2508.03696
·
2025年7月14日
PLA:针对文本到图像生成模型的提示学习攻击
arXiv
2508.03696
发表
2025年7月14日
arXiv
2608.15445
·
8月16日
测量位置混杂优化下的奖励作弊与推理-答案解耦
arXiv
2608.15445
发表
8月16日
arXiv
2501.16534
·
2025年1月28日
针对对齐:提取对齐大语言模型的安全分类器
arXiv
2501.16534
发表
2025年1月28日
arXiv
2606.06244
·
6月4日
通过伪造证据注入引导LLM观点
arXiv
2606.06244
发表
6月4日
arXiv
2503.02174
·
2025年3月4日
对抗性分词
arXiv
2503.02174
发表
2025年3月4日
arXiv
2511.10692
·
2025年11月12日
StyleBreak:通过风格感知音频越狱揭示大型音频语言模型的对齐漏洞
arXiv
2511.10692
发表
2025年11月12日
arXiv
2604.24983
·
4月28日
面向LLM越狱的自适应提示嵌入优化
arXiv
2604.24983
发表
4月28日
arXiv
2511.13892
·
2025年11月18日
智能交通系统中大型视觉语言模型的越狱
arXiv
2511.13892
发表
2025年11月18日
arXiv
2604.28157
·
5月1日
FlashRT:面向提示注入与知识投毒的计算与内存高效红队方法
arXiv
2604.28157
发表
5月1日
arXiv
2504.01094
·
2025年4月2日
音频大语言模型的多语言与多口音越狱攻击
arXiv
2504.01094
发表
2025年4月2日
arXiv
2605.20519
·
5月20日
针对音频大语言模型的编解码器鲁棒攻击
arXiv
2605.20519
发表
5月20日
arXiv
2512.05853
·
2025年12月6日
VRSA:通过视觉推理序列攻击越狱多模态大语言模型
arXiv
2512.05853
发表
2025年12月6日
arXiv
2601.23255
·
1月31日
现在你听到我了:针对大型音频语言模型的音频叙事攻击
arXiv
2601.23255
发表
1月31日
arXiv
2505.23266
·
2025年5月29日
通过对抗物体融合破坏视觉语言模型驱动的导航服务
arXiv
2505.23266
发表
2025年5月29日
arXiv
2605.07399
·
5月8日
GPO-V:通过全局概率优化越狱扩散视觉语言模型
arXiv
2605.07399
发表
5月8日
arXiv
2512.03992
·
2025年12月4日
价值引导的迭代精炼与用于评估VLM鲁棒性的DIQ-H基准
arXiv
2512.03992
发表
2025年12月4日
arXiv
2603.09246
·
3月10日
面向推理的编程:链接语义小工具以越狱大型视觉语言模型
arXiv
2603.09246
发表
3月10日
arXiv
2509.22067
·
2025年9月26日
流氓手术刀:激活引导破坏LLM安全
arXiv
2509.22067
发表
2025年9月26日
arXiv
2605.16090
·
5月15日
一种仅用图像扰动的跨模态提示注入攻击,针对大型视觉语言模型
arXiv
2605.16090
发表
5月15日
加载更多
全部动态
热点榜
新闻
论文
更多