论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
- arXiv
- 2610.04504
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-chat、Meta Llama 3.1 8B、Kimi
另有 643 篇论文还没打上分类标签,暂不在筛选结果里。
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉
SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 SteerDuplex,用监督微调与两阶段强化学习提升全双工语音对话可控性
SteerDuplex 是基于 Moshi 的全双工语音模型,目标是在保留轮替、打断和一般任务能力的同时,按用户指令改变内容与发声。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 VA-Judger,用人类偏好训练联合音视频奖励模型
VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略