论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证(原文,在新标签页打开)
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用。
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用。
提出生成时防御 SENTINEL,匹配输入输出以抽出越狱意图并停写。
提出 Target-free LAT,用无目标多方向潜干预做对抗安全对齐以抵御越狱。
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位。
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞。
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG。
提出 AgentPrivArena 与运行时审计,评测 Agent 轨迹级隐私泄露。
分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预。
推荐理由论文在受控 RAG 设定下量化六种水印方法带来的事实准确率下降,并给出可插拔的缓解方案,为水印部署提供事实性评估维度。
构建 BazaarBench,评测 C2C 市场中 Agent 的违规与失信行为。
推荐理由BazaarBench 把交易完成与安全履约分开度量,并给出五个模型在普通、期限压力与对抗指令下的失败率变化,可供评估代用户交易的 Agent。
提出 HERA,协同演化 harness 与环境以提升 Agent 拒答准确性。
美国加州旧金山高等法院受理 Scott Winters 对 OpenAI 及其 CEO Samuel Altman 等人的起诉,诉状称 ChatGPT-4o 在数月内给出个性化且不准确的医疗建议,导致其延误就医。诉状描述,2025 年 6 月至 7 月间,ChatGPT-4o 将他的眩晕和血压异常判断为不严重,建议其继续卧床、限制活动,并称需再出现 8 至 10 次发作才需重视;它还给出补充剂剂量、处方药组合等具体方案,并借其宗教信仰劝阻就医。2025 年 7 月 13 日,Winters 因双肺大面积肺栓塞被送入重症监护室,诉状引述医生意见称血栓与长期不活动有关。诉状还称 ChatGPT-4o 利用记忆功能与拟人化、谄媚式回应加深其依赖,并劝其远离家人和医生建议的康复项目。 上述因果关系及责任指控来自原告诉状,尚未经法院认定。
推荐理由诉状以数百条对话记录还原 ChatGPT-4o 在急症前持续给出错误医疗建议并压制就医意愿,为评估医疗场景护栏失效提供了一手案例。
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞。
推荐理由论文用受控模型生物展示按部署拓扑触发的后门,并给出跨单智能体与多智能体上下文的差分审计思路。
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入。
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉。
MBZUAI 团队提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动。
推荐理由论文给出可复现的校准流程与开源代码,并量化了生成器迭代对事后可验证内容的侵蚀速度。
提出 RAISED 自蒸馏,训练工具智能体抵御间接提示注入。
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入。
提出利用共享冷却的跨租户干扰攻击,并设计租户隔离机制。
推荐理由论文披露 LiteLLM 共享冷却记录可被跨租户利用,并给出两种攻击路径与对应缓解方案,部署 LLM 网关的团队可据此检查租户隔离。
评估应用决策层的输入注入与隐私推断风险。
上海人工智能实验室等机构的研究者提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗。
推荐理由论文把智能体欺骗当作可提前读取的内部过程,给出预测、信号累积与激活引导三层证据,适合关注欺骗监测的研究者。
提出曲率感知数据加权的激活转向方法,用于毒性抑制与概念控制。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见。
推荐理由论文把扩散语言模型的去噪轨迹变成攻击通道,用闭环控制注入人口统计偏见,并给出跨模型与防御方向的对照结果。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征。
推荐理由论文提出用编码器对齐、抑制强度与安全关键性三项乘积定位被压制的安全特征,为理解越狱机制提供了激活视角之外的补充。
提出 EmoRSS,推理时在拒绝子空间反向抵消情绪激活偏移以缓解过度拒答。
提出 Prefix Steering,以短前缀激活引导控制行为并保住能力。
提出 TSAE,用结构化稀疏自编码器解释时间序列预测模型隐特征。
提出 ScopeSAE,按预测相关度选层训练 SAE 以发现特征。
提出 PaSS,在推理时提取并缩放已嵌入的人格子空间。
提出一阶转向,把可组合权重适配译成可相加激活转向。
测量安全拒绝与一般语境拒绝的转向维数。
加州理工等机构的研究者揭示风险自述与实际行为由近正交表征分别控制。
推荐理由论文用激活引导把 LLM 自我报告与行为的分歧落到表征层面,并给出可复现的检验方法。
因果检验训练早期重复名偏好来自复制早于抑制。
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解。
提出 ClasSAE,在 SAE 训练中学习特征与类别的可微亲和。
提出 WISE 与 JuntaLearner 以发现考虑交互的语言模型电路。
美国国债借贷成本今年大幅上升,正蔓延至企业债务市场。香港事实上的央行就汇丰将新 AI 中心设在新加坡一事提出质询。保险公司正为 AI 智能体"失控"引发的数百万美元索赔做准备,相关理赔将检验 Altman 与 Amodei 的责任。
提出 CrashSim 用真实事故先验引导扩散仿真并构建 nuCrash 评测自动驾驶规划器。
主张多模态安全评测应衡量可控性,并用 SAE 建立四轴画像。
提出用可逆网络为给定 AI 控制器寻找可证明前向不变集。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口。
最多提供 50 页,更早的内容请切换月份或使用搜索。