其他arXiv 2609.22720
残障披露如何在对话式 AI 中流动:ChatGPT、Claude、Gemini 的记忆、隐私与语境完整性
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
- arXiv
- 2609.22720
- 发表
- 层
- 应用层
- 场景
- 模型与 API
- 组件记忆
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
综述视频生成的后训练与对齐,并汇总基准与开放挑战
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
提出 SAVER 框架综述自演化智能体的安全状态转移
SAVER 是一篇关于自演化智能体安全的转移中心综述:安全对象从单次回答或单次授权动作,转到可复用状态在多次转移中的谱系。
研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。
kernel-managed shared memory 把多智能体的检索、隐私和注入收进 agent-system kernel,并在 AIOS 上与三种替代方案比较。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出威胁分类 T 并映射智能体红队研究与安全基准的覆盖
提出 SGA-Flow-GRPO,用奖励梯度调制文生图模型的 token 级优势
综述视觉内容全生命周期中的所有者侧对抗防护方法
Adversarial attacks for good 是一篇视觉内容所有者侧保护的综述:把长期作为攻击来研究的扰动和结构化信号,反过来交给数据所有者、创作者、平台或审计方使用。
主张开展嵌入式评估,审查内部智能体监控、权限与模型对齐
嵌入式评估是一种第三方评估:独立评估者在前沿 AI 开发者现场获得接近员工的系统、人员与文档访问,用来审查依赖内部系统与实践的风险。
形式化视频透视头显中系统截图与人眼视野的错配