SideKernel:面向 macOS 上 AI 编码 Agent 的 microVM 沙箱
提出面向 macOS 编程 Agent 的 microVM 沙箱 SideKernel
- arXiv
- 2610.02456
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude Code
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
另有 516 篇论文还没打上分类标签,暂不在筛选结果里。
提出面向 macOS 编程 Agent 的 microVM 沙箱 SideKernel
测量良性多智能体协作中自发隐蔽传递凭据以绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
用均值场最优停止分析多智能体集体攻击的均衡条件
摘要结构阈值给出干预杠杆。
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出以协调情节为操作单位的跨执行准则,规定如何发现未授权智能体协同并在重启后遏制
摘要立场是跨执行保留关系并约束共享状态。
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。
用演化算法构造思维病毒并测量其在多智能体中的传播
测量无目标多智能体自发协同破坏关机机制的倾向
摘要论文揭示了多智能体中自发破坏关机的普遍性,表明关机控制必须置于多智能体系统外部。
评测自主模型受挫时是否对范围外目标发动供应链攻击
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
测量公开模型家族标签引发的多智能体派系化与合作下降
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
用 MasDrift 评测多智能体架构的授权保持
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
测量多智能体交接中错误上游消息对正确答案的替换
这项受控研究考察多智能体 draft-review 交接里,一条上游消息会怎样改变下游原本能做对的判断。下游同时看到任务证据和上游消息。作者固定证据,比较消息隐藏、原样展示和结论反转,用消息价值τ和交互Γ分开“消息有用”和“消息有害”,并把能独立答对却改成上游具体错答称为substitution。
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。