跳到正文

隐私与数据泄露 · 精选

10月9日 · 周五

隐私与数据泄露 · 精选

今天还没有新的精选
10月8日周四
  1. Scale AI Research BlogScale AI Research Blog · 50

    Scale AI 企业红队实测多轮攻击违规率

    Scale AI 公布其企业 AI 红队方法与实践数据,指出只测模型会漏掉系统层风险。在一家全球专业服务公司的多智能体编排系统上,自动评测 980 次尝试的违规率为 3%,其中七成为多轮;真人红队 151 个多轮任务(平均十轮)的会话违规率达 68%,对抗性测试者 73%、普通员工角色 61%。经四轮测试与修复,违规率降至 20% 再到 14%,攻破所需轮次中位数从七轮升至十六轮。在消费房贷短信助手上,161 段多轮对话中 115 段违规。

10月1日周四
  1. AWS Security · 45

    AWS 用 Strands Agents SDK 把 Bedrock Guardrails 扩展到工具交互

    AWS 发布实践指南,用 Strands Agents SDK 的生命周期钩子把 Amazon Bedrock Guardrails 从模型边界扩展到工具边界,在三个信任边界设置校验检查点。Checkpoint 1 用 BeforeInvocationEvent 在模型推理或工具执行前校验用户输入、其他 Agent 数据、MCP 工具服务器和 RAG 管道内容;Checkpoint 2 用 BeforeToolCallEvent 在工具执行前检查模型即将传入的参数,这是模型级护栏覆盖不到的缺口;Checkpoint 3 用 AfterToolCallEvent 在结果返回用户或下游系统前校验工具输出,尤其针对抓取外部网页的搜索工具。

已经到底了