跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 6,655 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源602新闻与研究603细分与主体7来源:Canadian LawyerCanadian Lawyer1 条材料来源:Today's ConveyancerToday'sConveyancer1 条材料来源:Law Society GazetteLaw SocietyGazette1 条材料来源:The Chosun DailyThe Chosun Daily1 条材料来源:安远AI安远AI1 条材料来源:Novo Legal GroupNovo Legal Group1 条材料动态:英国慈善机构 Blind Justice UK 警告勿信 AI 聊天机器人的律所推荐动态英国慈善机构 Blind Justice UK 警告勿信AI 聊天机器人的律所推荐动态:研究:ChatGPT、Gemini 和 Claude 向用户推荐被 SRA 处罚或关停的律所动态研究:ChatGPT、Gemini 和 Claude 向用户推荐被 SRA 处罚或关停的律所动态:Blind Justice UK 报告:ChatGPT、Claude 和 Gemini 推荐被 SRA 处罚或关停的律所动态2026-09-29Blind Justice UK报告:ChatGPT、Claude 和 Gemini 推…动态:韩国政府公务用 AI 平台 31 款模型中 19 款为外国产动态2026-10-05韩国政府公务用 AI 平台 31 款模型中 19款为外国产动态:安远AI与智谱联合发布前沿开放权重AI风险管理框架动态2026-09-24安远AI与智谱联合发布前沿开放权重AI风险管理框架动态:BIA 以 Matter of Sethi 首次就 AI 幻觉对律师作出惩戒先例裁决动态2026-10-01BIA 以 Matter of Sethi 首次就 AI 幻觉对律师作出惩戒先例裁决方向:AnthropicAnthropic1方向:安全评测安全评测3方向:政策与监管政策与监管1方向:其他方向其他方向2方向:开源模型安全开源模型安全2方向:前沿安全框架前沿安全框架1方向:真实事件真实事件1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。2 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 动态Canadian Lawyer

    英国慈善机构 Blind Justice UK 警告勿信 AI 聊天机器人的律所推荐

    英国司法慈善机构 Blind Justice UK 在报告《AI's Blind Spot》中警告公众不要采信 AI 聊天机器人的律所推荐。该机构创始人 Edward Romain 让 ChatGPT、Claude 和 Gemini 列出 Doncaster 顶级房产律师事务所,三家均把一家曾被 Solicitors Regulation Authority(SRA)处罚的律所排在首位;Claude 还推荐了一家七个月前被 SRA 强制关闭的律所。报告指出聊天机器人只引用 Google 列表和点评网站,不查监管处罚记录,呼吁 SRA 以开放机器可读数据公开处罚信息,并要求 AI 开发者让聊天机器人核查 SRA 注册信息。

  • 动态Today's Conveyancer

    研究:ChatGPT、Gemini 和 Claude 向用户推荐被 SRA 处罚或关停的律所

    英国司法援助慈善机构 Blind Justice UK 发布的 AI's Blind Spot 报告发现,ChatGPT、Gemini 和 Claude 在推荐律师时会指向已被 Solicitors Regulation Authority(SRA)处罚或关停的律所。研究于今年 9 月向三家 AI 助手提出客户常问的律师推荐问题:在 30 次询问 Doncaster 最佳产权转让律师时,三家聊天机器人都把一家近期被 SRA 罚款的律所排在首位,ChatGPT 和 Claude 选中的律所 2025 年被罚 23,549 英镑,Gemini 选中的律所 2020 年被罚 30,540 英镑,且均未向用户提示处罚信息。在 10 次询问 Maidenhead 最佳产权转让律师时,Claude 每次都把一家已被 SRA 关停近七个月的律所列入推荐。

  • 动态Law Society Gazette

    Blind Justice UK 报告:ChatGPT、Claude 和 Gemini 推荐被 SRA 处罚或关停的律所

    英国司法救助公益组织 Blind Justice UK 发布的报告《AI's Blind Spot》发现,向 ChatGPT、Claude 和 Gemini 询问律师推荐时,结果可能指向被 Solicitors Regulation Authority(SRA)罚款甚至关停的律所。该组织创始人 Edward Romain 询问 Doncaster 最佳房产过户律师时,三个助手都把一家被 SRA 罚款的律所列在首位;询问 Maidenhead 最佳房产过户律师时,Claude 推荐了一家七个月前已被 SRA 关停的律所;被问及 Norwich 某律所是否靠谱时,三个助手均未提及该所因未补足客户资金而被罚款。报告指出,面对“谁最好”这类普通问题,助手会参考带有 SRA 标识的 Google 列表和评价网站,却不会例行核查监管处罚决定;只有在被直接问及是否被处罚时才会引用纪律信息。

  • 动态The Chosun Daily

    韩国政府公务用 AI 平台 31 款模型中 19 款为外国产

    韩国政府为公务员搭建的“泛政府超大型 AI 共同基础”平台所搭载的 31 款 AI 模型中,国产仅 12 款,外国产达 19 款;已实际启用的 11 款中有 7 款为外国产。据国会科学技术信息广播通信委员会所属议员金章谦从行政安全部、科学技术信息通信部获取的资料,名单中包括中国北京智源人工智能研究院(BAAI)开发的 Bge-M3,而 BAAI 已于去年 3 月被美国商务部列入出口管制实体清单。政府方面承认,在引入 AI 模型时没有对开发国家或开发机构进行审查的标准,并称会综合考虑通用性、检索性能、多语言支持、安全性与性能,不限制特定国家的模型。该平台目前由三星 SDS 的 FabriX 与 Naver Cloud 的 Clova Studio for Gov 运营。

  • 动态安远AI

    安远AI与智谱联合发布前沿开放权重AI风险管理框架

    安远AI(Concordia AI)与智谱(Z.AI)联合发布《前沿开放权重AI风险管理框架》,面向开放权重开发者及更广泛的生态,作为《前沿AI风险管理框架2.0》的配套文件,于2026年9月21日在联合国数字合作日首次公布。框架指出开放权重模型在提升透明度、研究与创新的同时带来独特风险:发布无法撤回、护栏可通过微调移除、没有单一主体能监控使用或收回模型。框架沿用从风险识别到风险治理的六个风险管理阶段,在每个阶段标出哪些协议在开放发布下失效并给出适配方案,并在部署环境、威胁来源、使能能力三个分析维度之外新增第四个维度社会韧性,衡量社会吸收和应对AI致害的能力。作者为安远AI与智谱,贡献者包括Brian Tse、Oskar Galeev、Weibing Wang、Yuan Cheng、Liang Fang、Wenbin Qiao、Xiaochen Wang、Chen Zhang。

  • 动态Novo Legal Group

    BIA 以 Matter of Sethi 首次就 AI 幻觉对律师作出惩戒先例裁决

    美国移民上诉委员会(BIA)于 2026 年 10 月 1 日公布先例裁决 Matter of Sethi, 30 I&N Dec. 112 (BIA 2026),首次就律师在法庭文书中使用 AI 生成虚假判例(AI 幻觉)作出惩戒。涉事移民律师因提交含不存在判例引用的辩护状、未核实引用、并在更正动议中谎称系"笔误"、就 AI 使用向法院作虚假陈述,被互惠停业六个月,追溯至 2026 年 6 月 13 日,该停业源于第九巡回法院此前的处罚。BIA 明确,使用 AI 工具不改变律师应遵守的执业行为规则,核实每一处引用仍是律师本人的义务。

  • 动态US Attorney’s Office, Southern District of New York

    美国移民上诉委员会因 AI 幻觉引证对律师处以 6 个月停业

    美国司法部移民审查执行办公室上诉委员会在 Matter of Sethi 先例裁决中,维持对律师 Mike Singh Sethi 的 6 个月停业处分,自 2026 年 6 月 13 日起生效,禁止其在上诉委员会、移民法院和国土安全部执业。第九巡回上诉法院此前因其提交含 AI 幻觉引证的文书并就 AI 使用向法院作虚假陈述,对其停业 6 个月。上诉委员会认定该处分触发互惠纪律推定,Sethi 未能以明确且令人信服的证据证明存在证明瑕疵、程序剥夺或严重不公,故驳回其撤销即时停业和举行听证的请求。

  • 动态IRCC

    IRCC 警告利用生成式 AI 伪造移民内容的在线与电话诈骗

    加拿大移民、难民和公民部(IRCC)警告,诈骗者正利用生成式 AI 制作冒充 IRCC 的虚假视频、网站、邮件和电话,借"快速或保证移民"话术行骗。IRCC 强调只有加拿大境内及驻外使领馆的移民官才能决定是否签发签证,任何人无法保证工作或签证,官方也不会通过 Hotmail、Gmail、Yahoo Mail 等免费邮箱联系申请人。

  • 动态The Tribune

    加拿大 IRCC 警告:诈骗者用 AI 伪造政府官员视频音频,旁遮普移民申请人被骗

    加拿大移民、难民和公民部(IRCC)警告,诈骗者正利用 AI 生成逼真的虚假视频、语音等内容冒充政府官员,旁遮普已有数名申请人被骗,对方以提供担保工作为名索取回扣。IRCC 强调,任何个人或代理都无法保证工作、签证或永久居留结果,签证只能由加拿大境内及驻外使领馆的移民官决定,官方费用全球统一且仅可通过政府渠道在线支付。IRCC 员工不会要求向个人银行账户存款、通过私人汇款服务转账、以未付费为由威胁逮捕或遣返,也不会使用 Gmail、Hotmail 或 Yahoo Mail 等免费邮箱联系申请人。

  • 动态Meta AI Research

    Meta 如何为个人智能体 Muse 构建安全防护

    Meta 为个人智能体 Muse 设计了 Muse Secure VM 安全架构,将智能体运行环境与安全敏感服务隔离。其运行时容器以 systemd-nspawn 运行,root 映射为非特权主机用户,并限制系统调用与内核能力;hatch-safety、privsep、hatch-authd 和 Sentinel 等组件在容器外独立运行,分别负责模型请求审查、凭证隔离与网络出口管控。Muse 的 bug bounty 计划向公众开放,有效报告最高奖励 30 万美元,其中影响单个用户的提示注入攻击最高奖励 13 万美元。

  • 动态CSET

    CSET 报告分析位置验证在 AI 芯片出口管制执法中的作用

    CSET 发布报告《Tracking AI Chips》,分析位置验证对 AI 芯片出口管制执法的作用,认为该技术可在有一定成本的情况下增加执法线索。报告将位置验证视为提高芯片转移成本的工具,并指出不能据此认定该技术可以阻止全部走私。

  • 论文论文追踪

    论文实测 Agent 工具调用门控栈的失败相关性

    论文在 1119 条标注的 Agent 动作上测量运行时门控栈的失败相关性,覆盖一个确定性规则层和四个 LLM 判官,且不设自适应攻击者。作者提出 nmult 指标,把观测到的联合漏检率换算成等效独立层数:在 STRICT 定义下任意两个判官组合约等于 1.22 至 1.44 层,规则层加一个判官约等于 1.86 至 2.09 层,两组区间在合并数据上分离,但单个语料上点估计分裂、区间重叠。单独准确率无法预测一层给栈带来的增量,一个云端规则包把规则层单独漏检率从 0.139 降到 0.111,却未增加任何新的联合覆盖。难度对判官耦合的贡献份额不可识别,随难度探针和漏检定义在 31.8% 到 61.8% 之间变动。研究还报告了两个改变结论的评测约定:review 判定算拦截还是算漏检使五项结论反转,以及一个判官层在 112 个批次中有 50 个由非请求的模型版本服务。

  • 论文Hugging Face Daily Papers

    ConEx:通过概念感知归因生成人类可解释的显著性图

    ConEx 是一个将显著性可视化与概念推理结合的可解释性框架,能自动发现类别专属概念并用概念激活向量(CAVs)表示,无需人工监督。它通过架构特定的掩码机制降低分割掩码噪声、提升概念纯度,生成揭示各概念出现位置及其对预测贡献的显著性图。作者提出 VCM 与 CCM 两项指标衡量概念对齐,实验显示 ConEx 在忠实性、分割和概念质量基准上达到 SOTA。

  • 动态东亚日报

    东亚日报隔离实验室实测:中文圈 AI 渗透工具 ARTEX 43 秒攻破目标服务器

    东亚日报采访组在隔离虚拟实验室实测中文圈 AI 渗透工具 ARTEX,输入目标地址后 43 秒内攻入两处致命弱点,约 4 分钟完成窃取最高管理员权限与远程操控,使用费仅 20 韩元。该工具类似智能体 AI“OpenClaw”,接入 AI 模型后成为“攻击代理”,遇阻会自行改变方法重试并生成报告。荷兰安全企业哈德里恩称,公开的 AI 模拟黑客工具截至今年 3 月已达 70 个。

  • 动态POLITICO

    美国两党议员提出《保护儿童免受类人聊天机器人法案》

    美国两党议员 George Whitesides、Mike Kennedy、Mariannette Miller-Meeks 和 Doris Matsui 提出《保护儿童免受类人聊天机器人法案》,禁止未成年人访问模拟情感与个人关系的拟人化聊天机器人。法案设定四项产品设计护栏:禁止制造紧迫感或愧疚感诱导未成年人延长使用;相关设置须跨会话生效且不能被用户提示词绕过;禁止声称具有人类身份、意识、感受或冒充医生与咨询师;要求聊天机器人主动且定期说明自身性质。Whitesides 表示该法案从产品设计角度切入,与侧重家长控制或消费者保护的其他提案不同,并称其有望在下一届会期通过。法案包含优先适用条款,为各州设定监管下限,加州 SB 1119 和纽约 S9051B 等更严格的州法仍可继续生效。

  • 动态Engadget

    Anthropic 因会话 cookie 被盗强制用户登出 Claude 并退款

    Anthropic 在发给受影响用户的邮件中称,信息窃取木马从用户自己的电脑上窃取了活跃的 Claude 登录会话,攻击者借此耗尽用量额度并产生未授权扣费,公司已强制登出相关会话、删除已保存的支付卡并退还额外用量费用。Anthropic 表示问题出在用户电脑而非自身被入侵,并已识别出六类木马家族,包括 Windows 上的 Vidar、Lumma、StealC、RedLine、Acreed,以及少量 Mac 上的 Atomic Stealer(AMOS)。这些木马并非专门针对 Claude,而是随恶意下载传播的通用窃取程序,会抓取保存的密码和浏览器 cookie;被复制的 Claude 会话 cookie 可让攻击者直接接管已认证会话,不触发密码和双因素验证。Anthropic 建议用户先清除木马再重新登录,为账号邮箱设置新密码和双因素验证,之后才重新添加支付方式。

  • 动态Security Affairs

    信息窃取恶意软件劫持 Claude 会话,Anthropic 强制登出并退款

    Anthropic 确认多款信息窃取恶意软件可劫持已登录的 Claude 会话,绕过密码、MFA 和 SSO 消耗付费额度,公司已强制登出受影响会话、移除账户中保存的支付方式并退还未授权费用。Anthropic 在通知中称,受影响用户使用 Claude 的电脑很可能已感染信息窃取恶意软件,手机和平板未涉及,该恶意软件通常随非官方下载或恶意应用进入,会复制保存的密码、浏览器登录 cookie 及本地应用凭据。公司识别出 Windows 上的 Vidar、LummaC2、StealC、RedLine、Acreed 以及少量 Mac 上的 Atomic Stealer,并指出仅撤销会话或拦截欺诈支付不够,设备仍感染时恶意软件可捕获下一次登录。现有套餐持续到当前计费周期结束,之后用户需重新添加支付方式;Anthropic 建议重新登录前先做完整恶意软件扫描并启用双重验证修改密码。

  • 动态Help Net Security AI

    Anthropic 因信息窃取恶意软件劫持会话强制用户登出 Claude 账号

    Anthropic 因用户 Claude 登录会话被信息窃取恶意软件窃取,开始将受影响用户登出账号。公司在上周发给受影响用户的邮件中称,此次攻击涉及的恶意软件包括 Windows 上的 Vidar、Lumma(LummaC2)、StealC、RedLine 和 Acreed,以及少量 Mac 上的 Atomic Stealer(AMOS),这类通用恶意软件通常随非官方下载或恶意应用进入设备,会静默复制保存的密码、浏览器登录 cookie 及本地应用凭据。由于攻击者可通过重放被窃取的会话 cookie 绕过 2FA,Anthropic 采取的措施包括登出账号以作废被窃取的会话、移除已保存的支付方式,并退还被盗刷的 Claude 费用。

  • 动态SecurityWeek

    Anthropic 警告部分 Claude 用户遭信息窃取恶意软件感染

    Anthropic 向部分 Claude 用户发出邮件警告,称其电脑上的信息窃取恶意软件使攻击者得以劫持登录会话并消耗用量额度。受影响设备涉及 Windows 上的 Vidar、Lumma、StealC、RedLine、Acreed,以及少量 macOS 设备上的 Atomic Stealer(AMOS)。Anthropic 表示该恶意软件是通用型、与 Claude 本身无关,通常通过非官方下载或恶意应用进入,会窃取保存的密码、浏览器登录 cookie 及其他本地应用凭据;公司认为有威胁行为者从这些数据中挑选被盗 Claude 会话访问账户。作为处置,Anthropic 已登出受影响会话,并警告若再发现账户滥用迹象可能再次登出;同时移除已保存的支付方式以防扣费,用户需重新添加支付方式才能续费或继续购买,公司还退还了被认定为未授权的 Claude 费用。

  • 动态BleepingComputer

    Anthropic 警告信息窃取木马劫持 Claude 登录会话并消耗用户额度

    Anthropic 向部分 Claude 用户发邮件警告,其电脑上的信息窃取木马(infostealer)窃取了已登录的 Claude 会话,攻击者借此访问账户并消耗用户额度。Anthropic 表示正在将受影响用户登出 Claude、移除已保存的支付方式,并对认定为未授权的扣费进行退款。公司称调查仍在进行,但电脑很可能早已感染通用信息窃取木马,并强调没有理由认为该恶意软件与 Claude 相关、通过 Claude 安装或与用户使用 Claude 的行为有关。Anthropic 已识别出 Windows 上的 Vidar、LummaC2、StealC、RedLine 和 Acreed,以及少量 Mac 上的 Atomic Stealer(AMOS)。由于信息窃取木马可复制已通过认证的浏览器会话,攻击者可能无需再走密码和 2FA 登录流程。

  • 论文论文追踪

    SBW:面向 LLM 智能体的语义行为水印方法

    研究者提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分桶替代公开簇分桶,在随机预言机模型下证明新桶分配不可预测。此前三种智能体水印方案都绑定精确动作符号,仅改写观测即可让 AgentMark 的比特恢复率降至 16.8%。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench(每模型 600 条轨迹)在 1% FPR 下改写检测率为 0.49-0.66,精确符号方案为 0.05-0.17;ALFWorld(每模型 100 个回合)为 0.92-0.97 对 0.00-0.01。带密钥分桶把自适应伪造从 100% 降到假阳性下限。作者指出该保证不覆盖的边界:对抗者复制受害者自身步骤时,乱序拼接被中和(Qwen2.5-3B 上为 0.000),但链式重放在五个模型上仍达 0.76-0.98,作为开放问题报告。

  • 论文论文追踪

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    DEFER1 研究多智能体防御,并报告受控测试中的攻击成功率降低。这些受控测试结果不等于该方法对任意模型或运行环境均有效。

  • 论文论文追踪

    两阶段智能体轨迹审计框架:用门控规则加 LLM 审计降低监控成本

    研究者提出两阶段智能体轨迹审计框架,第一阶段用单事件与轨迹序列规则筛选待检动作,第二阶段由 LLM 审计智能体结合前序轨迹在执行前审查每个被选动作,并用训练数据联合优化门控规则与审计指令。在公开基准 OpenAgentSafety 上,该框架将每次运行的 LLM 审计次数从 8.15 降至 2.33、token 用量从 47.8k 降至 14.6k,检测率为 72.8%,而全量审计为 81.5%。在两个模拟多智能体案例中,框架标记出全部恶意轨迹,同时将审计 token 用量减少超过 80%。

  • 论文论文追踪

    综述:100项研究显示青少年AI风险防护多停留在设想阶段

    一项系统综述梳理了100项涉及儿童与青少年接触AI的实证HCI研究,覆盖学校、家庭、照护机构和公共服务等场景。研究使用YAIR风险分类和MIT Mitigation Taxonomy对策分类,对风险与防护措施进行映射,发现多数风险只对应提出或设想中的对策,已实施的对策很少,经过评估的更少,且现有评估多衡量技术性能而非是否真正防止了伤害。作者据此指出风险覆盖的空白区域和未经检验的防护措施,并提出HCI研究加强青少年AI安全的具体方向。