跳到正文
10月8日 · 周四

Meta · 论文

找到 2 篇
筛选8
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 15 篇还没打标签,不在筛选结果里。

另有 15 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2610.08670

    研究:后训练配方决定大模型是否违背自身道德判断行事

    提出知行差距面板,测量压力下模型是否违背自身判断

    发表
    测试
    OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个
    摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。

    本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。

    深度解读完整解读
  2. 攻击arXiv 2609.08236

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    发表
    攻击者
    无盒、黑盒
    测试
    Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    深度解读完整解读
已经到底了