安全攻防
morning
FLAWED 的缺陷及其对行业研究的意义
2026-09-24
1 阅读
约6分钟阅读
tob_scott_a
字号:
免责声明:此处表达的观点仅代表我个人的观点,并不代表任何现任或前任雇主或附属组织的观点。 9 月 17 日,我在 Twitter 上引用了 Trail of Bits 的博文,题为“1Password 的 AI 补丁基准具有误导性”,其中还引用了 Davi Ottenheimer 的“1Password 推送的虚假信息:他们的 AI 补丁报告是错误的”。两人都批评 1Password 的 Off-by-1 实验室的“Frontier 模型的漏洞补丁经常是 F.L.A.W.E.D”(以下简称“FLAWED”)。当它发布时我看到了 FLAWED,并与其他研究人员讨论了它;我们将其归类为污水并继续前进。当时我没有意识到 1Password 的发行版已经将其带入了多深的程度:进入新闻报道和防御者路线图。看到这项工作掩盖了资源较少的团体更严格的研究,迫使我在 Twitter 上发帖,而对此的回应迫使我写了这篇博文。原始线程 以下是该线程,包括两个后续回复,逐字转载。除了 Davi 和 ToB 提出的评估问题之外,本文中还有一些明显的问题,包括那些让我质疑人类与人工智能援助比例的问题,但其中一些问题非常严重,我们应该考虑我们对行业实验室要求的研究规范。虽然这些错误包括不正确的图表(例如,星号图 1 声明在相关步骤中在哪里?)、算术错误(例如 2.8!= 大约 4)以及可以从浏览中收集到的内部文本不一致,但引用问题是最严重的。行业论文的引用密度可能会稍低一些。但 FLAWED 采用了严格研究的形式和言辞(甚至声称在这个特定领域“几乎没有任何先前的工作”),仅引用了 19 个来源(主要是企业博客文章加上 XKCD)。这种说法与文献不符。并发的 PatchBench 论文有 73 次引用(https://arxiv.org/pdf/2609.04075),主要是学术研究论文。例如,Meta 的 AutoPatchBench 没有被引用,尽管这是著名研究人员的明显先前工作。 FLAWED 没有引用也没有阅读这篇有关 LLM 安全研究陷阱(包括相关子领域)的 NDSS 论文(https://ndss-symposium.org/ndss-paper/chasing-shadows-pitfalls-in-llm-security-research/),这本来会对这项工作真正有利,因为 FLAWED 具有此类已识别的陷阱。关于“修补地球”还存在一个事实问题。据 OpenAI 称,Calif 和 HackerOne 参与了“漏洞分类、协调披露和其他重点漏洞发现工作”,但该论文仅针对 ToB 工程师。我理解为什么 ToB 在这里受到关注;他们是 OpenAI 的合作伙伴,也是所有作者最近的前雇主。作为前 ToB 本人,我知道很容易引用最重要的内容。但对于一篇研究论文来说,这种说法仍然不准确且不恰当。我所做的行业研究已成为博客文章和白皮书,并且发表了学术著作。格式的约定产生了相应的期望。这声称并采用了权威研究的语气和格式,但没有采取必要的严谨性。犯错是正常的;这就是我们发表、复制和批评研究的部分原因。但这也是存在更正和必要时撤回的原因。我希望 1Password 撤回或更正。我希望他们至少与学术研究人员合作,雇用具有研究背景的人员,或者与社区合作,以防止再次发布具有如此高度集中的间接错误的工作。我作为一名 1Password 用户这么说,希望他们做这项工作。人工智能安全需要独立于前沿实验室的团体进行研究,尤其是审查潜在营销主张的工作。然而,这使得执行强有力的研究规范变得更加重要,而不是不那么重要。虽然 1Password 的 Off-by-1 实验室并不是世界上最严重的罪犯,但我希望他们能够做出高质量和诚信的工作,因为他们的兴趣应该是可信的研究而不是废话。在回应有人提出前沿实验室时,我写道:当然!如果你滚动浏览我的其余推文和转发,你会发现我个人和我推动的研究都对前沿实验室提出了很多批评。但在公司品牌下发布言论只是另一种不让科技公司承担责任的方式。解决办法是诚实和严谨,而不是因遗漏和疏忽而剽窃。我们应该扩大学术界或 EleutherAI 等地方的真实、良好、独立的工作,这些地方的资源和影响力比工业实验室少得多。忽略直接相关的学术工作会加深这种不平衡。 1Password 的工作引起了关注、新闻稿等,而真正的思想家却没有。当浏览时发现一些明显的错误时,缺乏细心是极难原谅的。 1密码不是一些密码
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱