首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

我们有一年的时间来修复各地的安全问题

2026-09-08 1 阅读 约7分钟阅读 saikatsg
分享:
字号:
GLM 5.3-flash 上周发布,这意味着 Glasswing 项目和 Daybreak 项目的时间不多了。现在任何人都可以使用能够进行危险黑客攻击的廉价模型,而没有拒绝恶意行为的正常保障措施。我们需要修复整个行业的漏洞,以免措手不及。这是计算历史上第一次,我们有能力做到这一点!我们可以使用比人类更快的前沿法学硕士来在我们剩下的时间内找到并解决这些问题。剩下的困难部分是部署修复程序。对于大多数人来说,这可能听起来像是无稽之谈或歇斯底里的过度反应,所以这就是它的含义:“GLM”是一种 LLM (AI)。 GLM 系列是开放式的,这意味着任何人都可以下载并运行模型。 “闪存”意味着与大多数“前沿”型号相比,它便宜且运行速度快。 “便宜”是相对的,但考虑一下在本地运行它的硬件大约需要 5-15,000 美元。这里的“前沿”意味着法学硕士“接近人工智能目前能够实现的前沿”。 Glasswing 项目和 Daybreak 是利用法学硕士来解决整个科技行业安全问题的举措。 “恶意行为”包括侵入基础设施和告诉人们如何制造管道炸弹等。这篇文章的其余部分是关于是什么让我如此确信这是一个迫在眉睫的威胁,以及我们可以采取哪些应对措施。 GLM GLM 5.3-flash 可以由世界上任何人下载和修改。 GLM(“通用语言模型”)家族由中国人工智能实验室Z.ai Co.(原智浦AI)开发。当模型由 Z.ai 托管时,它会受到法律要求的限制:Z.ai 在互联网上公开发布其模型(“开放权重”模型)。一旦这样做,DeAlignAI 等组织就会发布“取消的”模型,并通过手术消除拒绝任务的情况。 DealignAI 表示,被废除的模型在 Harmbench-320 上的得分为 0%,该测试测试模型是否拒绝完成有关虚假信息、网络犯罪、生物武器和其他非法行为(例如制造管状炸弹)的任务。换句话说,这个模型基本上愿意做任何事情。 Flash GLM 5.3-flash 可以在普通消费类硬件上本地运行。 “Flash”主要是一个广告术语——它是相对于其他模型而言的,而不是特定的技术方法。网上有很多人在本地运行了 GLM 5.3-flash 的基准测试。下面是一个示例,显示在约 6000 美元的 NVIDIA GPU 上每秒大约 20 个令牌。 9 月 22 日,Apple 发布了配备 256 GB 统一内存的 M5 Mac Studio。 “统一内存”意味着它可以在主机操作系统和GPU之间共享。这足以运行 5.3-flash,一旦发布,它可能会达到每秒 30 个令牌左右。 256 GB 的起价约为 9,500 美元。软件的进一步改进可以通过模型解码器的改变使吞吐量减半。如果我们将其推断为 M5,则总吞吐量约为 45 个令牌/秒。 45 个令牌/秒足以在 3 秒内编写这段代码: ⚠️ LLM 生成的代码 from pathlib import Path import hashlib def 摘要 ( path : Path ) -> str : hasher = hashlib 。 sha256() 与路径。打开(“rb”)作为文件:而块:=文件。读取(1024 * 1024):哈希器。更新(块)返回哈希器。 hexdigest() def main() -> None : import sys if len(sys.argv) < 2 : raise SystemExit("usage: hash.py FILE...") for name in sys 。 argv [ 1 : ] : path = Path ( name ) try : print ( f " { 摘要 ( path ) } { path } " ) except OSError as error : print ( f " { path } : { error } " , file = sys . stderr ) if __name__ == " __main__ " : main ( ) 换句话说,不仅可以在本地运行此模型,还可以执行以下操作:因此,从普通个人的储蓄中提取资金,并全天候高速使用。 Frontier GLM 5.3-flash 非常接近我们制造的最好 AI 的能力。我们制作的人工智能已经在野外发现并利用真正的安全漏洞。未来我们制造的人工智能将会变得越来越强大。 GLM 5.3 在 Cyber​​Gym 上的得分为 84.5%,在 ExploitBench 上的得分为 54.4%。我们没有直接获得 5.3-flash 的数据,但可能与 5.3-flash 大致相同或稍低一些。被淘汰的型号将再次略微降低。 Cyber​​Gym 测量过去开源项目发现并修补的现实世界漏洞。换句话说,只需查看公开的源代码和 CVE 描述,GLM 5.3 就可以重现此代表性样本中 84.5% 的漏洞。 ExploitBench 衡量模型是否确实可以利用漏洞造成伤害。它按照滑动比例进行评分,为部分利用提供部分分数,最后一步是任意代码执行。为了进行比较,ExploitBench 上领先(“前沿”)的模型是 GPT-6 Astra (100%),GPT-5.6 Sol 排名第二,为 78.5%。 Cyber​​Gym 上的领先模型是...GLM-5.3。亚军
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱