智能AI
morning
只用一张卡,做出了声称是100M参数以内最好的小模型?
摘要
机器之心编辑部 AI 圈有一种颇为复古的快乐:小参数模型暴打远超自身体量的对手。 上周,一位名为 slvDev 的开发者将一个 2890 万参数的语言模型,装进了售价约 8 美元的 ESP32-S3 微控制器。整块板子只有 512KB SRAM、8MB PSRAM 和 16MB 闪存。无需联网,模型可以直接在芯片上以约 9.5 token/s 的速度生成文本。 当然,这个模型只在 TinyStor...
token
BarunLM
35M
LFM2
230M
Base
H200
https
com
harrrshall
2026-08-03
1 阅读
约6分钟阅读
机器之心
字号:
机器之心编辑部 AI 圈有一种颇为复古的快乐:小参数模型暴打远超自身体量的对手。 上周,一位名为 slvDev 的开发者将一个 2890 万参数的语言模型,装进了售价约 8 美元的 ESP32-S3 微控制器。整块板子只有 512KB SRAM、8MB PSRAM 和 16MB 闪存。无需联网,模型可以直接在芯片上以约 9.5 token/s 的速度生成文本。 当然,这个模型只在 TinyStories 上训练过。它不会写代码,不能调用工具,也回答不了世界知识问题,主要能力是续写简短的儿童故事。 但这似乎并不妨碍开发者们玩得很开心。 近日,独立开发者 Harshal Singh 公布了一个 仅有 3500 万参 数 的基础语言模型 BarunLM ,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。 按照作者给出的结果,BarunLM-35M 在九项零样本基准上的 平均准确率达到 41.01%,超过了参数量约为其 6.55 倍的 Liquid AI LFM2.5-230M-Base,也超过了 GPT-2、Pythia -160M 等体 量明显更大的模型 。 更惊人的是,该模型 仅使用单个 H200 GPU 进行训练 。 整个项目已经开放模型权重、训练与推理代码以及完整评测结果,采用 Apache 2.0 许可证。 Github 链接:https://github.com/harrrshall/barunlm-35m Huggingface 链接:https://huggingface.co/harrrshall/BarunLM-35M 技术细节:让大部分注意力「只看附近」 BarunLM-35M 共有 35,072,768 个参数,使用约 57 亿 token 进行预训练,训练上下文长度为 2048。 作者采用 LM Evaluation Harness 0.4.12,对模型进行了九项零样本评测,包括 ARC-Challenge、ARC-Easy、BoolQ、HellaSwag、LAMBADA、OpenBookQA、PIQA、SciQ 和 WinoGrande。 在这套评测中,BarunLM 领先 LFM2.5-230M-Base 1.81 个百分点。作者还进行了 1 万次配对 bootstrap 重采样,得到的差值置信区间为 0.92 至 2.71 个百分点。 性能提升源于更优的架构。作者从 DeepSeek、Kimi 和其他前沿开源模型中汲取了灵感。 模型共有 12 层,隐藏层宽度为 448,采用 7 个查询头和 1 个共享键值头。其最显眼的设计,是按照 3∶1 的比例交替使用局部注意力与全局注意力:连续三个网络层只查看前后 256 个 token,第四层再执行一次全局信息交换。 标准全局注意力需要让序列中的每个 token 与其他所有 token 建立联系,计算量会随序列长度平方增长。但语言中的大量依赖其实发生在相邻范围内,因此,BarunLM 让大多数层处理局部信息,只定期打开一次全局视野。 这种设计降低了计算开销,同时又没有完全切断长距离信息流。 第二项关键设计是「可学习残差选择器」 。模型每隔四层设置一次选择机制,在多个中间表示之间决定应该保留哪些信息。它试图解决小模型的一个现实难题:网络容量有限,每一层都很珍贵,如果早期形成的有效特征在后续计算中被覆盖,模型没有足够冗余去重新学习。 除此之外,BarunLM 还组合了分组查询注意力、50% Partial RoPE、QK Normalization、门控注意力输出和 bounded SwiGLU,并将输入、输出嵌入权重绑定。词表被控制在 16384,进一步减少了嵌入层占用的参数。 训练预算同样值得注意。模型共看过约 57 亿 token,相当于每个参数对应 162.5 个训练 token。数据来自 FineWeb-Edu、Cosmopedia v2、FineMath-4+、DCLM、CodeSearchNet Python 和 CodeParrot Clean,覆盖教育文本、合成数据、数学、通用网页与代码。 最后 40 亿 token 的训练在单张 H200 上完成,使用 Muon 优化器,共训练 40690 步。 BarunLM 首先是一个基础模型,没有经过指令微调。它的上下文窗口只有 2048。作者明确表示,它主要面向紧凑语言模型研究、教学、文本生成实验和本地原型开发,而非医疗、法律或金融等高风险场景。 小模型的意义,不是成为缩小版 ChatGPT。当一张卡的训练预算就能够实现一些强大性能的时候,未来的想象将更加广阔。 © THE END 转载请联系本公众号获得授权 投稿或寻求报道:liyazhou@jiqizhixin.com 平台地址: http://www.jintiankansha.me/t/PMkg68Sbxb
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱