只用一张卡,做出了声称是100M参数以内最好的小模型?
创始人
2026-08-02 14:41:44

(来源:机器之心)

机器之心编辑部

AI 圈有一种颇为复古的快乐:小参数模型暴打远超自身体量的对手。

上周,一位名为 slvDev 的开发者将一个 2890 万参数的语言模型,装进了售价约 8 美元的 ESP32-S3 微控制器。整块板子只有 512KB SRAM、8MB PSRAM 和 16MB 闪存。无需联网,模型可以直接在芯片上以约 9.5 token/s 的速度生成文本。

当然,这个模型只在 TinyStories 上训练过。它不会写代码,不能调用工具,也回答不了世界知识问题,主要能力是续写简短的儿童故事。

但这似乎并不妨碍开发者们玩得很开心。

近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。

按照作者给出的结果,BarunLM-35M 在九项零样本基准上的平均准确率达到 41.01%,超过了参数量约为其 6.55 倍的 Liquid AI LFM2.5-230M-Base,也超过了 GPT-2、Pythia-160M 等体量明显更大的模型

更惊人的是,该模型仅使用单个 H200 GPU 进行训练

整个项目已经开放模型权重、训练与推理代码以及完整评测结果,采用 Apache 2.0 许可证。

  • Github 链接:https://github.com/harrrshall/barunlm-35m

  • Huggingface 链接:https://huggingface.co/harrrshall/BarunLM-35M

技术细节:让大部分注意力「只看附近」

BarunLM-35M 共有 35,072,768 个参数,使用约 57 亿 token 进行预训练,训练上下文长度为 2048。

作者采用 LM Evaluation Harness 0.4.12,对模型进行了九项零样本评测,包括 ARC-Challenge、ARC-Easy、BoolQ、HellaSwag、LAMBADA、OpenBookQA、PIQA、SciQ 和 WinoGrande。

在这套评测中,BarunLM 领先 LFM2.5-230M-Base 1.81 个百分点。作者还进行了 1 万次配对 bootstrap 重采样,得到的差值置信区间为 0.92 至 2.71 个百分点。

性能提升源于更优的架构。作者从 DeepSeek、Kimi 和其他前沿开源模型中汲取了灵感。

模型共有 12 层,隐藏层宽度为 448,采用 7 个查询头和 1 个共享键值头。其最显眼的设计,是按照 3∶1 的比例交替使用局部注意力与全局注意力:连续三个网络层只查看前后 256 个 token,第四层再执行一次全局信息交换。

标准全局注意力需要让序列中的每个 token 与其他所有 token 建立联系,计算量会随序列长度平方增长。但语言中的大量依赖其实发生在相邻范围内,因此,BarunLM 让大多数层处理局部信息,只定期打开一次全局视野。

这种设计降低了计算开销,同时又没有完全切断长距离信息流。

第二项关键设计是「可学习残差选择器」。模型每隔四层设置一次选择机制,在多个中间表示之间决定应该保留哪些信息。它试图解决小模型的一个现实难题:网络容量有限,每一层都很珍贵,如果早期形成的有效特征在后续计算中被覆盖,模型没有足够冗余去重新学习。

除此之外,BarunLM 还组合了分组查询注意力、50% Partial RoPE、QK Normalization、门控注意力输出和 bounded SwiGLU,并将输入、输出嵌入权重绑定。词表被控制在 16384,进一步减少了嵌入层占用的参数。

训练预算同样值得注意。模型共看过约 57 亿 token,相当于每个参数对应 162.5 个训练 token。数据来自 FineWeb-Edu、Cosmopedia v2、FineMath-4+、DCLM、CodeSearchNet Python 和 CodeParrot Clean,覆盖教育文本、合成数据、数学、通用网页与代码。

最后 40 亿 token 的训练在单张 H200 上完成,使用 Muon 优化器,共训练 40690 步。

BarunLM 首先是一个基础模型,没有经过指令微调。它的上下文窗口只有 2048。作者明确表示,它主要面向紧凑语言模型研究、教学、文本生成实验和本地原型开发,而非医疗、法律或金融等高风险场景。

小模型的意义,不是成为缩小版 ChatGPT。当一张卡的训练预算就能够实现一些强大性能的时候,未来的想象将更加广阔。

相关内容

热门资讯

经营现金流持续为负,能否改善?... 深圳商报·读创客户端记者 李薇 国科天成(301571)7月31日公告,根据该公司最新发布的投资者关...
孝庄去世后为何停灵37年不下葬... 17世纪中叶,盛京昭陵与北京城之间,隔着的不只是千里路程,还有满洲旧俗、汉地礼制和清朝皇室身份秩序的...
现金流为何重要买房决策更清晰? 在置业过程中,许多购房者往往过度关注房屋总价与首付比例,却忽视了维持家庭财务健康的核心要素。 资金流...
流动为何变化资产配置要关注? 在投资领域,资产配置是实现财富稳健增长的关键环节。而资产的流动性变化,更是投资者在进行资产配置时不可...
组合为何变化资产配置要关注? 在金融投资领域,资产配置是一个至关重要的概念。它不仅关系到投资者的收益,还影响着投资的风险。而资产组...