炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:21世纪经济报道)
记者丨石恩泽
编辑丨张星
8月11日,有市场消息称,芯片巨头英伟达正在秘密研发新一代开源大模型系列Nemotron 4,其中规模最大的版本预计至少拥有1万亿个参数,约为今年6月发布的Nemotron 3 Ultra的两倍,最快可能于今年秋末准备就绪。
耐人寻味的是节奏。万亿参数旗舰尚在训练之中,英伟达同日先行发布了300亿参数的轻量级模型Nemotron 3.5 Lightning和开源模型路由工具NeMo Switchyard。前者可在单块消费级GPU上运行,后者负责在不同模型之间自动调度任务。
值得注意的是,上述两款产品均免费开放,全球开发者可直接下载、使用和修改。
模型不卖一分钱,而英伟达约九成收入来自数据中心硬件。这家公司为什么要投入数百人的团队,亲自下场做一个免费的大模型?模型白送出去之后,又打算靠什么赚钱?答案藏在英伟达最核心的生意里。
截至8月11日美股收盘,英伟达股价超217美元/股,市值超5万亿美元。
卖GPU的,为什么下场做大模型?
表面看,英伟达做模型是不务正业。但多位业内人士向记者分析,这套打法的商业闭环其实非常直接:模型越开放,用AI的人越多;用AI的人越多,需要的GPU就越多。
“免费的AI应该有利于硬件,有利于芯片,有利于数据中心。”英伟达创始人黄仁勋7月在接受采访时说得直白。同月,他在公开场合发表声明,内容不是产品广告,而是一份支持开源权重模型的公开信。不到三周后,Nemotron 3.5 Lightning落地。
英伟达生成式AI副总裁Kari Briski在回应Nemotron 4时也表示:“我们投资Nemotron,是因为相信每家企业、每个国家都需要可及的前沿开源模型。”
更深层动力来自竞争格局的变化。美国AI追踪机构Interconnects AI数据显示,截至2026年3月,阿里通义千问(Qwen)系列已占全球开源模型下载量的50%以上;Hugging Face平台上,中国开源模型的月下载占比达41%,首次超过美国的36.5%。
API聚合平台OpenRouter的统计同样显示,DeepSeek、Qwen、MiniMax等“开源友好型”中国厂商的合计调用份额在2026年上半年从约两成升至接近五成,Meta等厂商动向尚不明确,但OpenAI已于2026年放弃开源路线,转向闭源旗舰。换言之,美国开源阵营正面临无人扛旗的局面。
一位长期跟踪AI产业的分析师向记者指出,英伟达真正担心的不是某个模型输掉benchmark,而是中国开源模型跑在以华为昇腾为代表的非英伟达算力上走向世界。而这就意味着CUDA生态被整体绕开。“所以它索性自己下场,在中国之外培育一个跑在英伟达GPU上的开源生态。”
这并非一时兴起。今年3月,英伟达被曝计划未来五年投入260亿美元研发开源模型,并发起Nemotron联盟,模型团队全职人员已超过500人。
英伟达应用深度学习研究副总裁Bryan Catanzaro此前坦言,构建Nemotron一是为了研究和预测未来硬件的突破方向,二是支持更广泛的生态——“也就是我们自己业务增长的机会”。
模型出来之后,打算怎么卖?
想清楚了为什么做,接下来的问题更实际:模型做出来之后,英伟达打算怎么把这笔账算回来?
答案可能出乎很多人意料:模型本身不卖,卖的是模型身后的一整套东西。
第一条路径是硬件绑定。Nemotron 3系列已采用NVFP4数值格式进行原生预训练。这是Blackwell架构独有的格式,意味着要跑出官方宣称的最优性能,最顺手的选择仍是英伟达最新一代GPU。
而Nemotron 3.5 Lightning单卡可跑,覆盖RTX个人电脑、DGX Spark桌面超算和Jetson边缘设备,本质上是把AI部署权从少数云厂商扩散到个人开发者和中小企业——客户越分散,硬件需求越分散,英伟达面对的就不再只是几家超大云厂商,而是从个人电脑到数据中心的一整条产业链。
第二条路径是企业级软件与服务。Nemotron模型以NIM微服务形式打包,通过Hugging Face、ModelScope、OpenRouter及英伟达云合作伙伴生态分发,企业深入部署时则引入AI Enterprise等付费软件栈,并采购DGX系统。
Kari Briski表示,对于很多企业,尤其是网络安全、材料科学等专业领域的公司,一个现实担忧是AI服务商最终可能成为它们的竞争对手,“企业确实需要考虑:究竟把自己的知识产权交给了谁?”而开源可私有部署的模型恰好接住这部分需求,即数据不出门,但服务器得买。
第三条路径最容易被忽略:卡位调度层。与Lightning同步发布的NeMo Switchyard是模型路由工具,能将任务自动分派给最合适的模型。英伟达内部基准显示,其在保持前沿精度的同时,任务成本可降至同类闭源模型的近三分之一。
把这几件事连起来看,英伟达的路线图很清楚了:小模型绑定C端和中小企业,大模型卡位B端大公司,路由工具做中间调度层。这整套“模型全家桶”都在为同一个目标服务:让更多人更便宜地用上AI,然后用更多的芯片。
尤其当AI Agent成为主流,一个任务要在多个模型间流转时,谁掌握路由和推理框架,谁就更接近AI应用的调度中心。
而开发者一旦沿着英伟达官方设计的路径部署,底层最顺手的硬件大概率还是英伟达的硬件。
对AI产业链意味着什么?
这套“免费送模型、靠算力变现”的打法一旦跑通,被搅动的就不只是英伟达自己的报表。当一家占据全球AI芯片市场绝对份额的公司亲自下场定义开源模型,整个产业链的成本结构和竞争重心都会随之移动。
短期看,开源旗舰扩容直接降低了AI应用的启动成本。企业不必再从零训练,下载模型、用自有数据微调即可。竞争重心随之从谁拥有模型,转向谁能以更低成本把模型跑起来,需求沿产业链向下传导。
多家券商研报推演的路径大致相似。个人开发者需要更强的RTX显卡;企业本地部署拉动GPU服务器、存储与网络设备,工业富联等服务器ODM厂商直接受益;规模化推理推动数据中心建设,配套带动液冷温控、高速交换机和光模块需求。
尽管单台RTX电脑并不需要800G光模块,但“本地完成原型、云端规模部署”的分工意味着相当一部分应用最终会回流数据中心。机器人和边缘设备则利好Jetson等低功耗平台生态。
更关键的变量是AI Agent。Agent不是一次问答就结束,而是持续多轮推理、工具调用和模型切换。这符合杰文斯悖论的逻辑:单次推理成本下降,调用次数反而大幅增加。
瑞银7月的报告也判断,开源模型不会减少GPU需求,而是将算力需求转向更具性价比的推理任务,低成本模型反而会扩大整体应用范围。这正是英伟达希望看到的结果。
对产业链其他玩家而言,影响则喜忧参半。闭源模型厂商的API议价能力将再度承压。OpenAI近期已宣布部分模型最高降价80%应战。对国产算力而言,窗口与壁垒并存。
词元(Token)需求持续高涨给了国产芯片承接推理需求的窗口期,但CUDA兼容性、卡间互联能力与英伟达相比仍有代差,“模型—软件—硬件”的全栈绑定一旦深化,迁移成本只会更高。
当然,这条“开源模型降低门槛—应用增加—推理增长—算力扩容”的传导链不会自动兑现。一位卖方研究员向记者提醒,真正需要跟踪的仍是云厂商资本开支、GPU集群建设进度和高速光模块的实际订单,“一款开源模型的发布不是订单本身,但它可能让产生订单的市场变得更大。”
英伟达下场做开源模型,不是慈善,也不是转型做模型公司。别人靠模型赚钱,它靠模型身后的算力赚钱。模型免费送,是把更多人请进AI市场;进场的人越多,芯片就越好卖。这是一场所有人都看得见却很难绕开的“开源阳谋”。
SFC
出品丨21财经客户端 21世纪经济报道
编辑丨江佩霞