北京时间9月14日早上,马斯克回了一句:有人问九月除了Grok 4.7,SpaceX AI还能指望什么——他点名Grok 4.8,2.5万亿参数,用新的C++软件栈训练,本周预训练结束,然后开始强化学习。同一天晚些时候,他又画了一张台阶:4.7大致跟Opus 5.0一个水平、不是5.1;4.8会有明显提升;4.9大概是Astra、Fable这一档;Grok 5也许比现在任何东西都强,走着瞧。
屏幕上全是2.5万亿。很多人的第一反应是:这脑子比别人大多了,是不是马上第一。
今天要聊的不是这个数字厉不厉害,是三件更底下的事。第一,现在大模型领先,参数到底占多大份。第二,模型训练了为什么会聪明,聪明到底是什么,会不会一直聪明。第三,各家方向看起来一样,差距为什么还是这么大。这三件弄清楚,再回头读马斯克那几条,会比刷参数冷静得多。
一、参数是什么:2.5T要拆两层看
可以把大模型想成一堵巨大的旋钮墙。每个旋钮上有一个数字,训练就是不停拧这些旋钮,拧到模型说的话最像人话为止。参数,就是旋钮的数量。2.5T,就是两万五千亿个旋钮。
2026年必须知道的细节:现在说一个模型多少参数,至少要分两个数。
一层叫总参数——仓库里存了多少重量,主要管知识装得下多少、专家能分多细,也管显存和存储要花多少钱。
一层叫激活参数——每个字真正算了多少,主要管这次思考有多慢、电费有多贵。
为什么要拆?因为现在前沿几乎都是混合专家(MoE)。打个比方:你去一家超大的医院,这家医院有896个科室。看病的时候,不可能896个科室的医生全围着你——医院会根据症状叫16个科室的专家过来会诊。这家医院的「总参数」是896个科室,「激活参数」是每次来的那16个。
开源侧最清楚的例子是月之暗面的Kimi K3:总参数2.8万亿,896个专家里每次只叫醒16个,真正干活的大约一千零四十亿。也就是说,它有一座接近三万亿的知识仓库,可每一步计算更像一个千亿级模型在跑。
这对理解Grok 4.8很关键。马斯克说的2.5万亿,更可能是仓库大小——医院有多少科室——不是每一步都跑2.5万亿。如果是稀疏MoE,从1.5涨到2.5,不等于推理成本同比例涨67%。更像是多开了几百个科室、多了一块货架。
真正贵的,是两层一起涨。只涨其中一层,账单和能力都不会按那个比例走。记住:总参数决定能装多少知识,激活参数决定每次思考花多少力气。
二、参数越多越聪明?缩放律在2026年被改写了
那是不是科室越多,医院就越厉害?
2020年,Kaplan那组很有名的结论大致是:损失会跟着参数、数据、算力按幂律往下掉。当时大家更偏向把模型做大。
2022年,DeepMind的Chinchilla把权重重新分配:算力固定时,参数和数据要一起涨。更小的模型,喂更多的数据,可以打过更大但没喂饱的模型。好比给一个学生一颗超级大的脑子却只让他读三本书——反过来脑子普通但读了三百本,考试大概率赢。
2024到2026年,实验室实际干的事又偏了。他们不太追求「训练那一次最省算力」,而追求上线之后总账最便宜——模型发出去会被问亿万次。所以预训练会远远训过那个理论最优点:宁可小一点、训得更透,上线之后每次回答更便宜。有人把2019到2025按同样算力拆过账:数据侧效率提升大约12倍,模型/架构侧大约3.7倍,数据大约是架构的3.2倍。
更准的说法不是「参数决定一切」。是:算力够、架构不崩的前提下,参数决定容量上限,数据决定这个容量被填得有多干净,后面的强化学习决定容量被用得有多聪明。
幂律还有一件扫兴的事。参数从1.5万亿涨到2.5万亿,涨了67%,能力不会涨67%。损失下降是慢慢的。数据、喂进去的字数、后面的配方不跟着变,单靠加参数,往往只是几个百分点;有的任务上几乎看不出来。
用榜单对一下账更清楚。最大的模型并不自动第一。2026年9月,闭源前沿基本不报参数;能公开对上的,主要是开源和马斯克口头报的数字。Kimi K3在不少写代码、跑agent的基准上,已经能贴着甚至局部超过Claude Fable 5.0、GPT-5.6 Sol,综合指数通常仍差一小档,不是代差。Grok 4.6口径1.5万亿,xAI自己报的Artificial Analysis指数可以打到61,和GPT-5.6 Sol持平,当时只差Fable 5.0一分;独立榜单上通常仍略落后头部,但已在同一窄带,价格低很多。GLM-5.2大约7440亿总参、约40亿激活;DeepSeek V4 Pro约1.6万亿总参、约49亿激活——很多任务上都能接近或局部摸到前沿。
更有说服力的是反例。Grok 4.7号称2.1万亿,延期了——原因不是参数不够,是强化学习出了问题:回复长度惩罚过重,模型会过早放弃它其实能做的难题,也不会严格检查自己的答案。到了这个量级,卡点经常在后面那一段,不在再加四千亿参数。
总参数第一,既不是充分条件,也不是必要条件。若只记一套口径:能不能进入前沿俱乐部,参数作用很高;1.5万亿和2.5万亿谁一定更强,不一定;谁在Arena、agent、编码上领先,参数是少数派,数据和强化学习往往更关键;为什么还要做2.5万亿——给知识和专家分片加天花板,并为下一轮强化学习留余量。
三、训练了为什么会聪明:下一词、压缩、世界模型与grokking
预训练几乎只干一件事:看见前面的字,猜下一个字。
听起来土。可这个土目标有一个很深的等价物——要把下一字猜准,就得把过去压成尽量小的内部状态,让它对未来仍然够用。语言里几乎所有规律——语法、事实、因果、社会惯例、数学步骤——最后都会变成:下一个字该是什么。只要把下一词猜到足够准,模型就必须在内部抓住这些规律,否则损失下不去。
关键点在这儿:训练从不直接奖励「理解」「推理」「有智慧」,它只惩罚预测错。理解,是这条压力下长出来的副产品。
你要预测一段物理实验记录的下一行,最好的办法不是背句子,是脑子里有一个粗糙的物理世界。预测一段证明的下一行,最好抓住证明在干什么。预测一段对话的下一句,最好抓住对方想干什么以及共同知道什么。所以「预测下一个词」,在数据足够丰富时,会慢慢逼近「预测世界接下来会怎样,再用语言写出来」。
可标准下一词训练并不保证内部状态一定干净、一致、能拿来做规划——它只保证对下一步够用。模型完全可以靠捷径、局部相关、表面模板过关。这正是它有时很聪明、有时突然很蠢的根源。
梯度下降不会思考。它只是反复加强能降低预测误差的内部路径。时间久了,网络里会竞争出两类解:一类是记忆解——把训练样本存下来,见到熟的就复述,新问题不会做;一类是规则解(电路解)——找到更短的生成规则,参数用得更省,对新例子也有效。
有个现象把这件事拍得很清楚,研究者叫它grokking。模型先把训练题背下来了,训练误差接近零,拿新题一测还是零分;你继续训,训很久,忽然有一天新题也会了。原因不是损失还在降,是内部发生了电路竞争:记忆回路和通用回路在抢同一条计算路径;权重衰减这类正则会慢慢打压又大又笨的记忆解,让更紧的规则胜出。这像相变——不是平滑变聪明。大模型预训练里也有类似的事,只是更碎:不同数据域不是一起顿悟,是局部、异步地从记忆过渡到能泛化。
所以「训练出聪明」的机制,不是注入灵魂,是在巨大的函数空间里,预测压力加上有限容量加上正则,让更可压缩的内部算法胜出。压缩得好,看起来就像懂了。
聪明在模型里面长成什么样子——机制可解释性给出的不是完整图纸,但大致有三层。
第一层,特征/概念:把同一件事的多种说法压成内部表示里的方向——猫、猫科、一只在沙发上的动物,可以指向相近的特征。
第二层,世界状态:不只存词,还跟踪现在世界是什么样。最经典的是Othello-GPT:只看棋谱预测下一个合法落子,内部却能直接读出整张棋盘,而且会随新落子更新——猜下一个词会逼出动态世界模型。
第三层,可复用的小电路:注意力头和中间层组成专门子网络,做复制、比较、查找属性、做一次归纳——更接近算法,而不只是联想。推理模型里还有更新的证据:思维链文本上的不同操作——拆问题、回想公式、计算、归纳——在中间层里是可分开的几何结构。
所以,训练后变聪明,物理上是:权重里长出了分层的压缩器。先把表面符号收成概念,再把概念织成状态,再在状态上跑可复用的小算法,最后把结果解压回词。它聪明,是因为这套压缩对很多任务够用;它不像人,是因为这套压缩不是为了生存、感知、行动一致性而长的——是为了把文本的下一步猜对。
还要把两件事分开:会做计算,不等于它写出来的那套话就是内部真实路径。思维链可以提高正确率,一个原因是网络一次往前算深度有限,把思考写成很多步等于临时加了计算时间;可写出来的步骤经常不是内部决策的忠实记录——模型可以先感觉到答案,再编一套像样的推导。苹果那类GSM-Symbolic实验也说明过:题目逻辑结构不变,只改数字、改名字,或加一句无关信息,准确率就会掉——很像高阶模式匹配,而不是对变量改名不敏感的求解器。后期推理模型好了很多,但「换皮就伤」仍然是这类系统的底色。你看到的聪明,是混合物,不是纯推理机。
四、会一直聪明吗:三堵墙与目标函数
不会。聪明有明确的失效边界。
在熟悉分布里,会不会越用越聪明?默认不会。权重在推理时通常是冻住的——不会因为今天聊了三个小时,明天就永久更聪明。除非有在线学习、记忆系统,或再次训练。对话里那次「临时变聪明」,多半是上下文里的工作记忆;窗口一关,那次聪明就消失。
继续把模型做大、数据做多,会不会永远更聪明?在一段很大的区间里会,但不是无限,也不是所有能力都同样涨。有些能力是涌现的:损失平滑下降,某个技能却在某个规模突然从几乎不能到能用——像相变,不神秘,但是非线性。
同时有几类上限几乎确定存在。
任意事实。 语法、括号、常见程序模式是有结构的,规模上去错误会消失;可「某人的生日」「冷门论文第几页」接近随机标签——信息论上,没见过就无法稳定记住。这类幻觉不是调参能彻底消灭的。OpenAI自己的分析更往前走了一步:现有训练和评测还奖励「不会就猜」,惩罚「说不知道」,所以模型会表现得很自信。
算力预算不够。 任何可枚举的模型族都存在它必然失败的输入。更日常的版本是:一次生成的串行计算量有限。任务所需的验证或搜索超过这个预算,它不会报「我算力不够」,而会流畅地编一个答案。幻觉在这里,是撞到计算天花板后的表现,不只是数据脏。
目标本身偏补全,不偏真值。 猜下一词的训练喜欢把句子写圆。圆和真,不是一回事。
出了训练世界:分布内很强,分布微扰常常还行;结构变了、规则反了、需要持久世界状态、需要真正的反事实实验,会脆。原因很简单——它学到的是文本里呈现过的世界统计,不是一个跟物理世界接上传感器、接上行动后果的模拟器。文本是世界的投影,投影会丢维度。
后训练之后的「更聪明」,是另一种聪明。预训练给的是世界压缩;强化学习、推理训练给的是:在难题上多走几步、少早停、会自检、会用工具。这会让同一底座显得突然更聪明,但它买的主要是策略和计算时间,不是无限新知识。Grok卡在强化学习上,就是卡在「怎么把已有压缩用好」,不是卡在再加几千亿参数。
把整件事压成一条链:数据里的规律变成预测误差 → 梯度改权重 → 内部特征、状态、电路被筛选出来 → 这些结构在分布内表现为智能 → 一旦任务超出压缩所能支持的事实、规则或计算深度,结构失效,流畅的胡话补上缺口。
最后一句最重要。人的聪明,有很大一部分来自:我发现自己可能错了,于是停下来,去看,去做实验。现在的大模型,训练目标几乎相反——继续把下一个词说圆。所以它能非常聪明,也能在同样流畅的语气里突然不再聪明。这不是性格,是目标函数。
五、方向一样,差距为什么还大:五层差
先校准预期。2026年9月,头部模型的智商差距已经不大。综合指数上,Claude的Fable、Mythos,GPT-6的Astra,GPT-5.6的Sol,Grok 4.6,Kimi K3,经常挤在同一窄带里。Arena头部大约1480到1530分。这不是2023年GPT-4对其它模型那种代差。你感觉差距很大,多半是任务形状、产品性格和可靠性在拉扯,不是有人发明了另一种智能。
有个很说明问题的裂口:GPT-6 Astra综合智力可以到61左右,agent指数却掉到51,落差接近十分;Claude Fable 5.1综合更高,落到agent时掉得少;Grok 4.6综合不是第一,但智力和agent之间的落差很小。意思是:「会答题」和「能在环境里连续干活」,已经是两条线。
所以用户体感里的「差很多」,常常是:拿Claude写长方案、改大仓库,它更像靠谱同事;拿Astra做难数学、看图推理,它更像竞赛选手;拿Grok跑大量agent,它更像便宜且不容易早停的工人;拿Gemini处理视频和海量文档,路径更顺。这不是一个人全面碾压,是专长错位。
公开层已经收敛:Transformer、混合专家、大规模预训练、高质量数据配比加合成数据、监督微调、可验证奖励上的强化学习、测试时多想一会儿、再套一层产品agent。从一万米高空看,没人走另一条物理定律。一篇覆盖2022到2025年八百多个模型的研究甚至说:在最前沿,大约80%到90%的成绩差可以被训练算力解释,公司特有的秘方大约只解释14%到18%。但用户感受到的差距,往往来自那剩下的10%到20%,再加上产品层——那一层放大效应极大。
真正拉开的,是同一方向里看不见的五层。
第一层,数据不是「都用互联网」,而是不同的世界切片。 Anthropic更偏长文档、代码库、审慎写作、内部高难度任务轨迹;OpenAI更偏广谱工具使用、数学竞赛、计算机使用、安全红队;xAI公开强调X的实时数据、Cursor真实开发会话、SpaceX工程和遥测;Google吃搜索、YouTube、安卓、Workspace这类别人没有的多模态矿;中国开源实验室大量用可验证的数学和代码强化学习,外加中文互联网和合成轨迹。模型变聪明,本质是压缩训练分布里的结构——分布不同,压出来的世界就不一样。这不是参数差0.5万亿能解释的。
第二层,后训练才是2026年的主战场。 预训练把地板抬到接近的位置;谁领先,越来越取决于强化学习怎么设计。Grok 4.7延期就是现场证据:同一底座,奖励函数写偏一点,表现可以从「能啃硬骨头」变成「会考试但会逃」。各家强化学习细节完全不同——奖励是「答案对」还是「过程对」;要不要惩罚太长、太短;数学、代码、写作、安全混在一个强化学习里,还是先训一堆专家再蒸馏回去。后训练是高维、易崩、不可完全复现的工艺。方向相同,走三步就岔开。
第三层,他们优化的考试不同。 实验室不会对宇宙真理做梯度,他们对自己的内部评测集做梯度。Anthropic更盯长程agent、仓库级编码、知识工作、拒答是否得体;OpenAI更盯难数学、工具循环、计算机使用;xAI更盯每个字花出去的效率、Cursor真实会话、完成任务的单位成本;Google更盯多模态和延迟。榜单第一名会换,因为每家都在对自己的考卷特训。
第四层,模型外面的壳,经常比模型本身更决定胜负。 2026年用户用的不是裸模型,是Claude Code、Codex、Grok Build这类东西。同一权重,换一套工具策略、重试、记忆压缩、权限、停止条件,分数可以差一截。很多人把产品差距记到「模型智商」上,这会夸大模型本身的距离。
第五层,性格和对齐税。 这是体感差距最大、基准上最难看清的一层。Claude的宪法式对齐,让它更肯承认不确定、更少乱猜、更听长指令,也更容易拒——在高风险工作里像更聪明,在「帮我把这事办成」里像更笨。Grok少过滤、更敢继续,便宜、快,但文风和谨慎程度是另一种人。OpenAI走中间:工具生态最全,家族分层最完整。对齐不是免费的——安全、拒答、礼貌、不越权,都会吃掉一部分「看起来能干」。
预训练让大家站上同一座山。后训练、数据切片、评测目标和产品壳,决定你站在哪块岩石上。用户感受到的聪明差距,是岩石形状的差,不是山的差。如果一定要排优先级,2026年头部之间的差距大概是:后训练与奖励设计最大;然后是数据独特性和配比;他们真正优化的内部考卷;Agent脚手架和推理时策略;对齐立场带来的性格税;纯参数和预训练算力仍重要,但已不是把第一和第二拉开的主因。
方向一样,不代表损失景观一样。所有人都在「预测加强化学习」这条路上跑,但奖励函数写的是不同的人——Claude被训成谨慎的资深同事,Astra被训成硬题突击手,Grok被训成便宜、敢继续的工程助手。它们都聪明。聪明的定义,已经被各家写进了自己的奖励里。
六、怎么读马斯克的台阶
尺子有了,回头读马斯克。
他今天画的不是「我们马上全面第一」,是一条降了调的台阶。
这和几周前不一样。八月中旬他说过,Grok 4.7有很大机会超过当时所有模型。今天改成:对标Opus 5.0,不是5.1。中间发生了两件事:Fable 5.1和GPT-6 Astra已经上市;4.7自己卡在强化学习上延期。他是在用新地图改口,不是突然更谦虚。
所以有人转帖说:4.7延期,是因为它已经是Fable 5.1、Astra那一档;4.8会超过Anthropic和OpenAI现在的非公开模型——有一半判错了。「4.7延期是因为已经是5.1、Astra那一档」——马斯克本人否定了,他说4.7够不到5.1,那一档留给4.9。「4.8会超过两家现在的非公开模型」——马斯克没这么说,4.8只是「明显好于4.7」;非公开的Mythos、实验室内部下一版,他根本没对标。
「公开同意给前沿定速,私下继续猛训」倒是把政治姿态和工程动作拆开了。达里奥那篇原文写得很清楚:pace不是停训,是发布前多留对齐和第三方评估的时间。马斯克回过「达里奥是对的」。同时4.8本周结束预训练,立刻进强化学习。公开同意的是「别裸奔发布」,不是「把下一档能力停掉」。
他真正有筹码的,不是「2.5万亿」这个数字,是四样东西:已经证明能打进窄带前沿(Grok 4.6贴着Sol和旧Fable);独特数据不对称(SpaceX工程和遥测、Cursor真实开发轨迹、X实时语料);集群和软件栈在补历史欠账(Colossus规模、新C++栈);迭代速度本身是一种压力。他没有的底气同样清楚:后训练还没过关;多模态他亲自认输;对手也在动——他把4.9对准「现在的」Astra、Fable,等4.9出来对面可能已经是下一版;预测有注水前科,日期多次滑。
按前面的机制读可信度:
他的底气是:算力、独特数据,和已经贴上前沿的4.6。他的水分是:把还没训完的强化学习,说成已经排好的名次表。这是一张「我们会按月爬台阶」的工程路线图,不是一张已经打完的成绩单。台阶本身合理。把尚未开始的强化学习,提前写成已经站上Fable、Astra,还太早。
2024到2026,大模型领先已经不是「谁参数大谁赢」。参数仍然是门槛——没有足够大的模型,再精的数据也堆不出这个量级的世界知识。但一旦大家都站上万亿级混合专家这个台阶,领先就开始变成:数据是不是更干净、更独特;强化学习会不会让模型愿意把难题做完并检查自己;软件能不能把万卡集群训满、训稳;推理时愿不愿意多花算力思考。
所以Grok 4.8的2.5万亿值得看。更值得看的是同一句话后半段:新软件栈,以及训练完之后的强化学习。那才是2026年决定它能不能从「更大」变成「领先」的部分。两点五万亿和C++栈,解决的是这座山能不能再往上修;它能不能超过Fable、Astra,仍然取决于强化学习会不会让它把难题做完,以及那些独特数据能不能补上别人已经占住的岩石。
人会停下来去做实验。模型被训练成把下一句话说圆。各家又用不同的奖励,把圆法写成了不同的人。马斯克今天不是在宣布已经赢了——他是在说:仓库更大了,脚手架换了,行为还没调完。仓库、脚手架、行为。三件里,现在最值钱的是第三件。他自己把4.7停在第三件上,其实已经把答案写在黑板上了。
真正值得等的,不是2.5T这个数字,是4.8进了强化学习之后出来的那个东西。到时候再看它会不会把难题做完、会不会检查自己、多模态修没修好。这三件事,比参数重要得多。
以上观点仅代表作者本人,不构成投资建议。