Grok 4.6

Grok 4.6 上线了。

离上一代 4.5,只隔了一个月。

最反常的一点:上下文窗口没变,还是 50 万 token。

隔壁都在卷 100 万、200 万,马斯克却把窗口冻住了。

那这一个月,xAI 在忙什么?

一句话:让模型”坐得住”。

什么叫坐得住?

扔给你一个代码库,能不跑偏,从头啃到尾。

给你一个陌生领域,能一步步查下去,不半路换题。

给你一个粗糙原型,能反复打磨,直到它真能跑起来。

官方管这叫”长程任务连续性”。

说白了,不是读得多,是坚持得久。

训练上,这代也换了打法。

拿 4.5 重新生成训练轨迹,跨推理强度、跨 Agent 框架、跨领域。

结果就是,模型开始自己检查作业了。

跑一段,自己验一下,不对再回头改。

这种”自我测试和验证”的倾向,比堆参数有意思得多。

跑分呢?

AA Intelligence Index 61 分,和 GPT-5.6 Sol Max 打平,离榜首 Fable 5 只差 1 分。

没屠榜,但每一项都比 4.5 强。

这才是重点。

过去一年,大家比的是”窗口能开多大”。

现在 Grok 把窗口按住,转头去比”能不能把活干完”。

因为 Agent 时代,真正的门槛变了。

能读 100 万字,读到第 3 万就忘了开头要干嘛,没用。

只能读 50 万,但能从头跟到尾,把任务闭环,这才是能交付的。

窗口是输入能力,坐得住是执行能力。

Agent 要的是后者。

还有个细节:一个月一代。

模型发布已经从”登月”,变成”发补丁”。

你压箱底的那个”最新模型”,下个月就旧了。

对做产品的人来说,真正要练的不是追新模型,是把模型当零件,随时能换。

马斯克这步棋,信号很清楚:

下一张入场券,不是谁窗口大,是谁坐得住。