
Grok 4.6 上线了。
离上一代 4.5,只隔了一个月。
最反常的一点:上下文窗口没变,还是 50 万 token。
隔壁都在卷 100 万、200 万,马斯克却把窗口冻住了。
那这一个月,xAI 在忙什么?
一句话:让模型”坐得住”。
什么叫坐得住?
扔给你一个代码库,能不跑偏,从头啃到尾。
给你一个陌生领域,能一步步查下去,不半路换题。
给你一个粗糙原型,能反复打磨,直到它真能跑起来。
官方管这叫”长程任务连续性”。
说白了,不是读得多,是坚持得久。
训练上,这代也换了打法。
拿 4.5 重新生成训练轨迹,跨推理强度、跨 Agent 框架、跨领域。
结果就是,模型开始自己检查作业了。
跑一段,自己验一下,不对再回头改。
这种”自我测试和验证”的倾向,比堆参数有意思得多。
跑分呢?
AA Intelligence Index 61 分,和 GPT-5.6 Sol Max 打平,离榜首 Fable 5 只差 1 分。
没屠榜,但每一项都比 4.5 强。
这才是重点。
过去一年,大家比的是”窗口能开多大”。
现在 Grok 把窗口按住,转头去比”能不能把活干完”。
因为 Agent 时代,真正的门槛变了。
能读 100 万字,读到第 3 万就忘了开头要干嘛,没用。
只能读 50 万,但能从头跟到尾,把任务闭环,这才是能交付的。
窗口是输入能力,坐得住是执行能力。
Agent 要的是后者。
还有个细节:一个月一代。
模型发布已经从”登月”,变成”发补丁”。
你压箱底的那个”最新模型”,下个月就旧了。
对做产品的人来说,真正要练的不是追新模型,是把模型当零件,随时能换。
马斯克这步棋,信号很清楚:
下一张入场券,不是谁窗口大,是谁坐得住。
留言 0
还没有留言,快来抢沙发