
凌晨,OpenAI 终于把憋了许久的 GPT-6 Astra 放了出来。
总裁布洛克曼淡淡补了一句:欢迎来到 AGI 时代。
先别急着沸腾。往回调 72 小时,这已经是第五家交卷的了。
三天,五家,集体放“大招”。
9 月 1 日,Anthropic 发 Claude Fable 5.1 和 Mythos 5.1。编程跑分直接翻倍,号称“面向编程和知识工作的最强模型”。Mythos 更是不对个人开放,只给“可信访问”计划。
9 月 2 日,谷歌连发两款:Gemini 3.8 Flash 和针对网络安全的 Cyber。价格一分没涨,软件工程能力厚了一截,离上一次更新才隔三周。
同一天,Meta 的 Muse Spark 1.3 也上线,死磕长周期 Agent 任务。
中国这边,阿里抬出了“Qwen 家族最强”的 Qwen3.8-Max,主打的还是编程和办公。
把时间轴再拉长:8 月底腾讯混元 Hy4 preview,8 月中智谱 GLM-5.3 说编程比上一代强 50%,7 月 Kimi K3 的编程测评一度干翻 Fable 5。
两个多月,神仙打架;最近三天,神仙集体下场。
可翻来翻去,这场混战里永远有一个雷打不动的名字:编程。
为什么?
说穿了很简单:代码,是最好验收的活。
写篇文章、做个设计、给个建议,好不好,你说你的、我说我的。代码呢?能不能编译、测试跑不跑得通、bug 修没修完,跑一遍全见真章。
AI 落地喊了一年,编程是第一个真正能“验货”的赛道。
更要注意的是,战场已经变了:从前是生成代码,现在是交付任务。
以前你让它写个函数。现在你要它钻进你的软件,自己动手、自己跑测试、发现问题自己改,把一整条活干完。GPT-6 Astra 就是这么干的。
这也正是各家真正的分歧点。
Anthropic 押长:长期复杂编程的可靠性,顺便把 Agent 编程的成本打下来。谷歌在补课,拼命刷迭代速度;Meta 想让模型听懂复杂上下文、调用工具,一口气跑完一条长工作链。
中国厂商想得更实际:编程强了,付费模式才走得通——开发者和 B 端,才是真愿意掏钱的人。
更有意思的是编程的“外溢”。
智谱被追问“编程三连问”,答案是:先把编程练到能发现网络安全漏洞,再慢慢迁移到数据分析、法律、金融。他们的路线图写得很直白:Chat → Coding → Agent → Co-work → Autonomous AI。
换句话说,编程是一把钥匙,后面一串门都得靠它开。
所以,别把这三天的狂欢当成又一次刷榜。
这是把“编程”这顶皇冠,焊死在 AI 王座上的三天。
而真正的恶战,可能才刚刚开始。
留言 0
还没有留言,快来抢沙发