巨头抢着宣布AGI来了,可“到没到”到底谁说了算?

这两天,AI圈又把“AGI”这个词喊炸了。
OpenAI 发了 GPT-6 Astra,官方口径是“代际飞跃”,电话会结尾还撂下一句:欢迎来到 AGI 时代。
Anthropic 也没闲着,甩出 Claude Fable 5.1,两家都在讲同一个故事:机器,追平甚至超过人类了。
热闹归热闹,有个问题被所有人默契地绕开——
AGI,到底是个啥?
通常的说法是“能在多个领域达到较高水平、完成复杂任务的通用智能”。可“多个领域”要多广,“较高水平”参照谁,系统遇到难题是自己扛还是得人搭把手——每一个环节,都缺一把统一的尺子。
一场终点会跟着参赛者移动的比赛,谁先宣布“赢了”,都可能胜在抢先,而不是货真价实。
DeepMind 的研究者提过一套分级框架,把能力的广度、水平和自主性拆开考:
能写代码、读财报、解科学题,说明覆盖面广;这些活儿能不能稳定干到专家级,是另一码事;更关键的是——没人盯着的时候,它能不能自己发现错误、重新规划、连轴转几个小时?
一个总要你纠错的模型,和一个能自己把活干完的系统,对一家企业来说,完全是两种东西。
所以你看,“是不是 AGI”正在变成一场定义权之争:谁出题、谁定及格线、谁握着评测权,谁就能左右大众对“机器多强”的判断,顺带影响资本的流向。
企业爱喊 AGI,不全是膨胀,背后有本商业账:一个标签,就能把一次产品升级讲成改变经济结构的大故事,融资、招人、客户预期都能借上力。
但掏钱采购的客户,买的从来不是标签,是活。
模型到底有没有帮你省下工时?干砸的时候会不会及时报错、及时止损?一份报告写得再顺溜,关键数字全得靠人逐项复核,那这份“流畅”就只值个安慰奖。
还有个更拧巴的地方:OpenAI 自己在 Astra 的安全文档里承认,模型越强,它的思考过程越难被监控。
越能自己干活的系统,也越像一匹脱缰的野马——跑得快,但难拉回来。
所以,别急着把“是不是 AGI”当成“值不值得用”。监管也一样,与其死磕一个谁也说不清的终点,不如盯着可观察的行为:它能执行哪些外部操作?搞砸了损失多大?人类能不能随时摁停?
技术是真的在进步,但“第一名”的名头,可以再等一等。
比谁先冲线更重要的,是让所有人都看清:机器到底多了什么本事,这些本事又该由谁来负责。
AGI 时代或许真的来了,但当务之急,是先给它立好规矩。