
别再把目光只盯在模型上。
杰富瑞最近把中美八款AI智能体拉出来实测,结果有点反常识:阿里千问办公拿了95分,全场第一。可它模型本身的智能分,只排第四。
真正拉开差距的,是那些看不见的”脚手架”——业内叫Harness。
模型是发动机,Harness是整车。发动机再猛,装在拖拉机上,也跑不过装了普通发动机的跑车。
这次实测里,腾讯Workbuddy访问量中国第一,但Harness环节得分垫底。流量大,不等于活儿干得漂亮。
为什么Harness这么关键?
因为智能体早不是”你问一句、它答一句”的聊天工具了。它要自己规划、调用工具、读网页、写代码、反复试错,把一个完整任务跑完。
这个过程里,模型只负责其中一环。怎么拆解任务、怎么调用工具、出错怎么回退——全看Harness的功底。
就像开饭店,大厨手艺再高,后厨流程乱成一团,上菜照样慢。
这也解释了行业里一个怪现象:模型越强,价格战反而越凶。DeepSeek涨价、OpenAI降价,大家抢着重排定价。
原因就在这——Agent工作流里,模型从”一次请求”变成了”几十次调用”。低端模型干杂活,高端模型保溢价。
一句话:模型不再是唯一的主角。
对普通用户和企业的启示很简单:别再纠结”哪个大模型最聪明”。选智能体,先看它顺不顺手、跑得稳不稳。
工具好不好用,从来不只是看那颗最亮的引擎。
留言 0
还没有留言,快来抢沙发