AI科学家

搞科研最难的是什么?

不是做实验,是想出”该做什么实验”。

一个靠谱的假说,要懂文献、通机制、还得够新。一个团队憋几个月,能想出几个就不错了。

谷歌DeepMind觉得,这事AI能干。

他们给AI配了一整个”研究团队”,叫Co-Scientist。八月底它又升级了:不光会出主意,还会自己规划实验、操作设备、分析结果、写论文。

一句话:AI科学家,从”动嘴”变成了”动手”。

它怎么想点子?

内部好几个AI各司其职:一个负责提想法,一个负责挑毛病,一个负责打分排序,一个负责把好想法再进化一轮。谷歌管这叫”想法锦标赛”,玩法是从AlphaGo那借来的。

升级之后它能干什么?

材料科学里,它找出了更安全的合成路径,还直接操控设备,三种半导体薄膜一次成功,配方从几天压到几分钟。

生物学里,它自己搭了一套图像分析流程,预测的菌落形状,跟实验室真实结果对上了仨。

计算机科学里更狠:全程没人插手,它自己设计了一个医疗AI架构,自动评测里干翻了GPT-5和Claude Opus 5。

最值钱的进步,是治”编数据”。

AI做科研最招人烦的,就是一本正经胡说八道。早先有些系统,编造率高达80%到100%。

谷歌这次加了个”验证模块”:每个数字,都拿代码实际运行结果去核对。编造的、抄袭的,都要扣分。

结果:关键结果编造率,从46%降到了4%。对照组系统是90%。完整编出来的假数据,Co-Scientist一次都没出过。

不过,也别神化它。

三个医生对它做的医疗AI做了盲测,九个维度里,它只在”降低有害回答”这一项上明显赢。

自动评测的高分,跟真人医生的判断,相关性并不高。

这说明什么?

AI做科研,正在从”会想”走到”会做”。但”可信”这两个字,还得靠人盯着。

验证模块再强,也只是把坑填平了一半。想靠AI彻底取代科学家的判断,还早得很。

能确定的是:以后搞科研的人,真的多了一个”读完了所有文献、还不知疲倦”的同事。