AI数据标注工作场景

8月25日,亚马逊扔出一颗不大不小的炸弹:用了21年的众包平台 Mechanical Turk(MTurk),要关了。9月30日生效。

很多国人可能没听说过这个名字。但你训练AI用的数据,大概率间接经过它。

2005年上线,贝佐斯当年给它起外号,叫”真人版AI”。

翻译过来就是——计算机搞不定的脏活累活,挂到网上,让真人干。给图片打标签、给句子分类、判断一个商品评论是好评还是差评……一单几美分几美分地算。

巅峰期,平台注册工作者超过50万人。他们自称”Turker”。

AI能看懂猫、读懂话、答对题,背后就是这样一群人,一张图一张图、一行字一行字喂出来的。

最绝的转折,来了。

现在还在平台上的Turker,很多人已经开始用AI干活:让大模型批量生成答案,再转交上去交差。

瑞士洛桑联邦理工2023年做过研究:摘要类任务里,33%到46%的Turker,已经在用大语言模型自动生成了。

翻译成人话:人,把训练AI的活儿,外包给了AI。

平台收上来的所谓”人类判断”,其实是AI生成、真人转手。一座叫”人工”的桥,两头都被AI拆了。

AI数据标注员

MTurk不是孤例。

Scale AI、Mercor、Prolific……一批估值惊人的数据公司,正用更高效的方式,做同一件事:让AI自己训练自己。

这或许是整个行业最冷的地方——教AI认字的第一批打工人,成了AI时代最先被裁掉的那批”技术工种”。

但故事还有下一句。

有媒体点破:这场剧变,没有削弱人类数据的价值,反而让真实、干净、AI造不出来的数据,变得更稀缺了。

想想就明白:当网上到处是AI生成的文本、AI标注的答案,谁还分得清,哪些判断来自真人?

MTurk落幕了,问题没落幕:当AI开始标注AI,数据的”人味”谁来保证?

真人的判断,可能正在重新变成最贵的东西。