文|超聚焦
字节想在大模型上后来居上,光堆GPU可能已经不够了。
据智能涌现报道,字节跳动近期成立新的一级部门“AI数据与安全”,与Seed、Flow、抖音等部门平行。与此同时,原AI数据与安全负责人傅越将于近期离职,其位置由原TikTok平台责任团队负责人王赢磊接任。
单看这件事,像是字节又一次普通的组织调整,但时间点有点巧。
近日,金融时报援引三位知情人士报道称,字节正在预训练一个参数规模最高可能达到10万亿的超级AI模型,目前仍处于早期阶段,最终模型规模将在后续训练阶段才能确定。如果最终做到这一规模,它将成为全球参数量最大的AI模型之一。
相比目前主流大模型,这已经不是简单地把模型“做大一点”,而是在继续往Scaling的极限上下注。
模型越大,需要填进去的就不只是GPU了。
字节这次成立的“AI数据与安全”,并不是凭空多出来一个部门。
智能涌现消息称,新部门的前身之一,是傅越在2023年成立的Global Data。这个百人左右的团队最早服务Dola、TikTok等国际业务,后来逐渐开始承担Seed模型训练的数据采购和质量管控。
后来,随着字节大模型业务越铺越开,围绕数据的团队也越来越多。
除了Global Data,集团数据中台DMC、Flow旗下AI数据平台AIDP,以及Seed内部不同模型方向,都陆续建立起自己的数据团队。它们服务的对象不同,做的事情却越来越接近:采购数据、组织标注、搭建数据集,再负责模型训练后的评测和质量控制。
结果就是,同样是给大模型准备数据,字节内部却逐渐长出了好几套班子。
今年以来,字节开始重新整理这套体系。原本分散在不同业务线的数据团队被陆续收拢,最终组成新的“AI数据与安全”部门,并直接升格为一级部门,与Seed、Flow、抖音等平行。
但从字节在数据上堆的人和钱来看,这次升格也不算突然。智能涌现此前披露,仅Seedance的数据评测团队就有上千人,一名算法工程师背后,往往对应十余名数据人员;今年字节在世界模型和Coding等方向的数据预算也已经达到千万美元级,而且还可以继续追加。
这已经不是过去找几家外包公司做标注的生意了。从数据采购、清洗、合成,到模型评测、质量控制,数据正在变成和算法、算力一样需要单独组织、持续投入的一套工程。
更关键的是,字节还主动给自己堵上了一条近路。
8月5日,据The Information报道称,张一鸣在约一个月前举行的Seed全员会上明确反对通过蒸馏外部模型来追赶。报道援引知情人士称,张一鸣认为,字节应该愿意“为长期目标牺牲一些短期利益”,即使Seed阶段性落后,也不应依靠蒸馏竞争对手模型来补差距。
一边奔着5万亿甚至10万亿参数去,一边又不想直接抄别人模型的答案,字节只能自己准备更多“教材”。
而现在,找教材这件事已经不只是字节自己的麻烦了。
字节遇到的问题,其实也是所有还想继续Scaling的大模型公司正在面对的问题。
过去几年,大模型变强的办法简单粗暴:更多参数、更多算力,再喂进去更多数据,但这三样东西并不是无限的。
2022年DeepMind在著名的Chinchilla论文中发现,如果希望在既定算力下把模型训得更充分,模型参数和训练Token不能只涨一个。按照其当时给出的经验规律,参数规模翻倍,训练数据量也应该同步增加。
问题是参数可以继续堆,GPU也可以继续买,互联网上人类写出来的好东西却是有限的。
研究机构Epoch AI曾估算,在考虑质量和重复利用之后,全球公开的人类文本大约相当于300万亿Token。
按照大模型训练数据规模过去的增长速度,这批数据可能在2026年至2032年之间被充分利用;如果模型为了降低推理成本而进行更长时间的“过度训练”,这个时间还可能提前。
公开互联网不够吃,大模型公司只能开始往围墙外面找。
最先被盯上的,是那些过去很难被大规模抓取、或者压根不免费的内容。论坛、新闻网站、付费出版物、专业数据库,甚至没有数字版本的实体书,都开始被重新标上价格。于是,过去靠爬虫解决的数据问题,越来越变成了一门采购生意。
2024年,Google与Reddit签下每年约6000万美元的内容授权协议,用于AI模型训练;同年,OpenAI又与News Corp达成多年合作,将华尔街日报、泰晤士报等旗下媒体的历史和实时内容纳入可使用范围。
但花钱买现成数据还只是第一步。
当新闻、论坛这些相对标准化的内容也被大厂瓜分后,更专业、更稀缺的数据开始需要专门找人生产。代码、数学、科学等领域,大模型公司开始直接雇佣工程师、博士和行业专家参与训练数据生产与评测。
再往下,甚至连“买”都买不到了,Anthropic最后干脆把手伸向了实体书……
今年1月,华盛顿邮报根据法院解封文件披露,Anthropic早在2024年就启动了一个内部代号为“Project Panama”的项目。而Project Panama干的事情也非常简单粗暴:买书、切书、扫描。
Anthropic批量采购了数百万册实体书,再用液压切割设备直接切掉书脊,把散开的书页送进高速扫描仪,数字化之后再将原书回收处理。项目启动大约一年时间,Anthropic为此花掉了数千万美元。内部文件甚至把目标写成了,要“破坏性扫描全世界所有的书”。
更夸张的是,在Project Panama之前,Anthropic还曾从LibGen等影子图书馆下载数百万册盗版书籍,这也成了后来Anthropic被送上法庭的直接原因。
2025年,法院认定使用书籍训练AI本身可以构成合理使用,但Anthropic保存超过700万册盗版书籍建立“中央图书馆”的行为面临侵权风险。为了结束集体诉讼,Anthropic最终同意支付15亿美元和解;今年7月,美国联邦法院正式批准了这笔协议,它也成为已知规模最大的美国版权诉讼和解之一。
从这个角度看,Anthropic那15亿美元的和解金,反而像是给高质量数据标了一个极其夸张的价格。毕竟,书可以买,版权可以买,专家也可以花钱请,但真正没被模型吃过、又足够好的数据,并不会随着参数一起凭空长出来。
这也是字节现在最麻烦的地方。一边是最高10万亿参数的模型计划,一边是不靠蒸馏走捷径,模型要继续往上Scale,最后还是得回到一个最朴素的问题:拿什么数据去喂。
哪怕10万亿参数还只是计划,但数据已经先成了字节必须单独下注的一门生意。