实体 · 技术
以大规模数据训练、用于理解和生成语言内容的机器学习模型。
Google 一个月处理的 token 已是全人类公开文本存量的十倍以上。这个比较说明「数据不够」这四个字被混用了。数据约束分为存量、许可、生产、搬运四层:可训练文本按中位估计 2028 年见顶,但许可层的天花板已经先到;合成数据只在有验证器的地方成立;而在物理层,HDD 产能按日历年售罄,存力开始需要像电力一样提前锁定。