AI 科技观察

系列

算力之后

追踪计算、能源和网络如何成为 AI 竞争的底层叙事。

系列导读

先进封装、内存、网络与冷却部件组成的无人物算力成本工作台

基础设施

AI 到底贵在哪里

从正式训练运行一路拆到 HBM、先进封装、网络、折旧、利用率、推理调度和客户总拥有成本,解释 AI 的钱分别花在哪里,以及为什么单位价格下降并不保证总支出下降。

AI 科技观察18 分钟阅读

从第 1 篇开始阅读

文章目录

  1. AI 到底贵在哪里

    从正式训练运行一路拆到 HBM、先进封装、网络、折旧、利用率、推理调度和客户总拥有成本,解释 AI 的钱分别花在哪里,以及为什么单位价格下降并不保证总支出下降。

    18 分钟阅读

    阅读全文
  2. 算力扩张背后的电力秩序

    从电量与容量的差别出发,追踪发电、输电、并网、冷却与算力调度如何共同决定模型能否持续运行。

    16 分钟阅读

    阅读全文
  3. 算力堆到一起之后,瓶颈变成了网络

    机柜内每颗 GPU 有 1.8 TB/s 的互联带宽,跨出机柜的单端口速率是 800 Gb/s。从 scale-up、scale-out 到 scale-across,三层网络的落差决定了并行策略承受什么压力、以太网在 UEC 1.0 之后解决什么问题,以及跨数据中心训练能扩展到多远。

    19 分钟阅读

    阅读全文
  4. 买得到算力,买不到数据

    Google 一个月处理的 token 已是全人类公开文本存量的十倍以上。这个比较说明「数据不够」这四个字被混用了。数据约束分为存量、许可、生产、搬运四层:可训练文本按中位估计 2028 年见顶,但许可层的天花板已经先到;合成数据只在有验证器的地方成立;而在物理层,HDD 产能按日历年售罄,存力开始需要像电力一样提前锁定。

    20 分钟阅读

    阅读全文