实体 · 技术
为机器学习工作负载设计的专用计算架构。
机柜内每颗 GPU 有 1.8 TB/s 的互联带宽,跨出机柜的单端口速率是 800 Gb/s。从 scale-up、scale-out 到 scale-across,三层网络的落差决定了并行策略承受什么压力、以太网在 UEC 1.0 之后解决什么问题,以及跨数据中心训练能扩展到多远。
从正式训练运行一路拆到 HBM、先进封装、网络、折旧、利用率、推理调度和客户总拥有成本,解释 AI 的钱分别花在哪里,以及为什么单位价格下降并不保证总支出下降。