当模型训练和推理同时增长,数据中心的瓶颈不再只是芯片数量。电力供应、散热能力、网络带宽和任务排队会一起决定一套系统能交付多少有效算力。
这意味着“增加 GPU”越来越像一个局部答案。真正需要优化的是一个动态系统:在不同时间,把不同任务放到最适合的资源上。
调度会变成产品能力
训练任务可以等待更长时间,实时推理却必须在延迟预算内完成。不同任务对电力和网络的需求也不一样。基础设施团队需要把这些差异转译成调度规则。
未来的 AI 平台会更像一个能源和计算的联合调度器:它不仅问“还有多少卡”,还要问“现在运行什么最划算”。
当成本、碳排和交付速度被放进同一张表,数据中心运营就不再是后台的工程细节,而是模型产品的一部分。
