智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 2024年Q4,AWS SageMaker团队内部有个数据:客户因为GPU容量不足导致的模型评估延期,平均每次损失12个工作日。这不是算力不够,是算力来得不是时候——
假设你负责一个LLM选型项目。两周内要跑完6个微调模型的对比评测,需要ml.p5.48xlarge实例不间断运行。但所在区域的按需容量在高峰时段完全不可预测——上周三下午你尝试部署,排队47分钟才拿到实例,基准测试的中断让团队多熬了一个通宵。
训练计划的做法是提前锁定。你指定实例类型、数量、起止时间,系统返回一个可用报价。接受后,这段容量被预留,生成一个ARN(Amazon资源名称)。部署推理端点时,在配置里引用这个ARN,实例就从预留池里出,而非按需池。
AWS文档里有个细节:搜索可用容量时,target_resource参数设为"endpoint"是关键。这个字符串决定了预留的P系列GPU专门用于推理负载,而非训练作业。混用会导致部署失败——预留了训练用的容量去部署端点,系统会拒绝。
整个流程被拆成四个环节。搜索阶段用search-training-plan-offerings API,输入实例类型、数量、期望时段,返回可匹配的容量报价。创建阶段确认报价,生成具有唯一ARN的预留凭证。部署阶段在CreateEndpoint或UpdateEndpoint时引用该ARN。最后是管理阶段:查看预留状态、调整(部分属性可修改)、或到期自动释放。
有个设计值得注意:预留一旦创建,费用即开始计算,无论你是否实际部署了端点。这和EC2 Reserved Instances的逻辑一致——你买的是「容量保障」,不是「使用券」。换句话说,锁了7天只用了3天,钱照付7天。
定价层面,训练计划的费率介于按需和Savings Plans之间。AWS没有公开具体折扣数字,但文档暗示「显著低于按需」。对于需要确定性胜过成本优化的场景(比如赶论文截止、客户演示、合规审计),这个溢价是可接受的。
SageMaker的产品演进有个清晰脉络。2023年训练计划上线时,大模型训练是GPU争夺的主战场。但2024年的客户数据变了:推理端的容量焦虑同样严重,尤其是两类场景——限时生产测试(比如黑五前的压力验证)和burst负载(营销事件触发的流量尖峰)。
AWS的应对不是扩增按需池,而是把现有预定机制做场景延伸。技术改动其实很小:增加target_resource="endpoint"的校验逻辑,调整调度器的资源分配策略。但产品意义很大:它承认了「推理也需要确定性」这个被忽视的需求。
一个对比:GCP的Custom Job预约和Azure的Capacity Reservations都支持推理场景,但AWS的训练计划是唯一把「搜索-比价-锁定」做成完整产品化的。其他两家更多是工单驱动或API裸调。
第一,搜索窗口的弹性。你指定「1月下旬开始,持续7天」,系统可能返回1月20-27或1月23-30的选项。如果评测必须衔接某个固定日期(比如客户现场演示),需要预留调整余量。
第二,实例类型的锁定。预留时指定 ml.p5.48xlarge,就不能中途换成 ml.p4d.24xlarge。模型评测过程中如果发现显存不足,只能取消原预留、重新搜索、承担窗口错位的风险。
第三,ARN 的引用位置。必须在 EndpointConfig 的 ProductionVariants 里指定 TrainingPlanArn,而不是在 CreateEndpoint 时传入。很多用户第一次部署时会搞混这两个 API 的参数层级,导致预留了容量却走了按需池。
AWS解决方案架构师在 re:Invent 2024 的演示中提到了一个客户案例:某金融科技公司用训练计划锁定 P5 实例做监管模型验证,把原本因容量波动导致的 3 周延期压缩到 9 天。节省的时间不是算力更快,是「等待算力」的时间被消除了。
训练计划目前支持的区域有限,北美和欧洲部分区域已上线,亚太区域逐步扩展。预留的最短时长是1天,最长182天,以UTC时间计算。跨预留期部署端点会导致冷启动失败——系统不会自动续期,需要人工创建新的预留并更新端点配置。
如果你的团队正在评估是否采用,有个简单判断标准:过去6个月里,因GPU容量不足导致的项目延期是否超过2次?或者,是否有必须在固定日期完成的推理密集型任务(如季度模型审计、合规压力测试)?两者满足其一,训练计划的确定性溢价就值得考虑。
最后一个细节来自AWS文档的更新日志:2025年1月的版本首次在「目标资源」参数的描述里,把「端点」和「训练作业」并列为同级选项。这个措辞改动比功能上线晚了约8周——产品团队显然在观察早期采用者的反馈,再决定是否正式官宣。
