当下,各家银行加速AI大模型布局,算力是其中的重点。而从AI算力方面来看,异构算力建设不仅是目前的主流方向和核心趋势,甚至已成为大模型算力基础设施建设的“默认选项”。
据悉,随着AI算力需求的快速增长,以及考虑到不同场景对算力的需求差异较大等因素,单一架构的芯片无法全面适配差异化需求,因此通过异构组合实现“任务与计算单元的精准匹配”成为必然选择。
值得一提的是,就在近日,招行关于异构算力建设的案例获得相关奖项,受到行业关注。
实现模型训练、微调和在线推理共享近10000张异构加速卡
据公开信息,在9月8日的KubeCon+CloudNativeCon+OpenInfra Summit+PyTorch Conference China 2026期间,云原生计算基金会(CNCF)宣布,招行获得CNCF最终用户案例研究大赛冠军。
据介绍,招行AI基础设施团队将Kubernetes与Kueue、KEDA、Prometheus、HAMi和Fluid相结合,构建了统一控制平面,让模型训练、微调和在线推理共享近10000张异构加速卡。
取得的成效为:通过与数据中心及其他团队的协作,招行将99%的加速计算资源纳入这一统一框架,使近万张加速卡的平均利用率从35%提升至60%以上;在可比的模型与服务条件下,每处理100万Token(输入与输出合计)的成本降低超过60%。
具体而言,随着AI应用不断推进,招行发现,训练、推理和多租户微调对同一套硬件提出了不同要求:分布式训练需要稳定、可预测的资源容量,但在等待其余工作节点或加速卡就绪时,已分配的资源可能处于闲置状态;在线推理则需要随着难以预测的流量快速扩缩容。
为此,招行构建了一套共享基础设施、解耦运行时的可组合架构:Kueue负责训练任务准入、队列和配额管理,避免任务在能够实际使用资源之前就预留容量;KEDA和Prometheus根据实时需求信号调整在线推理的规模;HAMi在训练和推理两条路径中以细粒度单元分配共享加速资源;Fluid则加速数据集、模型权重和检查点的访问,减少加速卡等待数据的时间。
此外,招行Twinkle训练框架则进一步提升多租户微调的效率,默认支持5个LoRA租户共享同一个基础模型实例。将基础模型副本从5个减少至1个,使这一配置下的加速卡资源使用量减少80%,训练密度提升至原来的5倍。
《智探AI应用》获悉,Twinkle训练框架已在几个月前发布。
2026年3月消息,招行信息技术部联合魔搭社区,正式推出全新训练框架——Twinkle,旨在构建一套兼具通用易用、高效训练与企业级服务能力的训练基础设施。
据彼时介绍,twinkle的架构由client和server两部分构成。其中client端包含两类client:一是符合twinkle调用API的客户端,其API和server端完全相同;二是对原生Tinker API兼容的客户端,这使得开发者可以直接使用Tinker API调用twinkle部署起来的后端训练服务。twinkle的server构建在更细粒度的原子训练组件上,这些组件基于PyTorch等基础算法库,并针对大模型场景进行了特殊优化。
而在6月,Twinkle 0.4.0版本发布。该版本主要围绕三条主线展开:扩展主流模型的训练覆盖范围;完善长序列、LoRA等复杂训练链路;完善昇腾NPU后端的关键算子与训练能力。其旨在让新模型接入更快,让复杂训练链路更稳,让训练框架在不同硬件后端上的可用性进一步提升。
此前自主研发并开源“统一AI算力调度平台”
事实上,招行此前多次对其AI算力相关基础设施进行了介绍。
2026年7月,招行表示,其自主研发并开源的“统一AI算力调度平台”入选CNCF发布的最新案例研究。
针对行业普遍面临的异构资源难统一管理、高性能训练资源难高效利用、中小任务则存在资源浪费等问题,招行通过技术优化,取得相关成果,包括“统一异构资源纳管”“首推超节点调度”“细粒度资源共享”“网络拓扑优化”等。
其中,关于异构资源纳管,架构管理团队将多种AI加速卡纳入统一资源池,上层应用无需关注底层硬件差异,平台运维复杂度大幅降低。
关于超节点调度,基于Device Plugin和调度器,实现国内主流超节点模组成对分配,避免单数卡跨模组导致的驱动异常,硬件入池率提升至100%。
据《智探AI应用》了解,在约半年前的3月,招行便宣布联合HAMi社区,首发适配AI超节点算力调度落地方案(超节点是指一种将多颗芯片通过高速互联组合成一个逻辑单元的硬件架构)。
HAMi作为CNCF开源项目,在解决异构算力卡的调度与切分方面有着不错的表现,并成为招行AI基础设施的关键组件,但在适配国内某主流算力卡超节点时,原生框架因硬件感知缺失、无法保障模组亲和性等问题,成为制约算力效率的瓶颈。
因此,招行与HAMi社区联手,基于开源版本进行增强,完成该算力卡超节点的适配。彼时的核心成果在于:
一是首次实现该超节点芯片拓扑信息的全量上报及高性能模组的成对分配等关键能力,在资源感知准确率与任务调度稳定性上,提供优于原生的解决方案;二是自主研发基于交换机域与直连邻居感知的拓扑亲和性调度算法,实现分布式训练任务计算单元的物理位置最优编排,减少跨交换机通信损耗。
事实上,招行曾在2025半年报中提到,构建领先的智算基础设施,通过底层技术创新持续提升模型性能和算力效能。因此能够取得目前的成果。
展开全文
- 移动支付网 | 2026/9/1 11:30:49
- 移动支付网 | 2026/9/1 9:03:46
- 移动支付网 | 2026/8/18 18:35:21
- 移动支付网 | 2026/8/13 9:10:00
- 移动支付网 | 2026/8/10 11:10:59
- 移动支付网 | 2026/8/5 8:51:06
- 移动支付网 | 2026/6/26 11:32:56
- 移动支付网 | 2026/6/12 18:58:00
- 移动支付网 | 2026/5/9 17:06:44
- 移动支付网 | 2026/5/6 10:22:41
- 移动支付网 | 2026/9/9 14:16:30
- 移动支付网 | 2026/8/24 11:16:04
- 移动支付网 | 2026/8/24 11:13:44
- 移动支付网 | 2026/8/21 14:31:56
- 移动支付网 | 2026/8/21 9:20:02





