9月9日·星期三 12:07·来源:InfoQ

招商银行统一近万张AI加速卡:利用率从35%提至60%+、每百万Token推理成本降低60%

招商银行在KubeCon+CloudNativeCon+OpenInfra Summit+PyTorch Conference China 2026大会上,凭借其AI基础设施实践获CNCF最终用户案例研究大赛冠军。该行通过Kubernetes及Kueue、KEDA、Prometheus、HAMi、Fluid等组件构建统一控制平面,使模型训练、微调和在线推理共享近10000张异构加速卡,99%的加速计算资源已纳入该框架。数据显示,加速卡平均利用率从35%提升至60%以上,每处理100万Token的推理成本下降超60%。 架构上,Kubernetes作为统一底座,Kueue负责训练任务准入与队列管理,避免资源未齐备时提前启动;KEDA与Prometheus组合实现推理负载的弹性伸缩;HAMi用于异构加速资源的细粒度分配;Fluid加速数据与模型权重访问。在多租户微调场景,自研Twinkle框架允许5个LoRA租户共享同一基础模型实例,将基础模型副本从5份减至1份,加速器资源消耗降低80%,训练密度提高5倍。该行后续计划动态调整多租户训练并发度,并扩展KEDA使推理服务在无请求时缩容至零。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→