Token精算时代已来!银行业如何管好每一枚Token?
移动支付网 2026/8/24 11:16:04

今年3月,国家数据局将Token中文名定为“词元”。同月在英伟达GTC上,黄仁勋首次提出了“Token经济学”(Token Factory Economics)概念。他认为Token是AI推理时代的基础度量衡和计价单位,就好比电量用“度”来衡量,石油用“桶”来衡量,那么算力消耗的多少,则使用Token来衡量。

这个定义的意义远不止于技术命名,更在于,每一枚Token都开始计价了。

放眼千行百业,Token消耗量正吞噬掉各大小企业的利润。对于银行业而言,这个趋势尤为突出。公开数据显示,招商银行日均Token消耗330亿,微众银行200亿,邮储银行及工商银行双双破百亿,这动辄百亿级的Token消耗量,如果按照目前主流大模型的推理均价估算,头部银行一年就是亿元级别的算力成本支出。

在银行整体利润增长放缓的大环境下,运营成本管控也逐渐收紧,行业不得不开始反思,这Token花的值不值?如何管好每一枚Token,稳稳吃上AI时代红利的同时,又能避免无效Token消耗拖累财务报表?

PNC金融服务集团CEO Bill Demchak那句警示犹在耳畔:“任何AI对银行生产力的提升,都可能被Token成本吞噬。”

是的,银行业正式步入了Token精算时代。

巨量Token消耗背后的算账焦虑

据经济观察网报道,今年6月底,某中型银行上半年工作总结会议上,高层领导点名批评部分智能体效果欠佳。该行IT部门主管透露了两个典型案例,财富管理智能体日均Token消耗量超2亿,但在面向千人千面的服务时,回复内容同质化严重;小微信贷风控智能体日均Token消耗超3亿,信贷评分却过度依赖抵押物评估,没能为小微业务拓展新的价值。

该行2026年上半年大模型日均Token消耗量突破50亿,单日算力支出5万元,上半年Token直接费用累计约900万元,占该行上一年度IT总预算的8%。

依据德勤及全球头部创投机构的TCO测算标准,计入算力硬件基建折旧、模型迭代、人才薪酬等间接投入成本,AI投入的总成本可达Token直接费用的3-4倍,如此估算下来,该行全年AI投入规模约为5400万-7200万元。

中型银行年营业收入平均水平在1500亿元左右,那么前述的AI整体投入则仅占营收的万分之四,绝对值看似微不足道,但却吞下了全行科技预算的8%。这样的成本结构差异令人咋舌,可见Token成本管控已不是单纯的技术问题,更是财务问题了。

中国银行行长张辉曾明确表示,要“避免因为人工智能是热点就一哄而上”,并提出要构建涵盖研发成本、推广成本、运营成本、安全成本四个维度的价值度量体系,坚持“先明确业务需求再开展研发”,优先运用开源模型或成熟模型进行本地化部署。

从行业趋势看,银行采购逻辑正发生根本性的转变。神州信息AI创新中心概括为三阶段演变:2025年上半年DeepSeek引发“算力焦虑”,银行纷纷采购服务器;2025年下半年话题转向“智能体”和“场景”;到了今年,大家开始追问“ROI”。

正如本文开篇所提,百亿级别的Token消耗量,以及亿元级别的算力成本支出,共同推动银行业对Token消耗的态度趋向理性化。建立Token经济度量机制,势在必行。

招商银行的Token度量体系:业务端积极,开发端审慎

迄今为止,国内最为完整公开的银行业Token度量体系,非招商银行莫属。

招行CIO周天虹在2026年6月股东会上披露,截至2026年5月,招行以“业务端积极、开发端审慎”的落地策略,日均消耗Token330亿,其中用于大模型编程的算力只占 5%,其余绝大部分来自业务部门的经营管理场景。

具体成效如何?零售端的“RM小助”智能体推动了人均有效触客次数提升14%,客均交易规模提升20%;对公端小企业尽调报告编写82%的工作量由大模型替代,在线风控平台审批对公信贷规模近6000亿元,同比增长44%。这些数据说明了,当AI嵌入业务流程时,其释放的价值是很可观的。

但比起成效,招行的Token度量体系更具参考价值。

早在提出“AI First”前,招行就搭建了一套成本收益体系:从银行和客户的两个视角,以人效提升、采购替代、风险控制、业务增长等6个维度进行度量,再通过业务+科技联合评估,按6个维度综合打分划分高、中、低价值工作项,最终将算力、研发人力向高价值场景倾斜。目前,全行高+中价值场景智能化覆盖率约70%,大模型成本收入比约20%,即每投入20元就创造100元收益。这是行业内为数不多能两处“转化率成绩单”的样本。

然而,在实际执行中,全行不同业务条线对“收益”的界定存在明显差异:有的关注人力工时节省,有的紧盯客户转化率,有的则仅统计系统调用量。这种不统一,使得跨场景的投入产出对比变得困难。此外,评估较大程度依赖人工填报,也将致使数据的可信度与时效性难以保障,导致部分高潜力项目因短期数据不明显而无法获得持续投入,而另一些低效项目却可能因“过程数据好看”继续占用宝贵的算力资源。

周天虹也坦言:成本端可以实现精准核算,但收益度量受业务价值链影响复杂度高,归因难度大,仍在持续优化度量算法与数据质量。

跨界Token精算管理:各有特色,各展千秋

跳出银行业,在互联网、保险、科技基础设施等领域,对于Token成本管理上,各自形成了一套行之有效的打法。

1.互联网公司的“两道闸门”:从统一收口到智能路由

今年7月,深信服AI算力网关成功入选《2025年人工智能应用典型案例名单》,其核心思路在于“统一收口、精细配额”:

统一收口,控总量。在业务系统与外部模型API之间建立统一管控层,按部门、项目设定调用配额,当调用量偏离基线时触发告警,临近预算上限时实施智能拦截,从而实现把算力留给高价值业务,避免无效 Token 消耗。

精细配额,优结构。通过智能路由引擎能力优化算力调用结构,实现降本不降智,简单的任务调度经济型模型处理,而复杂任务则调用高端大模型保障业务效果。深信服云AI总架构师贾毫杰曾表示,一家2000人研发团队的企业,在通过该网关的智能路由引擎将简单请求自动分发至低成本模型、复杂请求交由旗舰模型处理后,每月外部模型调用费用从40万元降至20万元,降幅达50%,且服务质量未受影响。

“控总量”解决“花超了”的问题;“优结构”解决“花亏了”的问题。对于银行而言,统一网关解决的是分散调用、重复调用等管理问题,智能路由引擎则提供了在模型选型层面优化成本的具体路径。

2.保险业的“ROI锚定”:高频场景的投产双收

平安集团2025年通过AI技术实现产险反欺诈理赔拦截减损超百亿元,AI坐席覆盖约80%客服总量;中国太保通过智能化体系推动代理人产能提升15.7%,实现了AI投入与业务价值的深度绑定。

这些数据背后有一个共同逻辑:将算力资源优先配置于“高频、标准化、可量化、风险可控”的场景,同时从“节省了多少成本”“拦截了多少风险”“提升了多少收入”三个维度综合评估AI价值。

从银行角度出发,零售风控、反欺诈、智能催收等场景具有类似的属性,比如风险拦截的直接经济效益可以量化,值得在算力分配中优先保障。

3.科技大厂的“极致优化”:让每张GPU每时每刻充分跑满

GPU资源浪费一般来自两个维度,一是时间维度上的昼夜峰谷波动,腾讯云的“潮汐调度”则利用推理任务白天负载较高、训练任务夜晚负载较高的峰谷错位特征,通过调度系统将白天空闲的训练资源用于推理、夜晚空闲的推理资源用于训练。结果令人惊喜:夜间资源利用率从约30%提升至90%以上。

二是空间维度上的粒度过粗,传统的方案中,单个微小任务也要独占整张GPU,导致碎片化浪费。腾讯云则通过qGPU做GPU细粒度切分,一张物理GPU可以同时承载多个任务,按算力显存进行弹性分配,同时配合训推混布、大小模型混布,消除卡内资源孤岛。

腾讯云运营商解决方案总经理张晋介绍称,在核心推理集群高强度业务混布实测中,通过时间+空间上的极致优化后,GPU综合满载率由传统方案的30%提升到85%,利用率翻倍,算力不再大面积空转,集群运营TCO节约50%左右。

4.SaaS的“混合路线”:拒绝All-in旗舰模型

旗舰模型,也就是AI厂商能力最强、参数最大、效果最好的模型,但成本也是最高的,就好比品牌的顶配旗舰手机。显然,如果单一依赖旗舰模型则很可能导致成本失控,因此,SaaS行业选择了“混合路线”。

旧金山AI初创公司Lindy面向用户流量全部切DeepSeek-V4,内部则使用Claude Opus作为少量高难度边缘任务的后备兜底模型,Lindy CEO Flo Crivello采访时表示,完成切换后一年省下数百万美元。这就是典型的跨模型选型混合策略。

也就是说,并非所有场景都需要调用最强大的旗舰模型。普通业务如内部知识库问答、文档摘要等,可以选择高性价比模型;而复杂场景比如信贷审批、合规审查等,要求容错率低,必须精准严谨,才有必要调用旗舰模型。这不仅能显著降低Token消耗,还能有效提升响应速度。

这对银行提出的核心要求是:建立对不同场景的“模型-任务适配”评估能力,即判断某个任务的最低模型能力门槛在哪里,从而在效果与成本之间找到平衡点。

银行可实施方略:构建业技财”融合的精细化运营体系

Token 精细化管理是科技、业务、财务三方在治理、度量、技术、调度、合规上的系统协同。结合前文行业实践与《关于银行业保险业人工智能安全开发应用的指导意见》(以下简称《指导意见》)要求,可拆为五层闭环:

1. 治理层:董委统筹+业技财联合评审,源头掐断无效Token

根据国家金融监督管理总局《指导意见》要求,由董(理)事会指定专门委员会统筹AI治理,建立跨业务、科技、数据的协同机制。

在此监管框架基础上,银行再引入财务维度,构建业务、科技、财务、数据四方联合评审机制,厘清AI项目的真实业务需求与预期收益,对Token消耗进行预算与全口径TCO测算。新项目可先进行小范围试点,经过数据验证后再分步扩围;运行中持续追踪实际回报。当投入持续大于收益时,可考虑动态调整配额或退出迭代,避免无效Token持续消耗。

2. 度量层:统一价值标尺,让每枚Token对应可量化业务结果

借鉴招行度量体系框架,建立全行统一的AI投入产出仪表盘,设定“成本收益比”、“AI贡献比”等核心指标作为参照。从成本端出发,核算研发人力及Token费用,收益端则锚定人工替代工时、流程提速比例、风险拦截成效、收入增长等可量化指标。只有可视化Token消耗与产出情况,才能为后续的资源配置决策提供可靠依据。

3. 技术层:统一网关+分级路由+缓存调度,把冗余Token压下来

在架构层部署统一AI算力网关,对所有内外部模型调用流量统一收口、总量管控。通过按部门、项目、场景设置Token调用配额,当超额调用时实施熔断预警,实现全量调用行为留痕可追溯。

在此基础上叠加三层技术降本,分层压降冗余Token消耗:

第一层:智能路由,简单任务如知识库问答、摘要、分类等走经济模型、开源模型承载,信贷审批、合规审查、交易分析等高精、高严谨性复杂任务,调用旗舰模型,保证按量配模、降本不降智。

第二层:语义缓存+上下文精简,对重复、相似查询请求命中缓存直接返回结果,同时精简无效上下文冗余输入,减少不必要的Token生成和消耗。

第三层:算力满载调度优化,借鉴腾讯云的潮汐调度与qGPU细粒度切分,通过错峰填谷,让整体利用率和成本效率都达到最优。

4. 资源层:精准沉淀高价值业务 实现资源价值最大化

借鉴平安产险AI应用实践,对全行AI智能体及模型应用场景开展分级分类排序,优先保障高频落地、价值可量化、风险可控的核心业务场景,重点向反欺诈、智能风控审批、智能化催收、客户精准营销等场景倾斜,足额供给算力与Token资源、保障业务高效运行。

针对同质化智能客服、低转化营销文案生成、重复性办公辅助等低价值、低产出场景,建立常态化场景评估与动态退出机制,及时缩减冗余Token配额、释放闲置算力,避免优质资源被低效业务持续占用。

5. 合规层:《指导意见》红线内嵌,而非事后补丁

AI安全不是降本的对立面,而是Token精算可持续的前提。《指导意见》对AI应用合规提出明确要求,涉及信贷审批、资金交易、承保理赔等高风险场景,须经风险管理委员会批准后方可实施;涉及客户权益或有实质性财务影响的关键决策时,设置人工复核,确保全程可追溯。银行可将数据安全与合规规则前置内嵌至Token调用、模型选型、数据使用全流程,从源头杜绝姓名、身份证号等客户隐私泄露,对外部模型建立准入清单与供应链集中度管控体系,实现算力精算降本与 AI 合规风控双向统一。

最后一点思考

银行业正值数智化升级的关键节点,未来,银行的竞争力,不仅取决于拥有多少算力,更取决于能用多少算力,换来多少利润。

构建Token精算机制,是一项涉及技术架构、管理流程与组织协同的系统性工程。它要求银行像核算资金成本一样核算Token成本。让每一枚Token的消耗都对应可量化的业务价值,才能走出一条符合银行业经营逻辑的高质量AI发展之路。

作者:银行科技研究员 小短


展开全文
相关阅读
资讯查询取消