查看官网原文 → 在乐享AI咨询 →
品牌/新闻

联想AI+|围剿Token“刺客”:给AI成本上三把锁-联想乐享知识库

⚡ 核心结论

联想AI+|围剿Token“刺客”:给AI成本上三把锁 联想AI+|围剿Token“刺客”:给AI成本上三把锁 2026-08-0…

内容来源:联想官方

联想AI+|围剿Token“刺客”:给AI成本上三把锁

联想AI+|围剿Token“刺客”:给AI成本上三把锁

2026-08-03 18:00:00

浏览

分享

操作示意图
操作示意图

AI席卷全球的浪潮不可逆转。Gartner预测,2026年全球AI支出将达到2.59万亿美元,同比增长47%。但当生成式AI从试验工具真正进入业务流程,一个尖锐的问题也随之浮出水面:AI用起来之后,成本如何控制?

答案当然不是限制使用。在智能体持续读取上下文、反复推理的时代,企业真正要盯住的,是每一个Token在哪里产生、怎样被使用,最终能否转化为业务价值。

围绕这条链路,联想给出了三层答案:

一次调用都走对模型、算清成本。

操作示意图

三者贯穿Token的端侧生成、规模生产和调用运营,让合适的任务在合适的位置调用合适的模型和算力,让每一笔AI投入都更清晰、更可控。

AI主机

让高频任务不必次次上云

个人和成长型企业使用AI,第一类容易被忽略的成本,是“什么都上云”。

整理资料、提炼会议纪要、生成固定格式的报告……这些任务频率高、重复性强,还常常涉及个人信息、客户资料和业务数据。如果每一步都交给云端大模型,企业就要为每一次输入、推理和输出持续买单;智能体一旦7×24小时运行,原本不起眼的单次调用,很快会累积成一张难以预测的账单。

不是所有Token都值得上云,就像不是每个快递都需要空运。联想AI主机提供了另一种选择:给智能体一个可以长期驻留、持续运行的本地“身体”。

操作示意图

就像每位员工有一台电脑一样,AI主机是专为智能体常驻运行设计的AI原生边缘设备,负责保存本地知识与长期记忆,承载高频任务,并与电脑、手机、平板等终端协同。它通过“端—边—云”协同重新分配任务——高频、模板化、涉及敏感数据的任务优先在本地完成;超出本地模型能力的复杂推理,再调度到云端。

企业由此减少需要按次购买的云端Token,把高度波动的API调用支出,部分转化为更可预测的本地设备和能耗成本。

以联想百应AI主机 mini 100为例,它面向OPC(一人公司),适用于AI创作、线上营销和市场分析等场景;0.5L机身通过6大类57项可靠性测试,日均耗电不足1度。在执行市场分析报告类任务时,其Token成本可降低70%~95%。

词元工厂

让每一分算力产出更多高价值Token

当AI从零散试验走向规模化应用,第二类容易被忽略的成本,是“生产了大量Token,却没有形成有效产出”。

一些企业投入大量资金部署集群、训练模型,却仍然依赖人工反复调试:数据与业务脱节,软硬件重复适配,模型上线后缺少持续优化。看似拥有了模型和算力,实际运转起来却像一个效率起伏的“手工作坊”。

而企业真正需要衡量的,不只是买了多少张卡、生成了多少Token,而是同样的投入能否稳定产出更多高质量Token,并转化为业务结果。

联想Token工厂先把价值账算在设备账之前。在签署GPU订单、启动模型训练之前,企业要先回答:第一个可以交付、可以被业务衡量的价值产品是什么?先跑通一个最小价值闭环,再决定需要什么数据、模型和算力,能够避免为了技术而技术,从源头减少无效投入。

操作示意图

从数据预处理、模型训练、效果评估,到在线部署、推理服务、持续监控和迭代优化,联想Token工厂让各环节进一步形成衔接顺畅、状态可读的生产线。面对不同模型和芯片,算力系统按需匹配;面对不断变化的业务,应用端产生的反馈与新数据重新回到生产环节,推动模型持续优化。企业由此减少重复适配、反复搬运和低效计算,让一次次优化沉淀为可复用的能力。

更便宜、更快、更可控,Token工厂正在各行各业加速创造价值。在制造行业,一家钢厂通过Token工厂赋能高炉大模型,订单交付周期缩短50%以上;在金融行业,一家头部公司通过建设Token工厂服务金融智能体,将商业尽职调查的时间从数周缩短至数分钟;在医疗行业,一家高端全科医院打造了Token工厂,节省了60%的文书工作时间,单医生创收提升43%。

词元中枢

让每一次调用都走对模型、算清账

Token生产出来之后,怎样使用和管理,是另一笔更隐蔽的成本。

随着业务需求分化,企业接入的模型越来越多,三类“说不清的钱”便开始出现:测试脚本持续消耗、预付额度闲置、多厂商账单口径不一,让企业既难对账,也难判断每笔Token投入的实际价值。

企业并不怕为AI花钱,怕的是钱花出去了,却不知道花在哪里、为什么花、是否值得花。

xCloud联想智能云词元中枢(Token Hub)把协议各异的模型和Token账单统一收口,让模型可以统一接入、智能调度,让Token可以精准计量、清晰分账。

操作示意图

在资源接入层面,联想词元中枢聚合200多个主流大模型,同时兼顾公有云模型、本地私有模型和企业自研模型,并通过统一标准API抹平不同厂商的协议差异。业务部门无需为每个模型重复开发和维护接口,Token接入效率提升80%。

在模型调度层面,联想词元中枢可以根据价格、吞吐量、时延等不同策略动态选择模型;通过动态比价与语义缓存技术,持续压降Token成本;在稳定性保障上,依托秒级故障切换机制自动无缝切换备用通道。目前,其Token使用成本可降低15%以上,服务可用性达到99.95%。

在运营管理层面,联想词元中枢提供模型选型咨询服务与账单管理、财务运营服务,以Token为统一单位进行精准计量,按部门分账。账单不再是“糊涂账”,Token消耗实现全透明、可视化。在实际场景中,部分模型每百万Token价格最低仅需0.5元。

以上能力已经获得权威验证。在中国信通院首批可信Token云服务评估中,xCloud联想智能云在“Token云服务TokenHub服务平台”中获评卓越级,即最高等级,并首批通过“模型聚合与Token管理平台”能力评估。

在佛山制造业数智平台,词元中枢已经成为城市级Token消费中枢,统一承担Token接入、调度、计量和分账,抹平多模型与异构算力之间的差异,让制造企业无需分别采购、搭建和维护多套模型及算力系统,也能按需获得稳定、透明的AI服务。

从联想AI主机,到联想词元工厂,再到词元中枢,联想给Token“刺客”上的三把锁,不是给AI应用踩下刹车,而是减少无效上云、无效生产和无效调用,让数据、任务、模型和算力各归其位。面向未来,联想也将继续投入技术创新,助力Token调用降本增效,以混合式AI加速创新生产力走进千行百业。