云擎天下-超高性价比AI算力服务平台

 A100 pcie40G - 1200/卡/月;裸金属八卡机:8*910B - 15000/月  8*4090 - 7800/月  8*5090 - 12000/月  8*A100 pcie40G - 9000/月  8*A100 pcie80G - 25000/月  8*A100 nvlink80G - 35000/月  8*A800 nvlink80G - 34000/月  8*H20*96G - 35000/月 8*H20*141G - 46000/月  8*L40 - 12000/月  8*L40S - 16000/月 8*H100 - 75000/月 8*H800 - 69000/月 8*H200 -94000/月 8*B200 -130000/月 8*B300 -280000/月 

算力行业剧变:从“堆显卡”到“卖Token”

2026年7月的最后一周,算力行业迎来了一场深刻的商业模式变革。在高端算力持续涨价、供不应求的背景下,头部企业不再满足于简单的硬件出租,而是开始探索“Token工厂”这一全新模式——从“卖硬件”转向“卖服务”,从按GPU时长计费向按AI输出Token数量交付演进。这一转变,标志着算力行业竞争焦点正从“拥有多少张显卡”转向“能高效产出多少智能成果”,整个产业正站在从资源型经济向服务型经济跃迁的门槛上。

一、Token工厂:算力商业模式的范式转移

所谓“Token工厂”,是指算力服务商不再以GPU数量或计算时长作为核心计费单位,而是以AI模型生成的Token(词元,即模型处理文本的最小单元)数量作为交付和计费的锚点。这一模式被称为TaaS(Token-as-a-Service,Token即服务),其本质是将算力抽象为一种可度量、可交易的智能生产力,类似于电力从“按发电机租用”转变为“按度电收费”。

截至目前,已有润建股份、弘信电子、行云科技、超讯科技、南威软件等10多家上市公司公开宣布探索或落地“Token工厂”业务。在刚刚落幕的2026世界人工智能大会(WAIC)上,“Token工厂”更是成为众多算力企业展台的核心词汇,多家厂商展示了其Token计费平台和调度系统,行业共识正在加速形成。

行云科技是这一模式转型的典型样本。7月29日晚,行云科技发布公告称,其此前签订的算力服务大单不仅迎来加单与提价,还新增了“Token收入相关的固定服务费”。具体来看,该公司与某头部长文本大模型服务商的合同,算力服务单元从128个增至256个,总金额从约10亿元飙升至30.53亿元,提升幅度高达201%。与此同时,每单元每月的算力服务费也增长了21%至36%不等。公告特别指出,新增的Token服务费将根据实际生成的Token数量进行阶梯式结算,这意味着行云科技的收入结构正从单一的资源租赁向“基础算力费+成效分成”转变,其商业弹性大为增强。

另一家典型企业润建股份,在WAIC期间发布了“润建智算Token工厂”2.0版本,宣称已接入超过5万张异构GPU,并推出按Token计费的开发者套餐,面向中小模型团队提供低门槛服务。弘信电子则联合多家国产芯片厂商,打造了基于燧原、寒武纪等芯片的Token化算力池,试图在国产替代路线上构建差异化的服务能力。

二、涨价风暴:供需失衡下的市场现实

Token工厂模式兴起的大背景,是高端算力持续紧缺与价格持续攀升形成的“卖方市场”。这一轮涨价潮波及消费级显卡和租赁市场,其烈度和持续性均为近年罕见。

从消费端看,显卡市场正在经历一场“涨价风暴”。受全球主要显卡生产商(英伟达、AMD)涨价通知影响,各大品牌工厂全面执行封仓策略,暂停对外批量出货,渠道库存迅速枯竭。深圳华强北多位商户反映,“这两天涨价幅度在30%左右”,RTX 5070去年零售价约4500-5000元,目前涨至6000-6500元;RTX 5080从8000元档位跳升至近12000元。“基本就是一天一个价,平均日涨幅500到1000元”,部分高端型号甚至出现“有价无市”的局面。游戏玩家和AI爱好者叫苦不迭,而黄牛和囤货商则趁机活跃。

从租赁端看,算力租赁价格同样持续上行。据行业分析机构数据,英伟达B200现货及合约综合租赁价格已从2025年8月的约4.0美元/GPU·小时升至2026年7月的约5.0-5.2美元/GPU·小时,累计涨幅约25%-30%。H100一年期合约租金也从2025年末的低位持续修复,目前稳定在2.8-3.0美元/GPU·小时左右。即便是国内算力租赁市场,A800、H800等合规型号的租金也环比上涨了15%-20%,且长租合约需提前数月排队。

这轮涨价的根源在于AI算力需求对上游产能的“虹吸效应”。三星、SK海力士、美光三大存储原厂将70%至90%的先进封装和晶圆产能转向利润更高的HBM(高带宽内存)产品。HBM的利润率显著高于消费级GDDR显存,且主要供应给英伟达、AMD等数据中心客户。厂商优先保障HBM订单,导致面向游戏显卡的GDDR产能大幅收缩,显存成本随之水涨船高。成本压力沿着供应链层层传导,最终推高了终端显卡价格。此外,全球AI大模型竞赛进入“百模大战”白热化阶段,头部厂商对集群规模的要求从千卡级跃升至万卡甚至十万卡级,进一步加剧了供需矛盾。

三、从“堆卡”到“系统”:算力竞争的逻辑升级

Token工厂模式的兴起,与算力行业竞争逻辑的整体升级密不可分。单纯靠增加GPU数量来提升算力的“堆卡”时代已经过去,系统级优化成为决胜关键。

刚刚结束的WAIC 2026释放了一个明确信号:国产算力已全面告别“堆卡”初级阶段,迈入高速互联、软件栈、集群调度等系统级竞争新阶段。华为昇腾950超节点首次以真机亮相,搭载1024张昇腾NPU卡,通过自研HCCS高速互联技术,提供1 EFLOPS的FP8算力,其集群线性加速比达到0.92以上,接近理想值。中科曙光展示了全国产十万卡AI超集群“曙光8000”,采用自研分布式存储和液冷系统,PUE低至1.08。沐曦股份首发曦景S600超节点,支持横向扩展至万卡级集群,并兼容PyTorch 2.0及以上生态。

这些展示表明,行业评价标准已不再局限于单颗芯片的峰值算力、显存带宽等参数,而是延伸到跨节点通信延迟、故障恢复时间、自动并行策略、编译优化效率等系统能力。正如一位业内资深架构师所言:“未来,随着国产GPU大量投入市场,硬件供给有望逐步充足,头部算力企业正将竞争重心转移至算力调度、推理优化等软件系统能力建设上。谁能在同样的硬件上产出更多Token,谁就能掌握定价权。”

这一转变也呼应了“Token工厂”的内在要求——Token产出效率不仅取决于GPU的浮点运算速度,更取决于整个系统的内存带宽、网络延迟、调度算法和模型并行策略。因此,系统级能力的提升直接转化为单位成本的Token产出率,这是商业模式成立的技术基础。

四、从“卖资源”到“卖服务”:产业价值重构

Token工厂模式的核心,是将算力从一种“资源”升级为一种“服务”,这一转变正在重构整个产业链的价值分配。

过去几年,算力行业的竞争关键是“拥有GPU”。许多投资者把GPU当成了新时代的“数字地产”,大量资本涌入购买显卡、建设数据中心,甚至出现“算力炒家”囤积居奇的现象。这种资源型模式简单粗暴,但边际收益递减,且面临硬件折旧和技术迭代风险。

如今,头部企业正将服务形态从“一口价卖算力”升级为盈利空间更高、客户粘性更强的TaaS模式。这意味着什么?意味着算力不再是一张张显卡的简单堆砌,而是一套从底层硬件驱动、中间件调度、模型优化到应用接口的完整生产体系。Token作为连接底层算力与上层应用的通用语义单位,正在演变为衡量AI生产力的核心“货币”。

对于下游客户而言,Token计费模式降低了使用门槛。开发者无需关心底层用了多少张GPU、是什么型号,只需按实际消耗的Token数量付费,就像按用水量缴费一样直观。这尤其有利于中小企业和个人开发者,使他们能够以更灵活的成本参与AI应用创新。同时,Token计费天然与模型推理的“吞吐量”挂钩,激励服务商持续优化系统效率,形成“效率越高—成本越低—客户越多—数据越多—优化更快”的正向飞轮。

当然,这一转型仍面临现实挑战。一方面,Token的定价标准尚未统一,不同模型、不同任务对Token的“含金量”差异很大,如何制定公平、透明的计价体系是行业难题。另一方面,有分析指出,当前全球约15%-20%的高性能GPU处于“开箱未通电”状态,大量闲置算力尚未有效盘活,从“囤积”走向“有效输出”仍需时间。此外,跨厂商、跨地域的算力互联和标准化调度也是技术难点。

但方向已经清晰:算力行业的竞争,正在从“你拥有多少GPU”转向“你能产出多少Token”。未来,谁能以最低成本、最高效率输出最多Token,谁就能在AI算力新基建中占据核心位置。

五、展望:算力普惠化与AI民主化

2026年7月的最后一周,算力行业站上了一个新的拐点。Token工厂不仅是商业模式的创新,更是算力从“硬件时代”迈向“服务时代”的标志性事件。它预示着算力将像水电一样成为可计量、可交易、可普惠的公共服务产品。

当算力按Token取用,AI模型的成本将变得透明可控,企业和个人可以像订阅云服务一样按需获取智能生产力。这将极大降低AI应用创新的门槛,催生更多细分领域的模型和应用,推动AI真正走入千行百业、千家万户。同时,Token工厂也有望缓解算力浪费问题,通过精细化的调度和计费,引导资源向高价值任务倾斜,提升整个社会的算力利用效率。

展望未来,随着芯片制程进步、先进封装技术成熟、以及系统软件的持续优化,单位Token的成本还将进一步下降。届时,AI算力将不再是大厂的专属奢侈品,而成为每个人都能负担的基础设施。这场从“堆显卡”到“卖Token”的变革,才刚刚拉开序幕,其深远影响将在未来数年内逐步显现。

商务合作:cloud-engine-ben(微信)
客服热线:19886543806
联系地址:深圳市南山区招商街道沿山社区南海大道1079号花园城数码大厦A座二楼
企业信息