回溯过往新闻发现,这类“始料未及”的算力挑战,已成为国内外大模型企业难以绕开的共性痛点。在国内,即梦AI Seedance 2.0发布后,因视频生成算力消耗巨大,有会员提交仅几秒的视频任务,排队十余小时仍未生成;智谱GLM-5上线后调用量暴增,引发大面积排队、卡顿等现象,部分长链代码生成任务直接中断;DeepSeek在今年4月发布V4模型前后,同样频繁出现服务异常。在海外,ChatGPT、Claude等大模型也经历过崩溃、长时间排队和限流的窘境。
Remy APP联合创始人、CEO王正男在接受深圳商报记者采访时,曾介绍过团队应对算力洪峰的紧张故事。Remy APP发布时,团队按照极高预期准备了八九百张GPU卡,当时还私下调侃会不会太夸张。结果APP刚一上线,任务量瞬间引爆,仅5秒左右,八九百张卡就已经不够用了。在任务暴涨、系统阻滞的情况下,团队紧急将算力拉升至1900张卡,才缓解了局面。
算力“洪峰”为何如此难控?
为何大模型发布初期的算力需求如此难以预测和及时扩容调度?深圳清华大学研究院弹性算力研究中心主任、共绩科技CEO付智分析指出,AI大模型在发布初期,算力需求通常呈现前期爆发式激增、持续性高并发消耗、后期峰谷波动加剧的特点,普遍面临“流量洪峰不可预测、单次调用Token消耗远超预期”的压力。随着大模型从单一文本走向多模态,计算复杂程度和算力消耗更是呈指数级提升,算力供给瓶颈已成为全行业必须直面的结构性挑战。
以Kimi K3为例,作为全球首个开源3万亿级别模型,它专为长程编程、知识工作和推理等前沿智能场景而设计。尽管采用了Stable Latent MoE(稳定潜在混合专家架构)并配合KDA混合线性注意力机制等技术,极大优化了计算效率,但由于其默认开启高强度思维链模式,单次调用的Token消耗远超常规模型。加之效率提升释放了更多使用量,进而推高了总资源消耗,导致推理阶段的总算力需求呈爆发式增长,上线后很快逼近集群承载极限。
此外,新一代大模型发布时期的推理体系仍处于相对早期阶段,系统适配与工程优化尚有空间;同时,算力供给的传导也存在客观的时间差,第三方平台的部署尚未完全跟上,都是大模型在发布初期常陷入算力困境的原因。
“整体来说,此类情况本质上不是单纯的算力不够,而是算力资源的时空错配、硬件瓶颈与成本控制的三重矛盾。”付智分析认为,要应对Kimi K3这类万亿级大模型的算力挑战,需要一套从底层硬件、系统架构到宏观运营的综合解决方案。例如,硬件层面需支持超大显存与高带宽互联;调度层面需要通过技术动态分配资源以应对突发流量,避免服务中断;成本层面则需兼顾性能与能耗平衡,避免因过度配置导致资源闲置或电费飙升。
“分类计价”驱动精细调度
除因算力告急暂停C端新用户订阅外,Kimi在此次声明中提及的“权益拆分”举措同样引发高度关注。声明指出,对于后续新订阅用户,将拆分 Kimi主权益(包含 KimiWeb, Kimi APP, Kimi Work)和 Kimi Code 权益,以方便更精准匹配算力,保障用户体验。意味着Kimi正试图通过“场景化计价”和“精细化算力调度”,探索算力成本与用户价值的精准匹配。
此类基于场景与算力消耗的分类定价,国内外不少AI大模型厂商正在探索推进。国内,今年6月下旬,豆包发布豆包专业版,推出了标准、加强、高级三档阶梯套餐。DeepSeek 此前有邮件表示,DeepSeek V4 新版本将对API定价策略进行结构性调整,首次引入“峰谷定价”机制,以更合理地配置资源并提升服务稳定性。海外大模型OpenAI目前的API定价体系主要围绕模型能力级别(旗舰/均衡/轻量)以及调用服务层级(标准/批量/优先)来划分。Anthropic则在模型能力的基础上,引入“安全约束松紧程度”作为溢价标准,形成三维定价策略。
战略品牌专家、晶捷品牌咨询创始人陈晶晶分析指出,传统互联网产品的边际成本差异有限,因此多采用统一会员模式。但大模型不同应用场景的算力消耗差异巨大,将高算力需求场景独立拆分,有助于企业更精准地匹配资源,实现成本与价值的对等。因此,AI产品通常根据模型能力、调用额度、响应速度和专业功能设置不同价格层级,通过产品分层管理算力资源。
陈晶晶指出,未来,大模型企业不仅需要持续扩充算力底座,更需通过提升推理效率、优化工程调度,配合精细化的服务分层与差异化定价,来提升算力效率、实现商业闭环。