来源:央视新闻 B 站视频

核心结论:视频讨论的重点不是单纯”算力够不够”,而是大模型和智能体应用爆发后,算力瓶颈正在从训练阶段的集中式供给,转向推理阶段的高并发、实时响应和弹性调度问题。

关键信息

  • 国家数据局数据显示,截至 2026 年 3 月,我国日均 token 调用量已突破 140 万亿,比 2024 年初增长超过 1000 倍。
  • 智能体、编程、办公、内容生成等应用会持续调用模型,单个任务背后的 token 消耗被放大,推理算力压力快速上升。
  • 传统包机房、长期租用或自建集群的模式更适合训练任务,不适合应用侧突发流量和弹性需求;按量付费又可能显著抬高中小企业成本。
  • 视频提出的解决方向是共享算力和算力调度网络,类似”打车软件”或”水龙头”,通过标准化接口调动全国各地机房甚至个人闲置算力。
  • 政策层面正在推进省级算力网、毫秒用算、普惠算力、算力银行、算力超市等模式,核心目标是让算力从”资源交付”转向”能力交付”。

一句话总结:AI 应用爆发后的关键矛盾,不只是有没有足够 GPU,而是分散、多样、冷热不均的算力资源能否被统一接口、统一调度和弹性供给。

参考资料

  1. 原始 B 站视频