发布时间:2026-09-21 04:01 更新时间:2026-09-21 04:01 阅读量:0
在国产大模型密集发布的同时,承载这些模型的算力底座也在同步推进。据了解,华为云昇腾950智算集群云服务将于9月30日在国内商用,11月30日面向全球开放。对于需要跑推理、做微调的站长和中小企业来说,这意味着多了一个可选的国产算力入口;具体的规格、计费方式与开通区域,以华为云官方页面为准。
把这条消息放到更大的背景里看,会更清楚国产算力现在所处的阶段。公开信息显示,截至2025年6月底,我国在用算力中心标准机架达1085万架,智算规模788 EFLOPS(FP16),全国算力中心平均PUE降至1.42;到2026年3月,智算规模已达1882 EFLOPS。另一组常被引用的数据是,2025年底大模型日均调用量较年初增长30倍,用户数超6亿。调用量涨上去,推理侧的算力需求自然跟着涨,这也是各家芯片厂商和云厂商都在抢的时间窗口。
政策层面的定调同样明确。国务院此前印发的《关于深入实施“人工智能+”行动的意见》提出强化智能算力统筹、支持人工智能芯片攻坚创新,并完善全国一体化算力网、发挥“东数西算”枢纽作用。工信部《信息通信行业发展“十五五”规划》提出,到2030年智能算力规模较2025年增长超5倍,有序部署万卡、十万卡及以上智算集群,并加大力度适配国产算力芯片。对运维和采购同学来说,这些表述会逐步落到招标文件、适配清单和补贴政策上。
产业侧的反馈比政策更直接。有统计显示,海光信息、寒武纪、摩尔线程、沐曦股份、壁仞科技、天数智芯、燧原科技七家国产AI芯片公司,2026年上半年营收合计约214.6亿元,接近上年同期的两倍。资本市场上,摩尔线程、沐曦等智算芯片企业也接连登陆科创板。出口方面,2026年1—7月中国集成电路出口总额达2160亿美元,同比增长99.5%,已超2025年全年总额。
模型侧的适配案例也在增加。智谱方面曾披露,GLM-5.3-Flash 线上流量由10万张国产芯片承载;美团 LongCat-2.0 在开源模型的同时开放了国产卡推理代码;魔芯科技的 MoWorld 4D 则基于全国产NPU完成训练与部署。这些案例说明国产芯片已经能扛住一部分真实业务流量,但距离“什么都能跑”还有距离。
行业内比较一致的判断是,国产算力芯片正处在从“可用”到“好用”的过渡期,推理侧生态壁垒相对训练侧更小,更容易先跑出规模。现实中的短板也客观存在:配套软件生态与开发工具链的成熟度仍在爬坡,CUDA生态的迁移成本不低,高端训练芯片和万卡级集群的稳定性、高速互联仍是门槛。
对中小站长来说,比较务实的做法是先在推理类场景做小规模验证,比如把站内问答、内容摘要、图片审核这类请求切一部分到国产算力实例上,观察延迟、并发和单位 token 成本,再决定是否扩大比例。如果打算本地部署,可以关注量化后显存占用较低的模型,例如中国电信开源的星辰 Xing4.0-29B-A4B,4-bit 量化后显存约 15GB,消费级显卡即可运行,适合先在自己的服务器上把链路跑通。
# 查看本机 GPU 与显存情况,判断能否本地跑量化模型
nvidia-smi
以 vLLM 为例,加载量化模型时的显存占用可用如下思路估算
显存 ≈ 参数量 x 量化位宽 / 8 + KV Cache + 框架开销
以 29B 参数、4-bit 量化为例,权重部分约 15GB 左右
具体数值随模型、上下文长度、并发数变化,以实测为准
需要提醒的是,算力选型没有统一答案,昇腾950商用后的实际价格、可用区域、支持的模型与框架版本,都要以官方文档和实际环境为准。建议在下单前先申请试用额度,用真实业务流量压一压,再评估迁移成本。
| 📑 | 📅 |
|---|---|
| 阶跃星辰Step 5 Preview发布,主攻AI编程与金融场景 | 2026-09-21 |
| DeepSeek筹备科创板IPO,V4.1 Flash同步发布 | 2026-09-21 |
| 中国电信开源星辰Xing4.0:29B智能体模型可在消费级显卡本地跑 | 2026-09-21 |
| 50亿美元融资落地,智谱上调年末ARR指引至30亿美元 | 2026-09-21 |
| 中电信开源星辰Xing4.0,29B轻量代码智能体 | 2026-09-20 |
| 智谱完成约50亿美元融资,国产大模型算力与智能体齐头并进 | 2026-09-22 |
| 中国电信开源Xing4.0-29B,全栈国产轻量级智能体模型 | 2026-09-22 |
| 国产AI芯片半年营收翻倍,算力政策密集落地 | 2026-09-22 |
| 阶跃星辰Step 5 Preview亮相,10月开源完整权重 | 2026-09-22 |
| 度小满原力AI平台开放,员工已自建350多个智能体 | 2026-09-22 |