国产大模型9月密集开源:轻量化与全栈国产化成主线

    发布时间:2026-09-25 04:00 更新时间:2026-09-25 04:00 阅读量:0

    2026年9月的国产大模型赛道,比融资新闻更热闹的是开源发布。短短一个月内,从手机厂商到运营商再到AI创业公司,陆续把自家新模型放上开源社区,方向也高度一致:参数不追求一味堆大,而是把「小参数跑出高性能」和「全栈国产算力可跑」当作卖点。对做建站和运维的读者来说,这意味着本地部署和API调用的选择又多了一批。

    几条值得关注的开源发布

    小米在9月22日发布并开源了MiMo-V2.6系列,包含Pro与Flash两个原生全模态模型。据公开信息,该系列在AA综合智能指数v4.3.2中取得46分,前代MiMo-V2.5-Pro为26分。API定价方面,Flash为输入1元、输出2元每百万词元,Pro为3元与6元。价格与评测口径以官方公告为准。

    阶跃星辰9月20日发布Step 5 Preview,采用稀疏MoE架构,总参数6000亿、激活参数270亿,支持100万词元上下文,原生支持文本与视觉输入,官方表示完整权重将于10月15日全面开源。

    中国电信9月17日发布的星辰Xing4.0-29B-A4B是其中比较特别的一个:总参数29B、激活参数4B,原生支持256K上下文并可扩展至512K,官方称其为国内首个基于国产算力和国产框架完成训练的百亿参数大模型。4-bit量化后显存约15GB,可在RTX 3090/4090这类消费级显卡上本地运行。

    更早的9月1日,科大讯飞开源了星火X2.5-4B与1.7B两个端侧模型,原生支持最长100万Token上下文,已上线Hugging Face、GitHub等社区。

    两条共同的技术主线

    第一条是轻量化与高效化。激活参数远小于总参数的MoE结构几乎成了标配,4B到30B这一档的模型开始能在单张消费级显卡上跑起来。对预算有限的站长来说,这直接降低了私有化部署的硬件门槛。

    第二条是国产算力全栈适配。从训练框架到推理引擎,厂商普遍强调对昇腾等国产算力的支持。中国电信这款模型把「国产算力+国产框架训练」作为核心标签,反映出产业链在训练侧的自主化推进。

    部署前先确认显存与量化方案

    如果你打算在自有服务器上试跑这类小参数模型,建议先确认显卡显存和量化方式。下面是一段常见的环境检查与依赖安装示例,具体版本号请以各模型官方仓库说明为准:

    nvidia-smi
    python3 -c "import torch; print(torch.version, torch.cuda.is_available())"
    pip install -U transformers accelerate
    

    以4-bit量化方式加载,显存占用会明显低于全精度

    python3 -m vllm.entrypoints.openai.api_server \ --model /path/to/model \ --quantization awq \ --max-model-len 8192 \ --port 8000

    需要提醒的是,以上命令只是通用写法,不同模型的加载参数、量化格式和支持的推理框架差异较大,实际部署请以模型官方文档和你的硬件环境为准,不要照搬参数直接上生产。

    从趋势上看,国产开源模型正在从「能对话」往「能执行任务」迁移,智能体能力成为新的比拼点。9月这批模型里,不少都把Agent场景作为重点宣传方向。对建站用户而言,后续把这类模型接进客服、内容审核或站内搜索,成本会比一年前低不少,但选型时仍要结合自己的算力预算和实际业务场景,先小规模验证再决定是否上线。

    继续阅读

    📑 📅
    阶跃Step 5 Preview发布:6000亿参数稀疏MoE瞄准编程与金融 2026-09-24
    国产AI芯片份额逼近五成,算力产业进入新阶段 2026-09-24
    智谱完成约50亿美元融资,六成投向下一代模型 2026-09-24
    9月国产手机端侧大模型备案新增三款 2026-09-24
    9月国产大模型开源潮:从MoE到全栈国产 2026-09-24
    智谱完成约50亿美元融资,六成投向下一代模型 2026-09-25
    硅基流动年内累计融资近29亿,推理算力赛道升温 2026-09-25
    超衍智能获近4亿天使融资,押注自进化大模型 2026-09-25
    全国产10万卡AI超集群投用,国产算力走到哪一步 2026-09-25
    小米开源MiMo-V2.6:全模态大模型登顶开源榜 2026-09-26