发布时间:2026-09-13 04:01 更新时间:2026-09-13 04:01 阅读量:0
9月第一周,国产大模型的开源动作集中落在“小参数、端侧”这一侧。科大讯飞在9月1日开源了星火X2.5-4B与X2.5-1.7B两款端侧模型,官方介绍两者均原生支持最长100万Token上下文,基于全国产算力平台完成全流程训练,预训练数据约20万亿Token;采用混合注意力机制后,长文本场景的显存占用约为传统全局注意力方案的四分之一。开源协议为Apache-2.0,兼容vLLM、SGLang、llama.cpp,也可通过Ollama、LM Studio部署,权重已在Hugging Face、ModelScope、GitHub等渠道开放。
紧接着,面壁智能联合OpenBMB开源社区放出了MiniCPM5-2B,这是一款2B参数的端侧语言基座,主打工具调用、深度搜索与代码生成。据公开评测信息,该模型在Artificial Analysis相关榜单的4B以下开源基座中表现居前,Agentic指数环节的得分明显高于同量级模型。腾讯同期发布EVIE-8B与EVIE-4.5B两款视觉文档检索模型,以Apache 2.0许可开放权重、训练流程、压缩算法和评测套件,ViDoRe V3指标为66.75 nDCG@10。基元律动联合无问芯穹、清华、北大等机构发布的Agent-Native模型NeoHorse-1,则提供4B与9B两个规格。
对站长和运维来说,这类模型的价值不在榜单分数,而在于能不能塞进已有的机器里跑起来。4B以下的模型在单张消费级显卡乃至CPU上都有落地空间,适合站内知识库问答、工单摘要、日志归类、代码片段生成这类“高频但不必顶格智能”的任务;长上下文则意味着可以把较长的一批文档一次性送进模型,省掉部分切片与召回环节。需要注意的是,窗口开得越大,显存和内存压力越明显,实际能开到多少,取决于推理框架与硬件条件,具体以官方文档和实测为准。
如果打算用vLLM提供OpenAI兼容接口,可以先用下面的方式把服务拉起来,再把站内应用的API地址指向本机端口。模型路径请替换为从官方仓库下载的权重目录:
python -m vllm.entrypoints.openai.api_server \
--model </path/to/model> \
--served-model-name local-small-llm \
--max-model-len 32768 \
--gpu-memory-utilization 0.9 \
--port 8000其中max-model-len是上下文长度上限。端侧模型宣称的百万上下文通常需要推理框架层面的压缩或稀疏方案配合,一上来就按最大值开启很容易显存不足,建议从32768起步逐级测试。服务起来后可用请求/v1/chat/completions验证是否正常,接口路径与参数以vLLM官方文档为准。
这批开源模型虽然多数标注Apache-2.0,但并非所有国产模型都无条件放开商用,部分厂商采用差异化商业许可,区隔个人研究、中小团队与大企业商用。上线前建议到Hugging Face、ModelScope或厂商官方渠道核对权重、许可与版本号。算力侧,工信部9月印发的信息通信行业“十五五”规划提出加快全国一体化算力网建设、加大国产算力芯片适配力度,端侧与边缘侧模型恰好契合这一方向。至于各模型的实际表现与部署细节,仍以官方发布和自身环境验证为准。
| 📑 | 📅 |
|---|---|
| 星火X2.5发布并开源端侧模型,百万上下文下探端侧 | 2026-09-12 |
| 百度搭子接入小度硬件,AI智能体走进家庭场景 | 2026-09-12 |
| 可灵AI获14亿元注资,视频生成赛道再受关注 | 2026-09-12 |
| 十万卡智算集群写入十五五规划,国产算力加速落地 | 2026-09-12 |
| DeepSeek V4.1 Flash上线并降价,同步筹备科创板IPO | 2026-09-12 |
| 工信部十五五算力规划落地,十万卡集群提速 | 2026-09-13 |
| DeepSeek发布V4.1 Flash,同步筹备科创板IPO | 2026-09-13 |
| AI智能体从对话走向干活,外滩大会与服贸会看点 | 2026-09-13 |
| 月之暗面递表港交所,Kimi K2.8 Preview全量上线 | 2026-09-13 |
| 智谱完成约50亿美元融资,加码GLM自训练 | 2026-09-15 |