科大讯飞星火X2.5端侧模型开源,支持百万级上下文

    发布时间:2026-09-16 04:00 更新时间:2026-09-16 04:00 阅读量:0

    9月1日,科大讯飞发布并开源星火X2.5-4B与星火X2.5-1.7B两款端侧大模型。官方信息显示,这两款模型在端侧原生支持最长100万Token的上下文窗口,基于全国产算力平台完成全流程训练,预训练数据规模约20万亿Token,采用Apache-2.0协议开源,允许免费商用,并兼容vLLM、SGLang、llama.cpp等常见推理框架。

    从参数规模看,4B与1.7B都属于轻量级模型,常见于手机、PC、车机、边缘盒子一类算力受限的设备。把上下文长度做到百万级,意味着模型可以在单次推理中直接吞下整本技术手册、一整套项目源码或长时间积累的会议记录,而不必依赖外部分段检索来拼接上下文。对于做端侧应用开发的站长和工程师来说,这是一个值得留意的能力变化。

    百万上下文在端侧意味着什么

    过去谈长上下文,通常是云端旗舰模型的卖点,端侧受限于内存带宽和算力,上下文往往只能维持在几千到几万Token。星火X2.5把这一指标拉到百万级后,端侧设备可以承载的任务类型会明显变宽:本地知识库问答、长文档摘要、代码仓库级的理解与补全、离线智能助手等场景,都有机会在不上传数据的前提下完成。

    需要说明的是,官方公布的百万Token上下文属于模型支持上限,实际可用长度会受设备内存、推理框架实现和量化精度影响,具体部署效果以实测和官方文档为准。若在资源有限的设备上运行,通常需要配合KV Cache量化或分块加载等策略。

    部署与选用建议

    两款模型均为Apache-2.0协议,商用限制较少,适合二次分发或集成进自有产品。选型上,1.7B更适合对延迟敏感的移动端与嵌入式场景,4B则在理解能力和资源占用之间取一个折中。下面是一段基于vLLM的本地启动示例,仅作参考,模型路径与参数请以官方仓库说明和实际环境为准:

    # 以实际下载的模型目录替换 MODEL_PATH
    python -m vllm.entrypoints.openai.api_server \
      --model /path/to/spark-x2.5-4b \
      --served-model-name spark-x2.5-4b \
      --max-model-len 32768 \
      --gpu-memory-utilization 0.85 \
      --port 8000
    
    

    调用测试

    curl http://127.0.0.1:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"model":"spark-x2.5-4b","messages":[{"role":"user","content":"你好"}]}'

    如果目标是纯CPU或边缘设备部署,可以换用llama.cpp加载GGUF量化版本;若追求高并发吞吐,vLLM或SGLang更合适。把max-model-len设得过大而显存不足时,服务会启动失败,建议先按设备实际情况从小到大调整。

    国产端侧模型的整体节奏

    把这款模型放进2026年8至9月的国产大模型发布潮里看,方向会更清楚。面壁智能联合OpenBMB开源了2B参数的MiniCPM5-2B,主打端侧Agent能力;智谱发布GLM-5.3-Flash并在发布前以匿名模型形式在大规模测试中验证;阿里Qwen系列旗舰开放权重;上海AI实验室发布多模态模型书生-S2。多家厂商密集上新,且普遍把注意力放在推理成本、端侧部署和工程效率上,而不是单纯比参数规模。

    对站长和运维人员而言,这类轻量开源模型的实际价值在于:可以在一台配置普通的服务器甚至本地设备上跑起私有AI服务,数据不出内网,调用成本可控。落地前建议先明确三件事——设备可用内存与算力、业务真正需要的上下文长度、以及量化后精度是否满足要求。这三项确定之后,再决定选用1.7B还是4B,会比盲目追求大参数更稳妥。

    继续阅读

    📑 📅
    电子信息制造业十五五规划发布,AI芯片攻关路线明确 2026-09-16
    智谱完成约50亿美元融资,GLM模型与算力建设加码 2026-09-16
    百度智能云发布超级智能体全家桶,AI从生成走向执行 2026-09-15
    国产大模型开源提速,从拼参数转向拼智能密度 2026-09-15
    电子信息制造业十五五规划发布,端侧AI芯片与存算一体成重点 2026-09-15
    美团龙猫2.0亮相服贸会,万亿参数跑通国产算力 2026-09-16
    智象未来获C+轮融资,多模态视频生成赛道再添弹药 2026-09-16
    智谱完成约50亿美元融资,大模型竞赛转向词元产能 2026-09-17
    电子信息制造业十五五规划发布,AI芯片设计被列为攻关重点 2026-09-17
    国产开源大模型9月密集上新,端侧与多模态成主战场 2026-09-17