科大讯飞星火X2.5端侧模型开源:小模型也能扛百万上下文

    发布时间:2026-09-15 12:30 更新时间:2026-09-15 12:30 阅读量:0

    2026年9月1日,科大讯飞开源了两款端侧大模型——星火X2.5-4B与星火X2.5-1.7B。按照官方发布信息,这是端侧模型首次原生支持最长100万Token的上下文长度,训练数据规模约20万亿Token,且全程基于全国产算力平台完成。

    小体积与长上下文,怎么同时做到

    端侧场景最现实的约束是内存和算力。1.7B版本的BF16权重只有3GB多,经过4bit量化后还能再减半,官方给出的说法是普通手机即可运行。要在这样的体积上撑起100万Token上下文,模型采用了混合注意力架构,对长文本中的注意力计算做了取舍,同时针对智能体、代码、数学和指令遵循这几类能力做了优化。

    开源协议用的是Apache-2.0,意味着可以免费商用。硬件适配覆盖英伟达、华为、海光、后摩等平台,推理框架兼容vLLM、SGLang、llama.cpp。对做端侧应用的团队来说,这意味着不必从零适配,主流工具链基本可以直接接上。评测方面,官方公布MCP-Atlas得分23.4,称是同尺寸中较高水平;智能家居指令执行正确率90.3%,响应时间0.85秒。这些数据以官方发布为准,实际效果还要看具体设备和量化方案。

    为什么端侧模型开始被认真对待

    过去一年,国内大模型的竞赛焦点从参数规模逐步转向落地成本。旗舰模型普遍采用稀疏MoE架构,总参数动辄千亿万亿,但每次推理只激活其中一小部分,目的就是把单次调用的成本压下来。端侧模型是这条逻辑的延伸:把一部分推理放在用户设备上完成,不占用云端算力,响应更快,数据也不用出本地。

    对站长和中小开发者而言,这类模型的价值在于门槛。一台普通手机或一台入门级服务器就能跑起来,不必先买卡、先租算力,就可以验证一个智能客服、文档问答或者设备控制类的想法。能否跑通,取决于量化后的内存占用和推理框架的支持程度,建议先在目标设备上做小规模压测。

    值得注意的是,星火X2.5系列并非只有端侧版本,9月7日还发布了旗舰版星火X2.5-293B。端侧与旗舰搭配,是当前不少厂商的共同做法:重任务走云端,轻任务和设备内交互交给小模型。

    给建站与运维人员的一点参考

    如果你打算在自有服务器上部署这类端侧模型做内部工具,比较稳妥的路径是先确认推理框架版本是否支持对应模型格式,再评估量化等级对内存和速度的影响。以llama.cpp为例,加载量化权重的基本方式如下,具体参数以官方文档和实际环境为准:

    # 仅示意模型加载流程,路径与参数请按官方文档调整
    ./llama-cli -m ./spark-x2.5-1.7b-q4.gguf -c 8192 -n 256 -p "你好"
    

    上下文长度是可以按需设置的,端侧设备上开到100万Token并不现实,8192或32768更贴近实际内存条件。把长上下文当作能力上限而非默认配置,是部署时比较务实的思路。

    继续阅读

    📑 📅
    智谱完成约50亿美元融资,加码GLM自训练 2026-09-15
    月之暗面递表港交所,Kimi K2.8 Preview全量上线 2026-09-13
    AI智能体从对话走向干活,外滩大会与服贸会看点 2026-09-13
    DeepSeek发布V4.1 Flash,同步筹备科创板IPO 2026-09-13
    工信部十五五算力规划落地,十万卡集群提速 2026-09-13
    电子信息制造业十五五规划发布,端侧AI芯片与存算一体成重点 2026-09-15
    国产大模型开源提速,从拼参数转向拼智能密度 2026-09-15
    百度智能云发布超级智能体全家桶,AI从生成走向执行 2026-09-15
    智谱完成约50亿美元融资,GLM模型与算力建设加码 2026-09-16
    电子信息制造业十五五规划发布,AI芯片攻关路线明确 2026-09-16