发布时间:2026-09-13 04:01 更新时间:2026-09-13 04:01 阅读量:1
9月10日,DeepSeek 正式发布 V4.1 Flash 模型,官方给出的两项关键信息是原生多模态视觉理解能力,以及通过 KV Cache 压缩把推理阶段的 HBM 需求降到原来的四分之一、SSD 需求降到八分之一,并同步大幅下调价格。对站长和运维人员来说,这类底层改动往往比参数规模更值得关注,因为它直接决定同样一张显卡、同样一台机器能承接多少并发请求。
就在前一天,多家媒体援引知情人士消息称,DeepSeek 已聘请中信证券筹备科创板 IPO,首轮募资规模超 500 亿元、投后估值超 3500 亿元,第二轮投前估值升至约 5000 亿元,两轮累计超 1000 亿元。这些估值和金额目前均来自媒体报道,尚未见到官方公告确认,实际数据以企业正式披露为准。
KV Cache 是自回归推理时缓存历史键值对的地方,上下文越长占用越大。把它压缩之后再配合多模态能力上线,意味着同一套硬件可以支撑更长的对话和图片输入场景。对打算自建推理服务的团队,选购显卡时除了看显存容量,也要把缓存压缩、量化方案、批处理策略一起算进去,否则纸面参数和实际吞吐容易对不上。
而如果只是调用 API,重点则落在计费口径上:输入与输出 token 是否分开计价、缓存命中的部分是否折价、图片等视觉输入如何折算,各家规则并不统一。素材提到,近期国产旗舰模型整体定价持续下探,例如某多语言版本低至 1.6 元/百万 token,另有旗舰 Flash 版本压到 1 元。价格变化频繁,接入前建议直接核对官方价目页,不要依赖第三方转述。
DeepSeek 并非孤例。智谱、MiniMax 已于 2026 年 1 月登陆港交所;9 月上旬,月之暗面以保密形式向港交所递交 A1 文件,同时以约 500 亿美元投前估值推进新一轮融资;快手旗下可灵 AI 获得国家人工智能基金 14 亿元现金入股,持股约 1.14%。资本动作密集的同时,市场关注点也从单纯讲赛道故事,转向商业模式与盈利质量的审视。
对中小站长而言,这轮变化的实际影响体现在两处:一是可选的模型供应商变多,但服务条款、数据留存策略、价格调整频率也更需要逐条比对;二是一旦供应商进入上市或重组阶段,接口兼容性与历史版本下线节奏都可能变化,关键业务不宜把逻辑硬绑在单一模型的私有参数上。
第一,把调用封装成可切换的适配层,模型名、接口地址写进配置而不是散落在代码里;第二,对长上下文和多模态请求单独限流与计费统计,避免超长输入把预算吃穿;第三,关注官方文档中的版本变更说明,新模型上线初期往往有灰度范围与配额限制。模型能力迭代很快,稳的往往不是模型本身,而是你围绕它搭的那层工程结构。
| 📑 | 📅 |
|---|---|
| 工信部十五五算力规划落地,十万卡集群提速 | 2026-09-13 |
| 国产端侧大模型密集开源,小参数模型开始扛活 | 2026-09-13 |
| 星火X2.5发布并开源端侧模型,百万上下文下探端侧 | 2026-09-12 |
| 百度搭子接入小度硬件,AI智能体走进家庭场景 | 2026-09-12 |
| 可灵AI获14亿元注资,视频生成赛道再受关注 | 2026-09-12 |
| AI智能体从对话走向干活,外滩大会与服贸会看点 | 2026-09-13 |
| 月之暗面递表港交所,Kimi K2.8 Preview全量上线 | 2026-09-13 |
| 智谱完成约50亿美元融资,加码GLM自训练 | 2026-09-15 |
| 科大讯飞星火X2.5端侧模型开源:小模型也能扛百万上下文 | 2026-09-15 |
| 电子信息制造业十五五规划发布,端侧AI芯片与存算一体成重点 | 2026-09-15 |