智谱完成约50亿美元融资,大模型竞赛转向词元产能

    发布时间:2026-09-17 04:00 更新时间:2026-09-17 04:00 阅读量:0

    2026年9月的国内AI圈,融资消息密集得让人有点跟不上节奏。9月13日,智谱宣布完成约50亿美元融资,结构上由约20亿美元股份配售和约30亿美元可转债组成。其中股份配售价为每股714港元,较公告前收盘价折让约9.96%;可转债为零息结构,初始转股价892.5港元,溢价约12.55%。按照公开信息,这笔资金将投向下一代GLM模型研发、完全自训练体系构建以及算力基础设施建设。

    对关注AI基础设施的站长和运维来说,更值得留意的是智谱披露的商业数据。2026年上半年公司收入9.54亿元,同比增长399.7%;其中API业务收入8.25亿元,同比增长2736%,占总收入的86.5%,MaaS平台ARR达到16亿美元。这组数字说明,大模型的收入结构正在从项目制交付向按调用量计费迁移,背后对应的就是实打实的推理算力消耗。

    融资不只是钱,更是算力与迭代节奏

    智谱今年的模型节奏相当紧凑,2月到8月先后推出GLM-5、5.1、5.2、5.3,大约每两个月一次重要升级。这种迭代频率对训练集群和推理集群的调度能力要求很高,也解释了为什么融资用途里算力建设被单独列出。同一时间段,另外两笔融资也值得记一笔:9月16日,清华系自进化基础大模型公司超衍智能完成天使轮及“天使+”轮,累计近4亿元人民币,投资方包括IDG资本、星连资本、晶泰科技、中关村科学城基金、深创投、上海未来产业基金等;9月15日,生成式AI研发商智象未来完成C+轮融资,投资方为新微资本、成都交子金控集团、工银资本,近三个月累计融资超21亿元。

    把这些消息放在一起看,国内大模型赛道的竞争标尺正在切换。过去大家比的是参数量和榜单排名,如今更常被提及的是推理成本、端侧部署和工程化效率。据中国电信研究院预测,我国词元年消耗量将从2026年的10亿亿跃升至2030年的超3500亿亿,年复合增速接近12倍。词元消耗量的量级变化,直接决定了数据中心里GPU集群的规模、网络互连的带宽需求,以及推理服务的成本模型。

    对建站与运维人群意味着什么

    如果你在维护面向用户的AI应用,这轮变化会体现在几个具体层面。第一,API价格和限流策略会更频繁地调整,模型版本迭代周期缩短,应用侧需要把模型调用层做成可替换的配置,而不是把某个模型名硬编码在业务代码里。第二,MaaS平台按词元计费的模式逐渐成为主流,成本监控要细化到接口维度,否则很容易出现账单超出预期的情况。第三,推理流量增长会推高对本地缓存、请求合并、流式返回等工程手段的依赖。

    一个务实的做法是在网关层做统一收敛,把不同模型的调用封装成内部接口,同时记录每次请求的输入输出词元数。下面是一段Nginx反向代理加日志记录的示例,用于把模型API流量统一收口,方便后续做用量统计与限流:

    http {
        log_format ai_tokens '$remote_addr - $time_iso8601 '
                             '"$request" $status $body_bytes_sent '
                             'upstream_time=$upstream_response_time';
    
        upstream llm_backend {
            server 127.0.0.1:8000 max_fails=3 fail_timeout=10s;
            keepalive 32;
        }
    
        server {
            listen 443 ssl;
            server_name ai.example.com;
    
            access_log /var/log/nginx/ai_access.log ai_tokens;
    
            location /v1/ {
                proxy_pass http://llm_backend;
                proxy_http_version 1.1;
                proxy_set_header Connection "";
                proxy_set_header Host $host;
                proxy_read_timeout 300s;
                proxy_buffering off;
            }
        }
    }

    其中 proxy_buffering off 对流式输出比较关键,否则前端会感觉响应被“憋住”。具体的超时时间和并发参数,还需要结合自己的模型响应速度和服务器规格调整,以实际压测结果为准。

    融资、模型迭代、词元消耗,这三件事在2026年已经连成一条线。对站长和运维来说,不必追每一个发布会的细节,但有必要把模型调用当成一项长期的基础设施成本来管理。至于各家的融资细节和后续产品计划,仍以企业官方公告和监管披露信息为准。

    继续阅读

    📑 📅
    智象未来获C+轮融资,多模态视频生成赛道再添弹药 2026-09-16
    美团龙猫2.0亮相服贸会,万亿参数跑通国产算力 2026-09-16
    科大讯飞星火X2.5端侧模型开源,支持百万级上下文 2026-09-16
    电子信息制造业十五五规划发布,AI芯片攻关路线明确 2026-09-16
    智谱完成约50亿美元融资,GLM模型与算力建设加码 2026-09-16
    电子信息制造业十五五规划发布,AI芯片设计被列为攻关重点 2026-09-17
    国产开源大模型9月密集上新,端侧与多模态成主战场 2026-09-17
    智象未来C+轮融资落地,视频生成模型同步升级 2026-09-17
    超衍智能获近4亿元天使轮融资,自进化大模型受关注 2026-09-17
    智谱完成约50亿美元融资,MaaS收入同比增长超27倍 2026-09-18