9月4日,AI 基础设施初创公司 Gimlet Labs 宣布完成 3 亿美元 B 轮融资,由 Andreessen Horowitz(a16z)领投,投后估值达 30 亿美元;Arm、微软 M12、三星风投等产业资本一同入局,Sapphire Ventures、Menlo Ventures、Tiger Global 等老股东跟投。至此这家 2023 年成立、源自 Pixie(Kubernetes 可观测性,2020 年被 New Relic 收购)团队的公司在不到一年里累计融资约 3.92 亿美元。CEO Zain Asgar 的论断很直接:推理已成为 AI 的主导工作负载,其基础设施需要从头重建。

一、没有一种芯片适合所有推理:把模型拆开路由

Gimlet 的核心主张是「多芯片推理云」(multi-silicon inference cloud)。该公司指出,没有哪一款芯片在全部推理任务中都是最优:GPU 擅长计算密集的 prefill,decode 阶段更受内存带宽限制,工具调用与代码执行反而是 CPU 的强项。于是 Gimlet 在软件层把推理任务拆到模型层、单个 layer 乃至具体 operation 粒度,再按服务等级与可用硬件动态映射到不同芯片——目前已公开支持 NVIDIA、AMD、Intel、Arm、Cerebras、d-Matrix 六家。公司宣称在相同功耗与成本包络下,部分前沿模型推理可获 3 到 10 倍提速。

二、Agent 让推理变得碎片化,编排价值被放大

这一路线与 Agent 的兴起直接相关。一个 Agent 任务往往是「调模型→检索→再调模型→执行代码→再调模型→调工具→生成答案」的碎片化链路,每一步都消耗算力、叠加延迟。当单次请求背后是几十次顺序模型调用,推理层的吞吐提升会沿整条管线倍增。Asgar 给出的一个刺眼数据是:当前投产的 GPU 集群利用率仅 15% 到 30%——硬件贵、用得少,正是编排层能变现的空间。a16z 合伙人 Raghu Raghuram 的总结点题:「答案不只是更多基础设施,而是更好的架构。」

三、护城河悬念:巨头会不会自己把这层做了

Arm、M12 的入局不只是财务投资,更是生态信号:编排层把 decode 阶段导向 Arm 芯片,等于为 Arm 授权方拉来推理份额;M12 则让 Maia 自研芯片在真实负载里与 NVIDIA 同台。但风险也写在同一页上:NVIDIA 已有 TensorRT/Triton/NCCL 完整软件栈,AWS、Google、Azure 内部都在做异构编排,OpenAI、Anthropic、Meta 的系统软件能力同样强。Gimlet 必须证明自己不是能被云厂商或芯片公司内部消化的工具,而是不可或缺的中间层。在芯片愈发多元的当下,统一调度层的价值可能随碎片化程度上升;但 30 亿估值买的是这个判断,而不是已兑现的规模化——公司尚未披露营收与具名客户,距离成为真正的「AI 基础设施层」仍有数年商业部署要验证。