一句话:给金融智能体造「训练场」,九人团队靠这个拿下三千万美元 A 轮
旧金山一家九人初创 Halluminate 在 10 月 1 日完成三千万美元 A 轮(Oak HC/FT 领投),累计融资达到三千八百五十万美元。它做的事听起来很朴素:为金融领域的 AI 智能体造可复现的「训练场」与评测环境。背后是一个被反复验证的尴尬事实——在其 Westworld 并购尽调基准里,七大前沿模型在八十八个真实感并购尽调任务上的最高平均正确率,也只有 51%。也就是说,最能干的模型,在金融这类长流程、强证据、易过时的任务上,离「可用」还差得远。
Westworld 基准:八十八个任务,最高也只有 51%
Halluminate 在八月发布的 Westworld Finance Diligence Bench,从 anonymized 的真实私募交易里抽取了八十八个并购尽调任务,由在岗交易人士撰写与审校。七个前沿模型跑下来,最高平均正确率 51%。失败模式很集中:漏掉要求的改动、用错分析方法、或基于已被取代的信息行动。论文作者指出,问题往往不在单步——而是在长而乱的真实工作流里,把指令与意图一路带到终点。一个任务会让智能体在含一百六十个文件的数据室、跨九条线索的二十一封邮件、四份会议纪要里修订工作说明书,而交易条款中途会变、某些条款必须原样保留。这种「带着约束走完全程」的能力,恰恰是通用编码基准测不出来的。
把失败变成训练环境,而非只打分数
Halluminate 的打法,是把每个识别出的失败模式,变成强化学习环境:一个结构化、可交互、可重置的模拟,让模型去试错、收反馈、迭代,而不碰真实交易与真实数据室。难点在于奖励函数必须可验证——编码环境用「测试过不过」干净解决,金融环境却要靠从业者写的专家 rubric 当验证器。Halluminate 的优势正在于此:基准任务来自真实交易、由从业者审校,专家 rubric 即验证器本身。CEO Jerry Wu 把这类系统称作「垂直化数据研究实验室」的基建——把金融专业判断与经验,沉淀成可训练的信号。
融资与定位:卖铲子给造模型的人
这轮由 Oak HC/FT 领投,Y Combinator、Orange Collective、FT Partners、Heavybit 等既有投资方跟投,总额来到三千八百五十万美元。值得玩味的是客户结构:据 Wu 说法,四家头部美国闭源实验室与两家头部浏览器 Agent 公司已是付费客户,团队仅九人、已盈利、跑在中八位数年化收入区间。它刻意把销售重心放在前沿模型实验室,而非广泛的企业客户——因为最渴「高质量训练环境」的,正是那些要不断把模型推过更长轨迹、更难推理的造模型者。投资逻辑也很直白:当智能体从几秒的任务延伸到几小时、几天,训练环境的质量会变得决定性。
和「智能体评测」线的关系:垂类评测基础设施
要分清边界。已有不少关于智能体评测框架与基准的工作,多聚焦通用能力或横向排名;Halluminate 切的是垂直行业的「训练环境」——不止打分,更造可复现、可重置、带专家验证器的 RL 环境。它和近期关于评测范式(给智能体加第二根标尺、看越界恪守)的研究互补:那些关心「怎么测得更准」,Halluminate 关心「测出来之后怎么变成可训练的信号」。一个是仪表盘,一个是健身房。
增量认知:智能体质量验证成独立赛道
这例印证一个正在成形的判断:随着智能体进到金融、法律、医疗这类高 stakes 长流程领域,光有模型不够,还得有「能验证、能训练」的垂类环境。评测与训练基础设施,正从大厂内部能力外溢成独立生意。Halluminate 的九人盈利、头部实验室买单,说明这条赛道的价值不靠规模堆人,而靠把行业 know-how 做成可复用的信号。对从业者,启示是:与其追着通用基准刷分,不如沉到某个垂直行业的真实工作流里,把「什么算对」定义清楚。
辩证看:客户集中与天花板的双刃
也要如实标注风险。其一,销售高度集中在少数超大客户,一旦某家实验室决定自建同类环境,收入敞口不小;大买家的议价权也强。其二,51% 是当下天花板,不代表永远——若前沿模型靠自身能力把差距抹平,Halluminate 环境的稀缺性会下降,所以它自称环境的复杂度要按「摩尔定律」节奏翻倍,才能持续逼出模型潜力。其三,金融 rubric 的权威性依赖从业者参与,规模化供给不易。这些是赛道真问题,不是否定方向。
边界与后续
需要说明:客户数与收入均为创始人自述,未经独立审计;基准任务取自 anonymized 交易,外部复现需注意脱敏与口径。后续值得跟踪的,是 Halluminate 会不会从金融扩到咨询、保险等相邻垂直,以及「环境复杂度翻倍」的节奏能否真的跟上模型进化——那才是它护城河深浅的真正试金石。
结语
金融智能体离好用还差得远,这件事本身就是一个市场。Halluminate 九人团队靠把「什么算对」做成可训练环境,拿到了头部实验室的订单与三千万美元融资——它提醒行业:当模型越来越强,稀缺的不再是算力,而是能把真实工作流变成可验证信号的那双手。