2026年7月初,法国AI公司Mistral AI发布了Leanstral 1.5——一款在形式化验证(Formal Verification)领域取得突破进展的开源模型。这一发布的意义远超常规的模型版本迭代:Leanstral 1.5证明了开源模型有能力在数学定理证明、代码形式化验证等高难度领域达到顶尖水平,并在真实世界的代码中自主发现了5个此前未知的安全漏洞。

在AI产业高度聚焦于Agent能力和多模态扩展的当下,Leanstral 1.5的发布提醒我们:AI在"深度推理"这条赛道上取得的进展,可能比大多数人所意识到的更为深远。

一、模型规格:119B 总参 + 6B 激活的 MoE 架构

Leanstral 1.5采用混合专家(MoE)架构,总参数规模达到119B(1,190亿),但每次推理时仅激活约6B参数。这种"大容量、小激活"的设计理念与Mistral AI一贯的工程风格保持一致——在保持模型能力的同时,显著降低推理成本和部署门槛。

模型以Apache-2.0协议开源,意味着开发者可以自由使用、修改和商用。这对于形式化验证这一原本门槛极高的领域而言,是一个显著的"民主化"信号。此前,顶尖形式化验证技术主要掌握在少数学术机构和大厂手中,Leanstral 1.5的开源让更多开发者能够接触到这一能力。

在训练方法上,Mistral AI采用了"中段训练(Mid-training)+ 监督微调 + CISPO强化学习"的多阶段训练策略。正是这种独特的训练管线使Leanstral 1.5具备了强大的"智能体证明工程(Agentic Proof Engineering)"能力——模型不仅能够理解数学命题和代码逻辑,还能自主推导证明步骤、验证代码正确性。

二、核心突破:PutnamBench、miniF2F 与真实漏洞发现

Leanstral 1.5在多项权威基准测试中交出了令人瞩目的成绩单:

PutnamBench:587/672 道难题被攻克。Putnam数学竞赛试题以极高的推理难度著称,即便是顶尖人类数学专业学生也难以轻松应对。Leanstral 1.5成功解决了587道(共672道),覆盖率达到87.4%。这不仅体现了模型在高级数学推理上的能力,更意味着AI在"理解抽象数学概念→构建证明路径→验证证明正确性"这一完整推理链条上取得了实质进展。

miniF2F基准测试达到饱和。miniF2F是形式化验证领域最被广泛认可的基准测试之一,Leanstral 1.5在这项测试中达到了饱和水平(接近或达到满分)。这标志着模型在标准化的定理证明任务上已经具备了相当成熟的能力。

真实代码验证中自主发现 5 个未知漏洞。这是Leanstral 1.5最具实践价值的成就。在对真实世界开源代码库的验证过程中,模型自主发现了5个此前未被记录的漏洞。这些漏洞的范围和具体细节目前行业暂未披露,但这一成果本身具有里程碑意义——它意味着AI Agent已经从"辅助程序员检查代码"进化到了"像安全研究员一样主动挖掘未知漏洞"的阶段。

三、形式化验证为何重要:AI 安全的"数学保障"

形式化验证是一种通过数学方法证明系统行为符合规格说明的技术。与传统的软件测试(只能证明存在bug,不能证明没有bug)不同,形式化验证能够在理论上保证代码的正确性——只要证明过程正确,结果就具有数学意义上的确定性。

在AI Agent快速进入关键行业的背景下,形式化验证的价值正在被重新发现。当AI Agent被用于自动驾驶、医疗诊断、金融交易、工业控制等高风险场景时,单纯依赖"测试用例通过"远远不够——我们需要数学级别的正确性保证。Leanstral 1.5展示了AI自身可以成为形式化验证的有力工具,这为AI Agent的安全保障开辟了一条全新的路径:用AI来验证AI的行为正确性。

特别是在AI Agent安全事件频发的当下——JADEPUFFER AI自主勒索攻击刚刚曝光、GPT-5.6全系触及安全警戒线——形式化验证提供了一种"先天免疫"的可能性。不用事后打补丁、不用应急响应,而是在代码被部署之前,通过数学方法证明其行为符合预期。

四、开源生态的分化:MoE 模型成为"新主流"

Leanstral 1.5的发布也从一个侧面印证了MoE架构在开源生态中的崛起趋势。2026年上半年,多个重量级开源模型采用了MoE路线:DeepSeek V4系列的MoE版本、美团LongCat-2.0的48B激活设计、华为openPangu-2.0-Flash的92B总参/6B激活结构。MoE架构正在成为开源大模型兼顾能力与效率的主流选择。

对于开发者社区而言,Leanstral 1.5的开源意味着可以将其与现有开发工具链集成。模型已通过Hugging Face和免费API开放,开发者可以将其用于代码审计、安全检测、数学研究等场景。而其在形式化验证领域的专项能力,也为构建更可靠的AI Agent应用提供了底层技术支撑——当Agent在执行关键操作前能够"自证正确",整个AI生态的安全水位将得到根本性提升。