Mistral 开源 Leanstral 1.5:在 Lean 4 形式化验证中超越基准,并发现真实代码漏洞
Mistral AI 发布开源模型 Leanstral 1.5,专为 Lean 4 形式化验证设计。在数学基准测试中表现优异,扫描 57 个开源仓库时发现 5 个未知 bug。本文解读其技术亮点、对中文开发者的实用价值,以及与国产形式化验证工具的对比。
一句话看懂
Mistral AI 发布 Leanstral 1.5,一个专为 Lean 4 形式化验证设计的开源模型,在数学基准测试中表现优异,并能在真实代码中揪出隐藏 bug。
详细发生了什么
Mistral AI 发布了 Leanstral 1.5,这是其专为 Lean 4 形式化验证系统设计的开源模型的升级版。该模型在多个形式化数学基准测试中取得了领先成绩,包括 MiniF2F 和 ProofNet,证明了其在自动定理证明方面的能力。
更引人注目的是,Leanstral 1.5 在扫描 57 个开源仓库时,成功发现了 5 个此前未被发现的 bug。这些 bug 并非简单的语法错误,而是涉及逻辑缺陷和边界条件,传统测试工具难以捕获。Mistral 表示,Leanstral 1.5 通过将自然语言描述转换为 Lean 4 形式化规范,并自动生成证明,从而实现了对代码的深度验证。
该模型基于 Mistral 的 7B 参数架构,采用 Apache 2.0 许可证开源,支持在消费级 GPU 上运行。Mistral 同时发布了模型权重和推理代码,鼓励社区参与改进。
中文圈视角
Leanstral 1.5 对中文开发者意味着什么?首先,形式化验证在金融、航天、操作系统等安全关键领域需求迫切,但此前门槛极高。Leanstral 1.5 的开源降低了这一门槛,国内团队可以直接下载使用,无需依赖闭源服务。
与国产替代对比:目前国内类似项目较少,清华大学有 Lean 4 相关研究,但缺乏成熟的工具化模型。智谱 AI 的 GLM 系列虽支持代码生成,但未针对形式化验证优化。Leanstral 1.5 填补了这一空白,尤其适合需要高可靠性的国产软件项目。
实际场景:国内开发者可以用它验证 Rust 或 C++ 代码的边界条件,或辅助数学竞赛题目的形式化证明。不过,Lean 4 本身学习曲线陡峭,中文文档稀缺,这仍是推广的障碍。
监管角度:形式化验证有助于满足《关键信息基础设施安全保护条例》中对软件安全的要求,Leanstral 1.5 的开源特性避免了数据出境风险。
几条值得记住的细节
- Leanstral 1.5 在 MiniF2F 基准测试中达到 42.3% 的准确率,比上一代提升 12 个百分点。
- 扫描 57 个开源仓库时发现 5 个真实 bug,涉及 Rust 和 C++ 项目。
- 模型基于 Mistral 7B 架构,使用 Apache 2.0 许可证开源。
- 支持在单张 RTX 4090 上运行,推理速度约 10 秒/个证明。
- Mistral 同时发布了 Lean 4 的 fine-tuning 数据集,方便社区二次开发。
一句话总结
Leanstral 1.5 让形式化验证从学术工具走向实用,中文开发者可免费用于高可靠性项目,但需先攻克 Lean 4 的学习门槛。