AI 快讯 编译自 the_decoder #模型评测#金融AI#开源模型

桥水基金测试:GPT和Claude在金融文档评估中败给开源微调模型,因正确答案从未公开

桥水基金与Thinking Machines Lab联合测试发现,经过微调的开源模型在金融文档评估中超越GPT-4和Claude,成本仅为十分之一。原因在于正确答案从未公开,揭示了通用大模型在专业领域的局限性。

编译发布 2026/07/03 原文发布 2026/07/03

一句话看懂

桥水基金测试显示,微调的开源模型在金融文档评估中击败GPT-4和Claude,成本仅十分之一,关键原因是正确答案从未公开。

详细发生了什么

对冲基金桥水(Bridgewater)与Thinking Machines Lab联合发布报告称,在金融文档评估测试中,一个经过微调的开源模型(基于Llama 3.1 70B)表现优于GPT-4、Claude 3.5 Sonnet等最强商业模型。测试涉及分析复杂的金融文件,如财报、监管文件和内部备忘录,要求模型提取关键信息并做出判断。

桥水发现,商业模型之所以失败,是因为测试所需的正确答案从未出现在公开训练数据中——这些答案来自桥水内部数十年的投资经验。而微调后的开源模型通过少量内部数据(约1000份标注文档)进行针对性训练,准确率提升了40%,成本仅为调用GPT-4 API的十分之一。

中文圈视角

这对中文用户意味着什么?首先,国内金融从业者常依赖Kimi、DeepSeek等模型处理财报,但同样面临“正确答案不在公开数据中”的问题。桥水的做法提示:微调开源模型(如Qwen2.5、DeepSeek-V3)可能比调用通用API更有效,尤其适合处理中文财报中的特殊术语和格式。

其次,国内监管要求金融数据不出境,使用开源模型本地部署可以规避数据合规风险。目前ModelScope上有多个金融微调模型,但质量参差不齐。桥水的方法论——用少量高质量内部数据微调——值得国内量化基金和券商借鉴。

一个中文圈尚未讨论的盲点:金融AI评估需要“私有测试集”,否则模型可能因数据泄露而虚高成绩。桥水刻意使用从未公开的答案,这提醒国内评测机构应建立类似机制。

几条值得记住的细节

  • 桥水测试使用Llama 3.1 70B作为基座模型,微调成本约5000美元,而调用GPT-4 API完成同等任务需5万美元。
  • 微调模型在“财务异常检测”任务上准确率92%,GPT-4仅78%。
  • 测试集包含500份桥水内部文档,答案从未在互联网上出现。
  • 桥水计划将微调模型用于内部投资决策辅助,不对外公开。
  • Thinking Machines Lab已开源微调代码和部分标注数据(脱敏后)。

一句话总结

通用大模型在专业领域可能不如微调开源模型,关键在于用私有数据做针对性训练。