主要来源Decoder
查看原文事件专题 · 多源确认
GPT和Claude在桥水基金金融测试中失败,因正确答案从未公开
桥水基金与Thinking Machines Lab的测试显示,一个经过微调的开源权重模型在金融文档评估任务上超越了GPT-4和Claude 3.5,且成本降低90%。该微调模型基于Llama 3.1 70B,在桥水内部金融问答数据集上训练,准确率达到92%,而GPT-4仅为78%。测试涵盖2000份真实金融文件,正确答案未公开以避免数据污染。
当前结论
桥水基金用自家金融数据微调了一个开源模型,结果比GPT和Claude都强,成本还低得多。想搞垂直领域微调的可以看看。
3 个信源63° AI 热度最后更新 2026/7/3 11:16:42
证据链
相关来源 1The Rundown AI
查看原文相关来源 2IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。