Model ML正把GPT-5.6 Sol更深地嵌进金融工作流:写研究报告、建模型,直接产出能带进会议室的PowerPoint和Excel文件。根据该公司自建的Composite评测,Sol做PPT时100%生成了可编辑的.pptx文件,但真正达到“可交给同事审阅”门槛的比例只有43.3%。做Excel时,Sol比Opus 5少花36%的token,可关键输出全部正确的模型比例,却从Opus 5的60%掉到了50%。

这组数字比任何“效率飞跃”都诚实:金融AI已经能把大部分体力活接过去,但要顶替分析师最后一道判断,还差一层审核。

Sol怎么被塞进金融流程

Model ML由Arnie和Chaz Englander两兄弟创立。两人套现退出上一段创业后,靠家族办公室做投资,顺手把自己用的软件做成产品对外销售。公司的核心是一个负责规划任务、挑选工具、核对证据的中枢代理,具体执行常派给GPT-5.6 Sol。

它配的文档工具能直接生成带来源追溯的原生Office文件。用户可以从邮件里交代任务,中途切到Office插件继续做,不用重新解释一遍。

Model ML举了两个场景。某全球资产管理机构做一份定制tearsheet,过去分析师要花约1小时,现在压缩到约5分钟。另一个案例里,代理一次处理了超过10万行、数百个文件的虚拟数据室。这类量级的资料整理,本来就是分析师最耗时、也最不需要判断力的部分——效率提升发生在这一层,不代表判断力也被替代了。

PPT领先,Excel掉队:一张表说清楚

Sol和Opus 5的差距不是单向的。PPT这条线上Sol占优,Excel这条线上反而是Opus 5更准。

指标GPT-5.6 SolOpus 5
PPT:生成.pptx比例100%76%
PPT:达到专业审阅门槛比例43.3%26.7%
Excel:平均token/表格2.44M(省36%)3.83M
Excel:关键输出全对比例50%60%

数据来自Model ML自建的Composite评测。

即便是表现最好的Sol,PPT每十份里也有近六份还没资格进入人工复核。Excel那条线更麻烦:token省了,正确率没跟上,另一款模型GPT-5.6 Terra处理一份workbook只要4.2分钟,比Sol的7分钟还快。没有一个模型在所有维度都最优。Model ML把Sol推上生产线,赌的是“完成率+省token”对客户更划算,不是全面碾压Opus 5。

PPT产出率100%,专业过关率仅43.3% 100% 生成可编辑.pptx文件比例 Opus 5:76% 43.3% 达到专业审阅门槛比例 Opus 5:26.7%
Excel测试:省token,但全对率不如Opus 5 GPT-5.6 Sol 2.44M 平均token/表格(省36%) 50% 关键输出全对比例 Opus 5 3.83M 平均token/表格 60% 关键输出全对比例

谁该跟着调整动作

Composite是Model ML自己搭的评测体系,工具链和打分门槛都是自己定的。结果说明这颗模型和这套流程配合得不错,不能直接当成独立第三方验证的结论——公司没有公开任务样本量、任务类型分布和测试时间,这些都是采购前该问清楚的问题。

投行、资管和家族办公室的分析师和团队负责人不必指望“少做PPT”就万事大吉。真正该调整的是把时间从排版、找链接、核对数字这些体力活挪到判断假设是否成立上。43.3%的专业审阅达标率意味着大多数产出仍需返工,团队内部的复核门槛不能因为“AI能生成文件”就调低。

评估AI代理、Office自动化和金融软件采购的企业决策者,可以把Model ML这份自建评测当作试点参考,不宜当作独立验证结论直接拿去做采购决定。Excel密集型的团队尤其要留意:如果任务对准确率的要求高于对token成本的要求,现阶段的数字并不支持把Opus 5换成Sol。更现实的做法是先用接近10万行规模的真实数据集做小范围试跑,再决定是否扩大部署。

接下来值得盯两件事:Model ML是否会公开第三方评测或更完整的任务细节,以及Sol在Excel上的全对率能不能在下一轮迭代里追上Opus 5。如果这两项都没有动静,Sol现阶段更像是“更快更全”的执行工具,还不是能独立签字的分析师替身。