今天看到一组数据,反复确认了三遍才敢信。伦敦一家叫Inherent的AI初创公司,用Qwen 3.6这个27B参数的小模型,在科学论文复现任务上跑出了0.791分,超过了Claude Opus 4.8的0.748分和GPT-5.5的0.729分。
注意,这不是在什么小众基准测试上刷分,而是他们自己发布的Replica基准测试,专门评估AI独立复现已发表科学论文结果的能力。27B对数千亿参数的模型,这仗打赢了。
为什么科学复现这么难?
先说背景。科学论文复现一直是学术界的痛点,你看到一篇论文声称发现了新方法,但自己按步骤跑却跑不出同样的结果。这不仅仅是执行力的问题,更需要理解实验设计的逻辑、判断哪些参数是关键变量、知道什么时候该调整策略。
传统的AI模型做这个事情,基本就是按部就班地执行。但Inherent的Faraday不一样,它用的是强化学习训练出来的科学判断力,他们内部管这个叫"品味"。说白了就是,模型不光能读懂论文,还能理解为什么要这样设计实验。
27B凭什么打赢千亿参数?
这里的关键不是模型大小,而是训练方法。Inherent的创始人都是DeepMind出来的,他们的核心假设是:在特定任务上,经过针对性强化学习的中小模型,可以超越通用大模型。
Faraday跑在Qwen 3.6上面,27B参数,体量大概只有Claude Opus 4.8的几十分之一。但它通过强化学习学会了实验设计、变量控制和错误排查的能力。这就好比一个专科学历但经验丰富的实验员,可能比刚入职的博士更能搞定某些具体实验。
这件事的行业意义
这个结果之所以重要,不是因为它证明了小模型一定比大模型好,而是因为它揭示了一个趋势:AI能力的提升路径不只有一条。
过去两年行业的主旋律是"大力出奇迹",参数越堆越多,算力越烧越大。但现在有人证明了,在垂直领域用强化学习训练中小模型,成本更低、效果更好、部署更灵活。
对开发者来说,这意味着你可能不需要调用最贵的API,一个本地部署的27B模型加上好的训练方法,就能解决很多专业问题。
Inherent的野心不止于此
这家公司刚以5000万美元种子轮走出隐身模式,团队只有12个人。他们的长期目标不是做一个论文复现工具,而是做一个AI科学家,能帮人类发现新知识。
论文复现只是起点。如果你能教会AI读懂论文、复现实验,下一步就是让它设计新实验、提出新假设。这条路走通了,AI就不再是知识的生产者,而是知识的发现者。
5000万美元、12个人、27B参数模型,干翻了硅谷几百亿美元堆出来的巨头。这个故事本身就够科幻的。

论文复现只是第一步,下一步要是能自动设计实验提出新假设,那就真成AI科学家了 ?
Qwen 3.6 27B当底座,说明开源模型的潜力被严重低估了。配合好的训练方法,中小模型的天花板远比想象中高。
12个人5000万美元干翻硅谷几百亿的军备竞赛,这才是真正的以小博大。
强化学习教出来的科学品味,这个概念有点意思。不是让AI死记硬背,而是让它学会判断什么时候该改参数。
数据说话:0.791 vs 0.748 vs 0.729。27B打赢千亿参数,关键变量不是模型大小而是训练方法。这个结论对整个行业都有参考价值。