今天看到一个排行榜,反复确认了三遍数据。一个独立评测者Ed Yau在8月23日发布了最新的大模型综合效能测评,测了17款前沿模型。智谱的GLM-5.3拿下第一名:28项实战任务100%通过,rubric评分9.3分(满分10),成本只要0.28美元。
同一套测试,GPT-5.5花了1.43美元。成本差了五倍,效果还略逊一筹。这个结果有点出人意料。
Ed-o-Meter:不是跑分,是实战
先说这个排行榜是什么。Ed Yau是英国Kerv公司的应用AI架构师,他自己搭了一套测试框架叫Ed-o-Meter。跟学术跑分不同,他选的是开发者和分析师日常真实会做的工作任务。五类测试:编程、数据分析、商业场景、安全检查、工具调用。
关键设计是:同一个prompt,17个模型完全一样的输入,确定性评分,只跑一轮。整套测试跑下来大概花费30美元。源码和每个模型的原始输出都公开链接可以查看。
这个设计思路跟传统的MMLU、HumanEval这类学术benchmark完全不同。学术跑分考的是模型在标准化题目上的表现,Ed-o-Meter考的是模型在真实工作场景里的表现。Yau自己也说,这些任务不算研究生水平的难题,更像是Agent系统里单个步骤的单元测试。
GLM-5.3为什么能拿第一
GLM-5.3是智谱8月14日发布、8月19日开放API的新一代旗舰模型。它沿用GLM-5.2的基座,主要通过扩大后训练规模来提升能力。简单说,不是重新训一个更大的模型,而是让现有模型在更复杂、更贴近真实工作的环境里反复训练。
在Ed-o-Meter测试中,GLM-5.3的优势体现在两个方面。一是实战任务全部通过,没有一项失败。二是安全评分也是100%。很多模型为了压低成本会在安全护栏上偷工减料,但GLM-5.3没有这个取舍。
同时,在Artificial Analysis最新的综合智能指数中,GLM-5.3拿到60分,进入全球前沿模型区间,和Claude Fable 5、GPT-5.6 Sol等闭源旗舰处在同一档。在LMArena匿名盲测Elo评分中,GLM-5.3-max以1487分排到第一。
开源模型和闭源模型的差距在缩小
更值得关注的趋势是:开源模型正在快速追平闭源模型。GLM-5.3是开源权重的,DeepSeek-v4-pro紧随其后排名第二,也是开源的。而OpenAI、Anthropic、Google的闭源模型 clustered在它们下方。
36氪的分析文章有一个很精准的问题:更强的GLM-5.3,为什么没有刷屏?答案是,模型跑分领先已经很难让市场兴奋了。4月GLM-5.1发布时智谱股价涨11.5%,6月GLM-5.2涨32.8%,但8月GLM-5.3发布当天股价跌了3.6%。
这说明行业已经过了靠模型能力突破就能引爆市场的阶段。现在的竞争维度是:更强的模型还能带来多大的差异化优势?这种优势能不能转化成产品和收入?
价格战才刚刚开始
从Ed-o-Meter的数据看,17款模型的成本差异巨大。GLM-5.3完成全套测试只要0.28美元,GPT-5.5要1.43美元。有些模型拒绝回答安全提示,几乎零成本输出,但这在实际使用中毫无价值。排行榜对这些数据做了调整。
延迟方面差异更大。最快的Haiku-4-5中位响应时间0.9秒,DeepSeek-v4-pro要40秒,但两者都能拿高分。这说明在实际部署中,速度和质量的权衡是真实存在的。
对做Agent系统的人来说,这些数据非常有价值。一个Agent工作流包含很多步骤,每个步骤需要一个模型来完成。你不可能所有步骤都用最贵的模型,也不可能所有步骤都用最快的。你需要根据任务风险、成本预算和延迟要求来选择合适的模型组合。
一个值得警惕的细节
Ed Yau在发布时也标注了几个需要注意的地方。一是部分rubric评分是由模型自己回顾打分的,存在潜在偏差。有一个案例是Fable-5自己给自己打了分。二是有些模型拒绝回答特定安全提示会导致成本计算失真。三是样本量较小,Wilson 95%置信区间在某些模型上有重叠。
但瑕不掩瑜。这套测试最大的价值在于透明和可复现。所有prompt、所有原始输出、所有评分决策都公开展示,任何人都可以验证和扩展。在满世界都是厂商自吹自擂的时代,这种独立评估太稀缺了。
我的判断
大模型评测正在从学术benchmark走向实战benchmark。MMLU、HumanEval这些题目已经被训练数据污染得差不多了,模型在上面的分数已经很难区分真实能力。未来有价值的是Ed-o-Meter这类测试:真实任务、透明评分、可复现。
GLM-5.3拿下第一,但它的竞争对手DeepSeek-v4-pro、Kimi K3、Qwen3.8-Max都在快速迭代。国产模型之间的差距已经很小了,真正的竞争不在模型本身,而在谁能把模型能力变成产品和收入。
对开发者来说,好消息是选择越来越多了。开源模型追平闭源,价格战开打,推理成本持续下降。你需要的不是一个最好的模型,而是一个最适合你场景的模型组合。

Ed Yau自己说这些任务像Agent系统的单元测试,说得很准。未来Agent系统每个步骤选不同模型组合,就像搭积木一样。这个评测给的正好是积木块的参数表
0.28美元跑完28项任务,GPT-5.5要1.43美元。差了五倍的价格,这个差距在生产环境里会非常明显。开源模型真的开始卷死闭源了
一个模型100%通过实战但只有33%安全评分,这就像学霸考试全对但作弊了。能力和安全不能二选一,GLM-5.3都拿到满分才叫真本事
从数据看,GLM-5.3的性价比确实突出。但DeepSeek-v4-pro紧跟其后,两者总分只差1.7分。开源模型集体崛起这个趋势比谁第一更重要。
做Agent的来说这个评测太有用了。我们选型的时候最怕的就是厂商自己发的跑分,水分太大。Ed-o-Meter这种独立评估加全量公开输出的模式,才是真正能指导决策的。