豆包大模型首次公开评测

2024-06-21 20:42:18

信息时报讯（记者卢云龙）近日，智源研究院旗下的 FlagEval 大模型评测平台发布最新榜单：在有标准答案的“客观评测”中，GPT-4 以76.11分在闭源大模型中排名第一；Doubao-Pro（豆包大模型）以75.96分排名第二，其后依次是 ERNIE 4.0、Baichuan3、Moonshot-v1。在开放问答等“主观评测”中，Doubao-Pro 同样排名第二，得分超过 GPT-4o 和 GPT-4。

Doubao-Pro 是由字节跳动自主研发的大语言模型，于5月15日正式发布。本期 FlagEval 大模型排行榜，是豆包大模型在公开评测中的首次亮相。

测试成绩显示，豆包大模型的数学能力、知识运用、任务解决等多项能力在客观评测和主观评测中都有出色表现。数学能力是评估大模型是否“聪明”的一个重要维度。此前，复旦大学自然语言处理实验室就2024 年高考数学题对13家主流大模型产品进行评测，豆包的数学高考新课标 II 卷答题获得最高分，客观题正确率达到 74.66%，成绩优于GPT-4o。

目前，豆包大模型正在通过字节跳动旗下的火山引擎向企业市场开放服务，已经与OPPO、荣耀、小米、三星、华硕等智能终端厂商建立合作。