当前位置: 首页 >综合快讯 > 内容

首个AI大模型高考全卷评测结果发布

综合快讯
导读 据上海人工智能实验室官微,近日,司南评测体系OpenCompass选取6个开源模型及OpenAI的GPT-4o开展首个大模型高考“语数外”全卷能力测试...
2024-06-19 17:01:26

据上海人工智能实验室官微,近日,司南评测体系OpenCompass选取6个开源模型及OpenAI的GPT-4o开展首个大模型高考“语数外”全卷能力测试。评测采用全国新课标I卷,参与评测的所有开源模型,开源时间均早于高考,确保评测 “闭卷”性。同时,成绩由具有高考评卷经验的教师人工评判,更加接近真实阅卷标准。首个大模型高考全卷评测结果显示,阿里通义千问Qwen2-72B、OpenAI的GPT-4o及书生·浦语0文曲星(InternLM2-20B-WQX)成为本次大模型高考的前三甲,对应得分率分别为71%、70.5%和70.4%。大部分模型在“语言”本质上的表现良好,语文平均得分率为67%,英语更是达到了81%。而数学则是所有大模型的短板,平均得分率仅为36%;InternLM2-20B-WQX取得了75分的最高分,超过所有受测模型。然而仍未达到及格水平。

文章转载自:界面新闻网 非本站原创

版权声明:转载此文是出于传递更多信息之目的。若有来源标注错误或侵犯了您的合法权益,请作者持权属证明与本网联系,我们将及时更正、删除,谢谢您的支持与理解。