• 我的订阅
  • 科技

首个AI高考全卷评测结果发布:最高分303,数学全不及格

类别:科技 发布时间:2024-06-24 09:22:00 来源:第一财经

高考覆盖各类学科及题型,同时因其开考前的“绝密性”,被视作中国最具权威的考试之一。这一面向人类设计的高难度综合性测试,目前普遍被研究者用于考察大模型的智能水平。

在前不久高考结束后,上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。

语数外三科加起来的满分为420分,此次高考测试结果显示,阿里通义千问2-72B排名第一,为303分,OpenAI的GPT-4o排名第二,得分296分,上海人工智能实验室的书生·浦语2.0排名第三,三个大模型的得分率均超过70%。来自法国大模型初创公司的Mistral排名末尾。

首个AI高考全卷评测结果发布:最高分303,数学全不及格

此次测试的模型分别来自阿里巴巴、零一万物、智谱AI、上海人工智能实验室、法国Mistral的开源模型,以及来自OpenAI的闭源模型GPT-4o。实验室表示,因无法确定闭源模型的更新时间,为公平起见,此次评测没有纳入商用闭源模型,仅引入GPT-4o作为评测参考。这次选择参与高考的“考生”均在高考前(2024年4月-6月)开源,避免了“刷题风险”。

从结果来看,大模型的语文、英语考试水平普遍不错,但数学都不及格,最高分也只有75分,来自书生·浦语2.0,其次是GPT-4o,得分73分。语文最高分是通义千问,英语最高分是GPT-4o。

在数学方面大模型还有很大的提升空间。数学关乎复杂推理相关能力,这是大模型普遍面临的难题,也是大模型在金融、工业等要求可靠的场景落地需要的关键能力。

首个AI高考全卷评测结果发布:最高分303,数学全不及格

上海人工智能实验室领军科学家林达华此前在采访中对第一财经介绍,复杂推理关系到落地应用时大模型的可靠性,例如在金融这样的场景下不能在数字上有差错,会对数学上的可靠性有较高的要求。另外随着大模型进入商用,若要分析一家公司的财报,甚至是工业领域要去分析一些技术文档,这时数学方面的计算能力就会成为一个壁垒。

“现在很多大模型的应用场景是客服、聊天等等,在聊天场景一本正经胡说八道影响不太大,但它很难在非常严肃的商业场合去落地。”林达华此前表示。

对于此次测试细节,上海人工智能实验室介绍,评测采用全国新课标I卷,“语数外”三科全卷测试,包括客观题与主观题。成绩由具备高考评卷经验的老师匿名人工判分,阅卷开始前,阅卷教师未被告知答卷均由模型生成,使阅卷教师完全以面对真实考生的标准评判回答效果。

值得注意的是,大模型犯错误的方式和人类考生有差异,从实践上来看阅卷老师们不完全适应给大模型评分,因此存在有题目误判的可能。实验室表示,每个题目都邀请了至少三位老师评阅取均分,团队对分差较大的题目还进行了再次审核,贴近高考真实阅卷标准。

实验室表示,在打分前,老师们并未被告知答案由大模型生成,但由于有的模型会存在完全不理解题意导致乱答、重复生成、回答更像解析而非解答的问题,老师们在阅卷过程中基本都会和团队确认这些情况是否是正常情况,团队会要求老师将离谱的错误直接视为答题错误,解析类型的回答以是否包含正确解题过程作为唯一准则。

在完成所有大模型答卷的评卷工作后,阅卷教师被告知所评“考生”的真实身份为大模型。研究人员同时邀请各科教师对大模型表现进行了整体分析,为模型能力提升策略提供参考。

语文方面,老师们认为,模型的现代文阅读理解能力普遍较强,但是不同模型的文言文阅读理解能力差距较大。大模型作文更像问答题,虽然有针对性但缺乏修饰,几乎不存在人类考生都会使用举例论证、引用论证、名人名言和人物素材等手法 。多数模型无法理解“本体”“喻体”“暗喻”等语文概念。语言中的一些“潜台词”,大模型尚无法完全理解。

在数学试卷上,老师们发现,大模型的主观题回答相对凌乱,且过程具有迷惑性,甚至出现过程错误但得到正确答案的情况。大模型的公式记忆能力较强,但是无法在解题过程中灵活引用。

英语则整体表现良好,但部分模型由于不适应题型,在七选五、完形填空等题型得分率较低。大模型英语作文普遍存在因超出字数限制而扣分的情况,而人类考生多因为字数不够扣分。

此外,一些老师提出,由于全部回答没有卷面,所以在作文的评判上会存在1-2分的误差。

(本文来自第一财经)

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-06-24 12:45:20

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

...考语、数、外全卷能力测试。据OpenCompass于6月19日发布的评测结果,大模型的语文、英语考试水平还不错,但数学都不及格
2024-06-26 07:26:00
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试
2024-06-20 10:19:00
...“一本”线。与文科相比,大模型的理科成绩要差很多,最高分还不到480分,多数大模型的理科总分在400分以下,数学普遍不及格,相比河南理科511分的“一本”线,大模型还需努力。
2024-06-26 11:14:00
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分
2024-06-20 11:10:00
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...重的安全性评测上,国内模型文心一言4.0表现亮眼,拿下最高分(89.1分),Claude-3仅列第四。自去年3月16日文心一言首发至今,用户数已突破2亿,每天API调用量也突
2024-04-22 09:46:00
安兔兔评测pc版正式发布,欢迎大家下载体验
...会显示详细的信息,比如页面顶端显示的是所测项目中的最高分,这个分数反映了电脑在CPU和GPU中和测试中的最佳表现。10万分以下表示设备可能难以高效处理复杂AI任务,10万-5
2024-10-04 00:33:00
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...,另一方面能够直观体现国产大模型的最新发展进程。 评测结果显示,文心一言app在智能体能力方面表现突出。在用户创建智能体功能方面,文心一言app支持用户通过上传图片或拍照的
2024-03-14 17:06:00
华为pura70ultra霸榜dxomark评测结果公布
...影像评测机构DXOMARK公布了华为影像新旗舰Pura70Ultra的影像评测结果:以163分的总得分,位居全球榜首
2024-05-18 15:10:00
用AI来做全国高考试卷,真的有人试了!结果:成绩偏科很严重
...,还真的有人试了。上海人工智能实验室近日公布了司南评测体系OpenCompass选取开源大模型测试今年高考的全国新课标I卷“语数外”的结果,为了确保“闭卷”考试,大模型的开源
2024-06-26 22:29:00
更多关于科技的资讯:
2月27日,山西转型综改示范区入区企业山西迈杰模具制造有限公司机械加工车间、冲压调试及焊装车间一片热火朝天的生产场景——机器的轰鸣声与员工们的专注身影
2026-03-01 20:19:00
小发票、大活力。市民参与“有奖发票”热情如潮水般奔涌攀升,消费市场焕发出勃勃生机。数据显示,活动启动半个月,已累计有303424张发票中奖
2026-03-01 20:20:00
鲁网3月1日讯日前,兴业银行联合中国电信成功开通全国金融行业首条跨省量子OTN(Optical Transport Network
2026-03-01 17:33:00
养老康复师、整理收纳师持续走热 58到家启动“50万阿姨招募计划”
春节过后,家庭服务消费迅速升温。58到家数据显示,节后找保姆需求订单量超过1月同期2倍以上,同比增长36%;北上广深等一线城市需求月环比增长超87%
2026-03-01 15:07:00
万联易达集团推出新型物流撮合交易平台“易达宝”
在全产业链供应链中,物流成本正在从“可优化项”蜕变为利润的隐形绞索,信息不对称与交易机制失衡导致物流成本层层加码。货主企业为找车需耗费大量时间成本和会员费等隐性支出
2026-03-01 15:09:00
奥托博克唯一线上官方旗舰授权落地京东健康 共助罕见病患者“步履不停”
在2月28日国际罕见病日到来之际,京东健康与全球知名康复品牌奥托博克(Ottobock)的合作迈出坚实一步。针对腓骨肌萎缩症(Charcot-Marie-Tooth disease
2026-03-01 15:11:00
今年5月 全球机器人将在杭州“同台竞技”
人形机器人在生产线上搬运物料 国家机器人检测与评定中心供图都市快报讯 昨天,2026杭州国际具身机器人场景应用大赛宣布
2026-03-01 08:35:00
30天连融三轮,5亿订单在手节后第一周,杭州四足机器人赛道就传来一阵密集的“脚步声”。2月26日,具微科技宣布完成超亿美元A++轮融资
2026-03-01 08:35:00
商报讯 近日,西湖区召开“新春第一会”,探索“顾问式”服务,为建设一流创新生态再出新招。据介绍,2026年,西湖区锚定科创
2026-03-01 08:35:00
昨天,百度智能云项目签约落地上城区。北京百度网讯科技有限公司将与上城区携手共建百度智能云千帆大模型(杭州)产业创新中心
2026-03-01 08:35:00
今年春节,秦皇岛市海港区一旅游景点“上新”智能机器人,该款机器人通过特色舞蹈表演、人机互动等形式,为游客提供表演、人机互动、海洋向导、天气预报等服务,让游客在欢声笑语中感受科技的
2026-03-01 10:32:00
杭州又一机器人大赛 定档5月
商报讯 又一机器人赛事即将开赛——5月15日至16日,2026杭州国际具身机器人场景应用大赛将在杭州云栖小镇会展中心和双浦机器人测试训练场举行
2026-03-01 08:35:00
鲁网2月28日讯冬尽春归,马蹄报喜。2026年迎来史上最长9天春节假期。从装点门庭的年俗好物,到象征团圆的珍馐美馔,涌动着万象更新的消费活力
2026-02-28 22:40:00
在全球经济充满不确定性的时代背景下,企业如何在危机中把握机遇、在变局中实现稳健增长,成为衡量领导者战略能力的重要标尺。作为荷美尔亚太区总裁
2026-02-28 17:17:00
电与未来同行:松下中国在海南开展电能知识可持续科普活动
2026年1月,松下中国来到海南乡村学生身边,在万宁市和乐、莲花、礼纪等地开展可持续教育科普活动。课程活动以“电能”为核心线索
2026-02-28 17:19:00