• 我的订阅
  • 头条热搜
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分,OpenAI的GPT-4o和上海人工智能实验室的书生·浦语2.0文曲星(InternLM2-20B-WQX)排...……更多
...考语、数、外全卷能力测试。据OpenCompass于6月19日发布的评测结果,大模型的语文、英语考试水平还不错,但数学都不及格,最高分只有75分(满分150分)。参加OpenCompass此次高考测试的大模型,分别是来自阿里巴巴、零一万物、...……更多
首个AI高考全卷评测结果发布:最高分303,数学全不及格
...能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。语数外三科加起来的满分为420分,此次高考测试结果显示,阿里通义千问2-72B排名第一,为303分,OpenAI的GPT-4o排名第二,得分296分,上海人工智能实验室的书生...……更多
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试。评测采用全国新课标I卷,参...……更多
...获国内头筹在极客公园最新发布的高考新课标Ⅰ卷大模型评测报告中,GPT-4o以562分排名文科总分第一。国内产品中,字节跳动旗下的豆包拔得头筹,成绩是542.5分。据介绍,本次评测以新课标Ⅰ卷为考题,与河南省考卷完全相同...……更多
用AI来做全国高考试卷,真的有人试了!结果:成绩偏科很严重
...,还真的有人试了。上海人工智能实验室近日公布了司南评测体系OpenCompass选取开源大模型测试今年高考的全国新课标I卷“语数外”的结果,为了确保“闭卷”考试,大模型的开源时间早于高考,同时邀请有高考评卷经验的教师...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...计意义思考不足,起码会带来以下几个潜在危害:其一,评测结果能否真实反映大模型的能力?如果对此认识不足,往往会过分夸大模型的效果。其二,会让人以为指标的提升,等价于大模型能力的提升、以及等价于真实场景的...……更多
智源评测体系发布 国内外“百模”评估结果出炉
...140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理解、知识运用、推理能力、数学能力、代码能力、任务解决、安全与价值观七大能力;针对...……更多
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...究中心联合中关村实验室研制的SuperBench大模型综合能力评测框架,正式对外发布2024年3月版《SuperBench大模型综合能力评测报告》。评测共包含了14个海内外具有代表性的模型,结果显示:文心一言4.0表现亮眼。例如在人类对齐能...……更多
高通骁龙xelite核显adrenox1评测
...了英特尔酷睿Ultra7155H、AMD7840HS等处理器核显性能。综合评测结果来看相比较AMD的Phoenix、英特尔的MeteorLake核显,AdrenoX1在基本的32位和16位浮点数学运算方面的吞吐量很有竞争力。此外得益于速度极快的LPDDR5X主控,AdrenoX1的DRAM带.……更多
AI界新晋王者被曝抄袭、作弊、做假,脸都丢光了
...比如,谷歌引以为傲的MMLU,是一个由伯克利大学主导的评测,囊括阅读理解、大学数学以及物理和社会科学等57项测验。但如果说,这些题目,是可以事先得知的呢?9月,中国人民大学与伊利诺伊大学香槟分校联合推出了一个...……更多
一加 Ace 3 Pro全面评测:续航、性能、拍照,它全都要
在这个快节奏的时代,智能手机已经成为我们生活的一部分,而对于许多用户来说,续航焦虑和性能瓶颈是两大痛点。今天,我们要为大家带来的,是一款能够打破这些焦虑的产品——一加Ace3Pro。这款手机不仅在性能上达到了...……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...,另一方面能够直观体现国产大模型的最新发展进程。 评测结果显示,文心一言app在智能体能力方面表现突出。在用户创建智能体功能方面,文心一言app支持用户通过上传图片或拍照的方式制作智能体形象,同时支持用户通过...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前三,超越了谷歌的 Gemini-1.5-Pro 和 GPT-4v,仅次于 GPT-4o(69.9)和 Clau...……更多
科学家建立新评价基准,助力评估大模型数据分析能力
...集。虽然这类数据的生成成本较低、人力需求不高,但是评测方法的开发却需要他们逐一校验,因为数据分析的结果并不仅仅依赖于执行的一致性。例如,在生成分类器的问题上,即便参考代码的执行结果和预测代码的结果不一...……更多
从AI搜索到语音陪练,腾讯元宝全面评测来了!大模型C端玩家谁更胜一筹?
《科创板日报》5月31日讯(记者 朱凌)直至五月尾声,AI应用市场的火热态势依旧不减。30日,基于混元大模型的AI助手App“腾讯元宝”上线,标志着BAT终于在AI消费C端应用领域聚首。据介绍,自2023年9月首次亮相以来,腾讯混...……更多
9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了
...空间。最近的一次,第一财经曾在6月报道过,根据司南评测体系OpenCompass的高考全卷测试,包括GPT-4在内,7个大模型在高考测试中语文和英语考试水平普遍不错,但数学这科全不及格,最高分也只有75分。在批阅大模型的数学试...……更多
Redmi K70 至尊版性能评测:跑分231万
...RedmiK70至尊版上同时开启,超高流畅度与超高清晰度“我全都要”,而不是一些友商产品的二选一。目前RedmiK70至尊版已经支持包括《原神》1.5K+120Hz在内的共20款游戏的超帧超分功能并发,游戏体验直接拉满。 当然,性能的强悍...……更多
中国移动5g手机综合评测结果公布
中国移动近日公布了2023年度5G手机综合评测结果,32款热门机型接受了从通信能力到用户口碑的全方位考核,小米和荣耀分别在高端和中端市场夺得冠军,展现了国产手机的强大实力。5G手机测评体系,用户体验为先中国移动的5...……更多
华为pura70ultra霸榜dxomark评测结果公布
...影像评测机构DXOMARK公布了华为影像新旗舰Pura70Ultra的影像评测结果:以163分的总得分,位居全球榜首,更在五个子项目中荣获三个最高分。值得关注的是,华为Pura70Ultra此次的得分并非微小优势,而是以显著的5分差距,远超第二...……更多
...技术生态、产业生态和开放性等多个维度进行评估,确保评测结果客观真实。此次评测结果将形成针对特定应用场景的综合报告和产品推荐目录,为政府、企业和研究机构建设智算中心提供芯片选型的重要参考和决策依据。在评...……更多
AI安全守护计划启动!信通院牵头,AIIA安全治理委员会发布三类模型安全评测
...情况,并启动了AI安全守护计划,发布了三大类别的安全评测结果。AIIA安全治理委员会成立于2023年12月底,经过半年运营,现有治理组、安全组两个工作组,近百家单位加入,主任单位由中国信通院牵头,副主任单位包括多家知...……更多
...护委员会了解到,陕西省2023年首届“三秦伴手礼”消费评测活动已于近日正式启动。据悉,本次消费评测活动最终结果将于2024年3月份发布。首届“三秦伴手礼”消费评测活动分为征集申报、初评筛选、网上评测、优选评测、宣...……更多
2023移动网络质量“百城”专项评测:打造高质量的5G服务
2023年全国重点区域移动网络质量“百城”专项评测活动11月7日正式开启,来自中国信息通信研究院泰尔系统实验室5支专业的网络质量评测团队奔赴全国百余个城市,对重点和热点区域开展移动网络测试。其实“移动网络质量专...……更多
...年首次使用AI评卷辅助校验系统,对试卷主观题进行智能评测参考,对各学科评卷质量进行实时校验,及时发现评卷中可能出现的误差,进一步确保评卷公平公正。三是严格评卷场地管理。评卷期间,所有评卷老师和工作人员,...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
...一致时,就会推翻 “假设”,重新尝试新的假设。 人类评测结果人类在 VCR 任务下的水平如何呢?下图中展示了母语者或各语言的流利使用者在英 / 中两种语言的简单 / 困难设定下的准确度:如果考虑包含时间、地名、人名的...……更多
hightechpoint评测高通骁龙xelite散热表现
...位名为HighTechPoint的用户在Reddit硬件社区发帖,分享了他评测华硕vivobookS15Copilot+PC搭载高通骁龙XElite处理器后的散热表现。经过使用液态金属导热膏进行测试后,结果显示CPU的最高温度降低了2摄氏度。HighTechPoint对普通导热膏和液...……更多
8天线覆盖150平米超大面积,锐捷X32 Pro评测
...网线,然后就是下载锐捷星耀APP,扫码绑定,登录设置,全都一目了然,可以说是0门槛。 我家的路由器摆放的位置是进门的位置,以我们家的户型来说,是比较居中的。唯一不好覆盖的地方就是阳台,因为要间隔两道门,所以...……更多
新能源车评测,懂车帝算是玩明白了
...新能源汽车的基础上,懂车帝正式推出了“6+2新能源汽车评测体系”。该体系共分续航、充电、辅助驾驶等6大维度和冬夏季极限评测2大场景,基于客观真实的实测数据,对新能源车进行综合评分,为消费者提供选买参考。极寒...……更多
2022-12-15 18:40:00新能源,评测
多家车企质疑懂车帝冬测,中汽协呼吁汽车评测应专业公正
...体而言,此次懂车帝冬测引发广泛质或将成为第三方汽车评测领域的转折点,众多网友纷纷呼吁尽快出台真正科学、专业、严谨、公正的测试标准,为行业发展和用户购车用车带来真正的价值。 ……更多
更多关于科技的资讯:
“胖东莱”直播间被曝光:“进口奶粉”实为方便食品
快科技5月12日消息,5月以来,胖东来被碰瓷事件频频发生,而近日一个名为“胖东莱食品中转仓”的直播间也引发热议,被网友质疑又在借机碰瓷胖东来
2025-05-12 18:44:00
高速上女子站快车道当“警示牌”:以为打了招呼就能被看到
快科技5月12日消息,有车的朋友都知道,车上自带的三角警示牌就是为了在紧急情况下使用的,它能提醒后车前方存在意外情况,进而及时减速或者变道躲避
2025-05-12 18:44:00
曝光丰田计划收购哪吒汽车 高管回应:\
快科技5月12日消息,今天下午,有消息称丰田汽车可能要收购国内的新能源汽车制造商哪吒汽车。这消息一出,立刻引起了很多人的关注和讨论
2025-05-12 18:44:00
《英雄联盟》LPL美女主持人希然跨界加盟《歌手》:曾参加央视网络春晚
快科技5月12日消息,日前,《英雄联盟》LPL官方主持人冯爔(希然Iris)跨界加盟音乐综艺节目《歌手2025》,以音乐合伙人的身份亮相
2025-05-12 18:44:00
禁止智驾吹牛后:隐藏式门把手也要被整治了
“炫技”和“保命”孰轻孰重,大家再清楚不过。第一次见到隐藏门把手就在想,为什么这种费力不讨好的门把手,反而成了创新设计的潮流
2025-05-12 18:44:00
iPhone 17要涨价!苹果考虑提高秋季产品价格
快科技5月12日消息,据财联社最新报道,苹果考虑提高秋季发布的iPhone产品系列价格。需要注意的是,此前有爆料提到iPhone 17国行版价格没有上调
2025-05-12 18:44:00
AMD平台新选择!铭瑄终结者B850M PRO WIFI上线:升级至12+2+1相供电
快科技5月12日消息,铭瑄扩大B850系列主板产品线,推出了终结者B850M PRO WIFI(MS-Terminator B850M PRO WIFI)主板
2025-05-12 19:14:00
海鲜党速囤 淄博鲜实加虾仁酱6.4元/瓶大促:大颗虾仁 含量≥30%
鲜实加虾仁酱2瓶平时要卖45.9元,今日下单领取33元优惠券,到手价12.9元,算下来每瓶约6.4元。产品规格:产地山东淄博
2025-05-12 19:14:00
魔改集装箱!丹麦推出月球模拟栖息地
快科技5月12日消息,据媒体报道,丹麦设计工作室SAGA Space Architects近日揭幕了其最新力作——FLEXHab月球模拟栖息舱
2025-05-12 19:14:00
小米SU7成4月份10至50万销量榜首 卢伟冰:用户认可说明一切
快科技5月12日消息,今日,话题#小米SU7成4月份10至50万销量榜首#登上微博热搜。对此,小米集团合伙人、总裁,手机部总裁
2025-05-12 19:14:00
哪吒汽车:登陆毛里求斯 哪吒X与AYA车型同时开售
快科技5月12日消息,哪吒汽车近日在微博宣布正式登陆毛里求斯,哪吒 X 与哪吒 AYA 同时开售。据悉,毛里求斯为非洲东部一岛国
2025-05-12 19:14:00
“不败金身”破了!顺丰支付首吃罚单
快科技5月12日消息,近日,中国人民银行深圳市分行集中公布两则行政处罚信息,深圳市快付通支付有限公司(下称 "快付通")与顺丰恒通支付有限公司(下称 "顺丰支付")因多项违规合计被罚没 372
2025-05-12 19:14:00
不到9mm刷新折叠屏轻薄记录!荣耀Magic V5参数出炉:骁龙8 Elite加持
快科技5月12日消息,博主数码闲聊站今天爆料,荣耀Magic V5将会是今年第二代骁龙8 Elite大折叠旗舰。该机将搭载5950mAh电池
2025-05-12 19:14:00
口感醇厚细腻:Ijsselmeer精酿黑/白啤27.9元12瓶狂促
天猫Ijsselmeer啤酒旗舰店,Ijsselmeer精酿黑 / 白啤日常售价为39.9元,下单领取9元优惠券,首次购买用户叠加3元首购礼金
2025-05-12 19:44:00
快科技5月12日消息,近日,内蒙古锡林郭勒一对74岁老奶奶和73岁闺蜜自驾游引发关注。副驾上老人的女儿介绍说:“视频里开车的老人是我妈妈的网友
2025-05-12 19:44:00