• 我的订阅
  • 头条热搜
首个AI高考全卷评测结果发布:最高分303,数学全不及格
...能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。语数外三科加起来的满分为420分,此次高考测试结果显示,阿里通义千问2-72B排名第一,为303分,OpenAI的GPT-4o排名第二,得分296分,上海人工智能实验室的书生...……更多
...考语、数、外全卷能力测试。据OpenCompass于6月19日发布的评测结果,大模型的语文、英语考试水平还不错,但数学都不及格,最高分只有75分(满分150分)。参加OpenCompass此次高考测试的大模型,分别是来自阿里巴巴、零一万物、...……更多
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试。评测采用全国新课标I卷,参...……更多
...“一本”线。与文科相比,大模型的理科成绩要差很多,最高分还不到480分,多数大模型的理科总分在400分以下,数学普遍不及格,相比河南理科511分的“一本”线,大模型还需努力。文科舒适区,英语具有压倒性优势大模型处...……更多
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分,OpenAI的GPT-4o和上海人工智能实验室的书生·浦语2.0文曲星(InternLM2-20B-WQX)排...……更多
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...重的安全性评测上,国内模型文心一言4.0表现亮眼,拿下最高分(89.1分),Claude-3仅列第四。自去年3月16日文心一言首发至今,用户数已突破2亿,每天API调用量也突破了2亿。 ……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...,另一方面能够直观体现国产大模型的最新发展进程。 评测结果显示,文心一言app在智能体能力方面表现突出。在用户创建智能体功能方面,文心一言app支持用户通过上传图片或拍照的方式制作智能体形象,同时支持用户通过...……更多
华为pura70ultra霸榜dxomark评测结果公布
...影像评测机构DXOMARK公布了华为影像新旗舰Pura70Ultra的影像评测结果:以163分的总得分,位居全球榜首,更在五个子项目中荣获三个最高分。值得关注的是,华为Pura70Ultra此次的得分并非微小优势,而是以显著的5分差距,远超第二...……更多
AI大模型也高考?成绩单出来了,星火综合第一
...”评测中,讯飞星火不仅平均分位居首位,且获得了全场最高分56分。潇湘晨报邀请湖南知名作家、编辑作为阅卷老师,对国内五大AI大模型产品——百度文心一言、讯飞星火、阿里通义千问、字节豆包、腾讯元宝的高考作文进...……更多
amd64核心锐龙线程撕裂者7980x首发评测
...恐怖的世界纪录,是撕裂者7980X默频下的整整两倍。此前最高分来自两颗EPYC9654组成的192核心384线程系统,但也不到15万分。当然代价也不小,在超过17万分的时候,系统峰值功耗就跨越了1500W。CineBench2024多核最高8052分,将世界纪...……更多
OPPO Find X7 Ultra影像与华为并排第一,远超vivo与小米同期新旗舰
近日, DXOMARK 公布了 OPPO Find X7 Ultra的影像评测结果,摄像头总体分数达到157分,与华为Mate60 Pro+并排在第一名。根据DXOMARK的评测结果显示,OPPO Find X7 Ultra在照片、变焦、散景、视频、人像、低光表现均获得了较高的分数,与不...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...计意义思考不足,起码会带来以下几个潜在危害:其一,评测结果能否真实反映大模型的能力?如果对此认识不足,往往会过分夸大模型的效果。其二,会让人以为指标的提升,等价于大模型能力的提升、以及等价于真实场景的...……更多
阿维塔11荣获IVISTA中国智能汽车指数五星智能评价
...时,阿维塔11还刷新了导航智能驾驶评测(NP测试)历史最高分,以96.10分拿下G+(极优秀)评价,斩获该排行榜第一名。阿维塔11荣获IVISTA中国智能汽车指数五星智能星级评价。 阿维塔科技供图 华龙网发中国汽车工程研究院股份...……更多
智源评测体系发布 国内外“百模”评估结果出炉
...140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理解、知识运用、推理能力、数学能力、代码能力、任务解决、安全与价值观七大能力;针对...……更多
DC 240W+PD 100W+90Wh快充续航,华硕 ROG幻16 2022笔记本充电评测
...解这款笔记本的 Type-C 端口充电兼容性。如上图,是本次评测选用的全部百瓦档位的第三方充电器,其中包括努比亚、绿联、苹果等品牌。 使用氘锋 165W 氮化镓充电器为ROG幻16 2022笔记本充电,使用 POWER-Z KM003C 实测功率为 19.11V 4...……更多
长江存储PC411 1TB固态硬盘评测 新一代OEM神盘诞生
...性能和较低的功耗的DRAMLess产品,或将成为一代OEM神盘。评测开始前,我们先快速了解一下长江存储PC411固态硬盘的产品特性1、容量高达2TB;2、标称连续读取写速度达到7000MB/s和6000MB/s;3、采用高性能DRAMLess无缓存主控方案;4、...……更多
EVNIA 32M2N6800MW 显示器评测
前段时间,我们有幸评测了飞利浦Evnia旗下最新推出的31.5英寸4K+240HzQD-OLED显示器32M2N8800。这款显示器凭借其震撼的大尺寸屏幕,无限对比度带来的富有层次的视觉感受,以及丰富细腻的色彩表现,加上Evnia为游戏玩家精心设计的...……更多
AI界新晋王者被曝抄袭、作弊、做假,脸都丢光了
...比如,谷歌引以为傲的MMLU,是一个由伯克利大学主导的评测,囊括阅读理解、大学数学以及物理和社会科学等57项测验。但如果说,这些题目,是可以事先得知的呢?9月,中国人民大学与伊利诺伊大学香槟分校联合推出了一个...……更多
惠普ProBook 450 G10 评测:6K价位的酷睿i5也能做主力机
【大泽科技SHOW】平时上班你是用公司配的电脑还是用自己的笔记本电脑呢?相信很多人都会选择用自己的笔记本电脑,其中一个原因是有些公司会给一些补助。当然最重要的还是自己的电脑用着更习惯,工作数据也能随身带着...……更多
iQOO Neo9S Pro评测:旗舰双芯加持
...QOONeo9SPro的安兔兔跑分达到了2287515分,是当前安卓阵营的最高分之一,实际使用起来自然也是非常流畅,即使重度性能玩家也能轻松满足其使用需求。 为了测试双芯加持的iQOONeo9SPro在游戏方面实际表现,笔者首先选取了高负载...……更多
科大讯飞:打造自主创新的大模型底座,为全球产业链提供更多选择
...于大模型的评测报告——《人工智能大模型体验报告3.0》评测结果显示,由科大讯飞研发的讯飞星火认知大模型获得1775最高分蝉联冠军,并获得基础能力指数、智商指数、工具提效指数三项评测指标第一。 在通用人工智能全球...……更多
好一个响当当的铜豌豆 星途瑶光家族如何以安全定义豪华?
3月19日,最新一期中国保险汽车安全指数(C-IASI)评测车型结果公布,星途瑶光斩获了“车内乘员安全”、“车外行人安全”和“车辆辅助安全”三大核心关键指数全优G评级,连同此前2023年9月份获得中国首批零甲醛座舱汽车...……更多
“整活”保险业务,AI大模型哪家强?
...面,GPT-4表现一骑绝尘,在核保、理赔质检方面均得到了最高分。 例如在询问“因突发脑梗摔伤,意外险能否理赔”时,GPT-4对产品条款进行了多种假设,并依据不同假设给出了正确的理赔建议。《报告》指出,而国内大模型目...……更多
自带副驾屏的腾势N7,座舱智能化体验如何?
...和连续对话方面,仍有提升空间。结合基础项体验与体系评测结果来看,腾势N7基础项完成度为75.74%。负责运行腾势Link车机系统的芯片为 紫光展锐A7870,非冷启动状态下,系统流畅性、核心应用启动速度、目的地搜索速度和投屏...……更多
阿维塔11荣膺“五星健康车”认证 4项测试全五星最高评价
...日,中国汽研发布中国汽车健康指数(C-AHI)2023年第四批评测结果,阿维塔11在关乎乘员健康的4项测试中均取得高分,摘得各项全五星最高评价。“中国汽车健康指数”是中国汽研基于国内外工况标准,结合消费者实际用车需求...……更多
技嘉冰雕 X 360水冷散热器评测:性能颜值均符合高端定位
...一系列固态硬盘、内存乃至水冷散热器等产品。今天我们评测的产品便是技嘉即将推出的水冷散热器-冰雕X360。技嘉的水冷散热器根据颜色及规格命名,黑色产品命名为“水雕”系列,而白色产品则命名为“冰雕”系列。我们今...……更多
科学家建立新评价基准,助力评估大模型数据分析能力
...集。虽然这类数据的生成成本较低、人力需求不高,但是评测方法的开发却需要他们逐一校验,因为数据分析的结果并不仅仅依赖于执行的一致性。例如,在生成分类器的问题上,即便参考代码的执行结果和预测代码的结果不一...……更多
从AI搜索到语音陪练,腾讯元宝全面评测来了!大模型C端玩家谁更胜一筹?
《科创板日报》5月31日讯(记者 朱凌)直至五月尾声,AI应用市场的火热态势依旧不减。30日,基于混元大模型的AI助手App“腾讯元宝”上线,标志着BAT终于在AI消费C端应用领域聚首。据介绍,自2023年9月首次亮相以来,腾讯混...……更多
iPad Pro 2024首发评测:轻且强,但空有一身好「武功」
...4 的被动散热始终比不上 MacBook Pro 的主动散热:iPad Pro M4 最高分 8468(第 1 循环),最低分 6100(第 20 循环),在第 2 循环分数就降低到 7000 以下;而 MacBook Pro 则一直稳定在 9500 到 9100 分之间,稳定性高达 95.8……更多
强芯更AI 大屏更护眼 攀升暴风龙P3 Pro轻薄本评测
...,在产品上也逐渐彰显出其差异化定位。而今天来到PChome评测室的,正是攀升全新推出的暴风龙P3Pro,可以说是攀升这一代笔记本产品的集大成者,不但配置大幅升级,还继承了诸如攀升护眼等具有攀升特色的功能,也让攀升暴...……更多
更多关于科技的资讯:
柏曼光环为什么这么贵?消费者有更便宜的选择吗?
柏曼是台灯领域的知名品牌,始终致力于灯具的研发生产。柏曼光环mini是柏曼最新推出的一款护眼台灯,具备高品质光照,优越的性能
2024-11-07 16:09:00
中国消费者报上海讯(记者王小月)第七届进博会如约而至。今年,叮咚买菜派出上百名商品开发人员组成的豪华买手团,发掘高品价比进口美食
2024-11-07 16:16:00
智启未来,趣享生活  德国卡赫举办系列新品首发活动
全球最大的清洁设备和清洁解决方案提供商德国卡赫,于11月6日在第七届进博会新品发布平台举办主题为“智启未来,趣享生活”的新品发布会
2024-11-07 16:48:00
中华人寿石家庄中心支公司成功开展重大消费投诉应急演练活动
近日,为了有效预防和妥善处置重大消费投诉事件,提升应对突发事件的能力和效率,中华人寿石家庄中心支公司积极组织并开展了一场重大消费投诉应急演练活动
2024-11-07 16:49:00
本文转自:人民网-广西频道为进一步提高发电效率、降低故障损失,广西桂冠电力股份有限公司山东分公司(简称桂冠山东分公司)积极推行一系列创新运维管理举措
2024-11-07 17:07:00
东方资讯消息,据媒体报道,腾讯微保近日成为全国首个数据要素场内线上交易全闭环试点机构,公办医院患者可通过腾讯微保平台实现个人商业健康险快速理赔
2024-11-07 17:22:00
尾气水汽收集回收装置的工作原理和用途
水汽收集装置也称之为超低温水汽收集仪器是一种用于捕集真空系统中水蒸汽的装置。它通常被安装在真空系统的高阀与真空腔之间或真空腔内
2024-11-07 17:31:00
AI智能高速公路巡检车亮相十堰,有啥高科技?
十堰广电讯(全媒体记者 魏俊 何旭 通讯员 伍子阳)近日,搭载AI巡检系统的高速公路智能巡检车正式亮相十堰。11月6日上午
2024-11-07 17:38:00
都市丽人亿元大手笔,开启国民内衣新时代
11月6日,由都市丽人携手永达传媒举办的“都市丽人内衣奥运冠军之选”都市丽人高铁冠名列车首发仪式在成都东站盛大启动。广东都市丽人实业有限公司董事长郑耀南
2024-11-07 17:51:00
即日起,欢太金融服务记录开通查询功能
欢迎关注“欢太服务助手”微信公众号,通过其菜单栏的“我的服务”,您可以轻松进入服务记录查询的专属页面。当您需要使用此服务时
2024-11-07 17:58:00
短视频4.0时代来临,火乐园引领全民创作与收益新模式
近年来,短视频行业蓬勃发展,整个产业生态链不断完善,使得其模式已经进入较为成熟的阶段,这也为整个互联网行业带来了新的商机
2024-11-07 18:03:00
本文转自:人民网-四川频道换个视角,我们带你鸟瞰龙泉驿,如果人类有翅膀,可以像鸟儿一样随时在天空翱翔,那看到的世界会是什么模样
2024-11-07 18:43:00
本文转自:人民网人民网上海11月7日电 (记者任妍、栗翘楚)“我们连续7年参展,17款新品,数量为历届参展最多,包括7款全球首秀和10款中国首展
2024-11-07 19:16:00
本文转自:人民网2024“国是论坛”——戴琼海院士:规避技术安全隐忧 促进人工智能持续发展人民网记者 宋子节11月5日至6日
2024-11-07 19:58:00
三星时隔10年再推超薄旗舰!Galaxy S25 Slim首曝
快科技11月7日消息,据媒体报道,三星明年将推出一款超薄机型,命名为Galaxy S25 Slim,届时Galaxy S25系列至少有4款机型
2024-11-07 14:42:00