• 我的订阅
  • 头条热搜
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分,OpenAI的GPT-4o和上海人工智能实验室的书生·浦语2.0文曲星(InternLM2-20B-WQX)排...……更多
...考语、数、外全卷能力测试。据OpenCompass于6月19日发布的评测结果,大模型的语文、英语考试水平还不错,但数学都不及格,最高分只有75分(满分150分)。参加OpenCompass此次高考测试的大模型,分别是来自阿里巴巴、零一万物、...……更多
首个AI高考全卷评测结果发布:最高分303,数学全不及格
...能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。语数外三科加起来的满分为420分,此次高考测试结果显示,阿里通义千问2-72B排名第一,为303分,OpenAI的GPT-4o排名第二,得分296分,上海人工智能实验室的书生...……更多
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试。评测采用全国新课标I卷,参...……更多
...获国内头筹在极客公园最新发布的高考新课标Ⅰ卷大模型评测报告中,GPT-4o以562分排名文科总分第一。国内产品中,字节跳动旗下的豆包拔得头筹,成绩是542.5分。据介绍,本次评测以新课标Ⅰ卷为考题,与河南省考卷完全相同...……更多
用AI来做全国高考试卷,真的有人试了!结果:成绩偏科很严重
...,还真的有人试了。上海人工智能实验室近日公布了司南评测体系OpenCompass选取开源大模型测试今年高考的全国新课标I卷“语数外”的结果,为了确保“闭卷”考试,大模型的开源时间早于高考,同时邀请有高考评卷经验的教师...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...计意义思考不足,起码会带来以下几个潜在危害:其一,评测结果能否真实反映大模型的能力?如果对此认识不足,往往会过分夸大模型的效果。其二,会让人以为指标的提升,等价于大模型能力的提升、以及等价于真实场景的...……更多
智源评测体系发布 国内外“百模”评估结果出炉
...140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理解、知识运用、推理能力、数学能力、代码能力、任务解决、安全与价值观七大能力;针对...……更多
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...究中心联合中关村实验室研制的SuperBench大模型综合能力评测框架,正式对外发布2024年3月版《SuperBench大模型综合能力评测报告》。评测共包含了14个海内外具有代表性的模型,结果显示:文心一言4.0表现亮眼。例如在人类对齐能...……更多
高通骁龙xelite核显adrenox1评测
...了英特尔酷睿Ultra7155H、AMD7840HS等处理器核显性能。综合评测结果来看相比较AMD的Phoenix、英特尔的MeteorLake核显,AdrenoX1在基本的32位和16位浮点数学运算方面的吞吐量很有竞争力。此外得益于速度极快的LPDDR5X主控,AdrenoX1的DRAM带.……更多
AI界新晋王者被曝抄袭、作弊、做假,脸都丢光了
...比如,谷歌引以为傲的MMLU,是一个由伯克利大学主导的评测,囊括阅读理解、大学数学以及物理和社会科学等57项测验。但如果说,这些题目,是可以事先得知的呢?9月,中国人民大学与伊利诺伊大学香槟分校联合推出了一个...……更多
OpenAI o1模型到博士水平了?复旦教授:没有真正推理能力,学到的还是概率相关性
...OpenAI表示, o1模型在推理能力上相比GPT-4o显著进步。综合评测显示,在绝大多数需要深入思考和复杂推理的任务中,新模型都展现出了明显优于GPT-4o的表现,并在多个细分测试上超过90%。在启用视觉感知能力的情况下,o1模型在M...……更多
一加 Ace 3 Pro全面评测:续航、性能、拍照,它全都要
在这个快节奏的时代,智能手机已经成为我们生活的一部分,而对于许多用户来说,续航焦虑和性能瓶颈是两大痛点。今天,我们要为大家带来的,是一款能够打破这些焦虑的产品——一加Ace3Pro。这款手机不仅在性能上达到了...……更多
安兔兔评测pc版正式发布,欢迎大家下载体验
兔友们,全新的安兔兔评测PC版已经正式发布了,目前已经在安兔兔官网以及各大渠道上线,欢迎大家下载体验。与Android版本测试流程相似,安兔兔评测PC版测试项目同样包括了CPU、GPU、Memroy(内存和存储)和UX(用户体验)四...……更多
腾讯大模型混元Turbo:御气升昺云,梓桐金鼎开
...5T基础平台软件产品兼容国内主流芯片。一、混元Turbo之评测混元Turbo的核心技术混元Turbo的发布凝聚了腾讯团队长期以来对大模型技术的深入研究。该模型采用全新的分层异构MoE架构,创新之处在于通过合理配置专家数量与激活...……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...,另一方面能够直观体现国产大模型的最新发展进程。 评测结果显示,文心一言app在智能体能力方面表现突出。在用户创建智能体功能方面,文心一言app支持用户通过上传图片或拍照的方式制作智能体形象,同时支持用户通过...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前三,超越了谷歌的 Gemini-1.5-Pro 和 GPT-4v,仅次于 GPT-4o(69.9)和 Clau...……更多
科学家建立新评价基准,助力评估大模型数据分析能力
...集。虽然这类数据的生成成本较低、人力需求不高,但是评测方法的开发却需要他们逐一校验,因为数据分析的结果并不仅仅依赖于执行的一致性。例如,在生成分类器的问题上,即便参考代码的执行结果和预测代码的结果不一...……更多
从AI搜索到语音陪练,腾讯元宝全面评测来了!大模型C端玩家谁更胜一筹?
《科创板日报》5月31日讯(记者 朱凌)直至五月尾声,AI应用市场的火热态势依旧不减。30日,基于混元大模型的AI助手App“腾讯元宝”上线,标志着BAT终于在AI消费C端应用领域聚首。据介绍,自2023年9月首次亮相以来,腾讯混...……更多
9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了
...空间。最近的一次,第一财经曾在6月报道过,根据司南评测体系OpenCompass的高考全卷测试,包括GPT-4在内,7个大模型在高考测试中语文和英语考试水平普遍不错,但数学这科全不及格,最高分也只有75分。在批阅大模型的数学试...……更多
“礼遇四川”四川特色伴手礼评测结果揭晓 50款伴手礼上榜
本文转自:人民网-四川频道人民网成都9月27日电 (赵祖乐)9月26日,2024年“礼遇四川”四川特色伴手礼评测活动在成都落下帷幕。经过长达数月的精心筹备与激烈角逐,最终50款极具地域特色和文化底蕴的伴手礼脱颖而出,获...……更多
重磅!TeleAI 完成首个全国产化万卡万参大模型训练
...一。作为新一代版本,TeleChat2-115B 在9月最新公布的 C-Eval 评测 Open Access 模型综合榜单中,以 86.9 分的成绩排名第一。其通用能力较 TeleChat 系列模型提升近 30%,特别是在工具使用、逻辑推理、数学计算、代码生成和长文写作等方...……更多
Redmi K70 至尊版性能评测:跑分231万
...RedmiK70至尊版上同时开启,超高流畅度与超高清晰度“我全都要”,而不是一些友商产品的二选一。目前RedmiK70至尊版已经支持包括《原神》1.5K+120Hz在内的共20款游戏的超帧超分功能并发,游戏体验直接拉满。 当然,性能的强悍...……更多
中国移动5g手机综合评测结果公布
中国移动近日公布了2023年度5G手机综合评测结果,32款热门机型接受了从通信能力到用户口碑的全方位考核,小米和荣耀分别在高端和中端市场夺得冠军,展现了国产手机的强大实力。5G手机测评体系,用户体验为先中国移动的5...……更多
卓越外观,续航越级!vivo Y300 Pro外观评测结果来了
最近vivo全新发布的vivo Y300 Pro,不知道大家了解了没有。这款手机以其卓越的外观设计,带来了其他千元档手机所没有的旗舰品质外观效果,感兴趣的朋友一起来了解一下吧。先来看看vivo Y300 Pro的配色设计,该机一共有四款全...……更多
华为pura70ultra霸榜dxomark评测结果公布
...影像评测机构DXOMARK公布了华为影像新旗舰Pura70Ultra的影像评测结果:以163分的总得分,位居全球榜首,更在五个子项目中荣获三个最高分。值得关注的是,华为Pura70Ultra此次的得分并非微小优势,而是以显著的5分差距,远超第二...……更多
...技术生态、产业生态和开放性等多个维度进行评估,确保评测结果客观真实。此次评测结果将形成针对特定应用场景的综合报告和产品推荐目录,为政府、企业和研究机构建设智算中心提供芯片选型的重要参考和决策依据。在评...……更多
AI安全守护计划启动!信通院牵头,AIIA安全治理委员会发布三类模型安全评测
...情况,并启动了AI安全守护计划,发布了三大类别的安全评测结果。AIIA安全治理委员会成立于2023年12月底,经过半年运营,现有治理组、安全组两个工作组,近百家单位加入,主任单位由中国信通院牵头,副主任单位包括多家知...……更多
...21日电 9月19日,2024年“礼遇四川”四川特色伴手礼线下评测活动在四川成都开启。在消费者的热切期盼中,经过层层筛选的90余家企业携其精心准备的100件精品伴手礼亮相评测现场,每一款都承载着四川独特的文化韵味与企业的...……更多
...护委员会了解到,陕西省2023年首届“三秦伴手礼”消费评测活动已于近日正式启动。据悉,本次消费评测活动最终结果将于2024年3月份发布。首届“三秦伴手礼”消费评测活动分为征集申报、初评筛选、网上评测、优选评测、宣...……更多
更多关于科技的资讯:
REDMI Turbo 4发布后大量米粉涌入门店体验 王腾:外观吸引了很多女生
快科技1月2日消息,今日晚间,REDMI王腾发微博表示,一线同学反馈前往门店体验小旋风Turbo 4的用户非常多,外观设计吸引了很多女性用户
2025-01-02 22:14:00
南京市科技大会召开 未来网络试验设施官宣竣工
本文转自:人民网-江苏频道大会现场。人民网 杨维琼摄人民网南京1月2日电 (杨维琼)1月2日,南京市科技大会暨产业科技创新工作推进会上
2025-01-02 22:17:00
沙特2025年起统一电子设备充电端口 Type-C版图又扩大了
沙特当局宣布,2025年1月1日起采用统一的电子设备充电标准的第一阶段要求,在各种电子设备上强制使用 USB Type-C 端口
2025-01-02 22:44:00
江苏完成全国首个运营商通用遥控器采购:一键切换直播/互联网电视
快科技1月2日消息,近年来,众多用户纷纷反映“遥控器操作非常复杂”“家里为了看直播得两个遥控器常年来回切”“设备之间不知如何切换”等烦恼
2025-01-02 23:14:00
海马全新纯电MPV曝光:首创1+1+3座椅布局!
快科技1月2日消息,海马汽车与智行盒子联合打造的全新MPV车型——海马INJOY U的最新信息已经曝光。这款新车将搭载62
2025-01-02 23:14:00
苹果2025年火力全开:19款产品将亮相 阵容豪华
据报道,苹果公司在2025年将火力全开,预计发布多达19款新品,涵盖智能手机、平板、电脑笔电、穿戴设备、智能家居以及其他周边六大品类
2025-01-02 23:44:00
本文转自:环球时报2025年是联合国宣布的“量子科学和技术国际年”,预计年内有一系列活动,纪念和肯定量子理论给科技社会带来的巨大影响
2025-01-02 23:54:00
芝奇发布DDR5-6000 C26超低延迟内存:首次64GB
除了追求越来越高的频率,如今的内存都在大力降低时序和延迟,尤其是在AMD平台上,低延迟带来的性能增益十分显著。现在芝奇也带来了自己的DDR5-6000 C26
2025-01-02 19:44:00
国际首台!高压射流-机械联合破岩盾构机“山大号”投用
快科技1月2日消息,据报道,国际首台高压射流——机械联合破岩盾构机“山大号”在济南轨道交通6号线东仓站顺利始发。据悉,“山大号”将用于6号线东仓站至山东大学站区间的盾构掘进
2025-01-02 19:44:00
肆拾玖坊荣获“年度先锋企业”:匠心筑梦,酱香致远
在近日举行的中国财经2024年度消费企业先锋榜评选中,肆拾玖坊,这个在酱香白酒领域深耕九载的品牌,凭借其卓越的品质、创新的理念和迅猛的发展态势
2025-01-02 19:57:00
工信部征求意见:新能源汽车对低温续航衰减率低于35%的 给予1.2倍积分鼓励
快科技1月2日消息,今日,工信部公开征求对《关于2026—2027年度乘用车企业平均燃料消耗量与新能源汽车积分管理有关要求(征求意见稿)》的意见
2025-01-02 20:14:00
竞争激烈!2025年汽车行业价格战继续:等等党不亏
元旦伊始,万物向新。从2024到2025,国内汽车市场好戏连连,技术战和价格战双管齐下,有少数品牌交出满意的年终成绩单
2025-01-02 20:14:00
热搜第一!苹果官网突然降价,客服回应“能否退差价”
今天(1月2日),微博话题#苹果官网突然降价#冲上热搜榜,引发关注。元旦刚过,苹果中国官网公布出了“叱咤福利”新年促销活动
2025-01-02 20:23:00
母亲希望分享已故儿子Steam游戏遗产引网友热议
近日,一位母亲在Reddit游戏社区讲述了自己儿子不幸离世的遭遇,并寻求网友建议,询问是否能将儿子遗留下的Steam游戏账号中的游戏分享给他人
2025-01-02 20:44:00
连续6个月销量上升!凯迪拉克2024年12月单月热销14097辆
快科技1月2日消息,凯迪拉克在2024年12月的销量表现亮眼,单月销量达到14097辆。其中,全新XT5车型的销量尤为突出
2025-01-02 20:44:00