• 我的订阅
  • 头条热搜
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分,OpenAI的GPT-4o和上海人工智能实验室的书生·浦语2.0文曲星(InternLM2-20B-WQX)排...……更多
...考语、数、外全卷能力测试。据OpenCompass于6月19日发布的评测结果,大模型的语文、英语考试水平还不错,但数学都不及格,最高分只有75分(满分150分)。参加OpenCompass此次高考测试的大模型,分别是来自阿里巴巴、零一万物、...……更多
首个AI高考全卷评测结果发布:最高分303,数学全不及格
...能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。语数外三科加起来的满分为420分,此次高考测试结果显示,阿里通义千问2-72B排名第一,为303分,OpenAI的GPT-4o排名第二,得分296分,上海人工智能实验室的书生...……更多
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试。评测采用全国新课标I卷,参...……更多
...获国内头筹在极客公园最新发布的高考新课标Ⅰ卷大模型评测报告中,GPT-4o以562分排名文科总分第一。国内产品中,字节跳动旗下的豆包拔得头筹,成绩是542.5分。据介绍,本次评测以新课标Ⅰ卷为考题,与河南省考卷完全相同...……更多
用AI来做全国高考试卷,真的有人试了!结果:成绩偏科很严重
...,还真的有人试了。上海人工智能实验室近日公布了司南评测体系OpenCompass选取开源大模型测试今年高考的全国新课标I卷“语数外”的结果,为了确保“闭卷”考试,大模型的开源时间早于高考,同时邀请有高考评卷经验的教师...……更多
大模型权威报告:讯飞星火得分第一
...、物理、医学5个二级分类,题型上以单选和简答为主。评测结果中,讯飞星火78.50%的得分率排名第一。另外,讯飞星火在理科综合大类下80%的二级分类评测中得分率为第一,化学与生物较为突出。 逻辑思维也是“最聪明”大模...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...计意义思考不足,起码会带来以下几个潜在危害:其一,评测结果能否真实反映大模型的能力?如果对此认识不足,往往会过分夸大模型的效果。其二,会让人以为指标的提升,等价于大模型能力的提升、以及等价于真实场景的...……更多
王小川新公司「百川智能」发布首个开源中英文大模型,开源免费可商用 | 最前线
...其测试结果位于国内中文大模型的前列。在MMLU英文权威评测榜单上,baichuan-7B也超过了Meta旗下的LLaMA-7B。MMLU是由加州大学伯克利分校等知名高校共同打造,集合了科学、工程、数学、人文、社会科学等领域的57个科目,主要目标...……更多
智源评测体系发布 国内外“百模”评估结果出炉
...140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理解、知识运用、推理能力、数学能力、代码能力、任务解决、安全与价值观七大能力;针对...……更多
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...究中心联合中关村实验室研制的SuperBench大模型综合能力评测框架,正式对外发布2024年3月版《SuperBench大模型综合能力评测报告》。评测共包含了14个海内外具有代表性的模型,结果显示:文心一言4.0表现亮眼。例如在人类对齐能...……更多
高通骁龙xelite核显adrenox1评测
...了英特尔酷睿Ultra7155H、AMD7840HS等处理器核显性能。综合评测结果来看相比较AMD的Phoenix、英特尔的MeteorLake核显,AdrenoX1在基本的32位和16位浮点数学运算方面的吞吐量很有竞争力。此外得益于速度极快的LPDDR5X主控,AdrenoX1的DRAM带.……更多
AI界新晋王者被曝抄袭、作弊、做假,脸都丢光了
...比如,谷歌引以为傲的MMLU,是一个由伯克利大学主导的评测,囊括阅读理解、大学数学以及物理和社会科学等57项测验。但如果说,这些题目,是可以事先得知的呢?9月,中国人民大学与伊利诺伊大学香槟分校联合推出了一个...……更多
OpenAI o1模型到博士水平了?复旦教授:没有真正推理能力,学到的还是概率相关性
...OpenAI表示, o1模型在推理能力上相比GPT-4o显著进步。综合评测显示,在绝大多数需要深入思考和复杂推理的任务中,新模型都展现出了明显优于GPT-4o的表现,并在多个细分测试上超过90%。在启用视觉感知能力的情况下,o1模型在M...……更多
一加 Ace 3 Pro全面评测:续航、性能、拍照,它全都要
在这个快节奏的时代,智能手机已经成为我们生活的一部分,而对于许多用户来说,续航焦虑和性能瓶颈是两大痛点。今天,我们要为大家带来的,是一款能够打破这些焦虑的产品——一加Ace3Pro。这款手机不仅在性能上达到了...……更多
安兔兔评测pc版正式发布,欢迎大家下载体验
兔友们,全新的安兔兔评测PC版已经正式发布了,目前已经在安兔兔官网以及各大渠道上线,欢迎大家下载体验。与Android版本测试流程相似,安兔兔评测PC版测试项目同样包括了CPU、GPU、Memroy(内存和存储)和UX(用户体验)四...……更多
\\\
...IEval-Math、APE5K、CMMLU-Math、高考数学和Math401等6个公开数学评测集合的测试结果中,好未来的MathGPT取得了多项测试的最高分数。同时,MathGPT在C-Eval的初高中的全科测试集合上也均有不错的表现。基于此,搜狐科技选取三种不同难...……更多
腾讯大模型混元Turbo:御气升昺云,梓桐金鼎开
...5T基础平台软件产品兼容国内主流芯片。一、混元Turbo之评测混元Turbo的核心技术混元Turbo的发布凝聚了腾讯团队长期以来对大模型技术的深入研究。该模型采用全新的分层异构MoE架构,创新之处在于通过合理配置专家数量与激活...……更多
商汤科技发布“书生·浦语”大模型 中文考试超越ChatGPT
...含1.6万亿token的多语种高质量数据集”训练而成。从全面评测结果来看,“书生·浦语”不仅在知识掌握、阅读理解、数学推理、多语翻译等多个测试任务上表现优秀,而且具备很强的综合能力。其在综合性考试中更是表现突出...……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...,另一方面能够直观体现国产大模型的最新发展进程。 评测结果显示,文心一言app在智能体能力方面表现突出。在用户创建智能体功能方面,文心一言app支持用户通过上传图片或拍照的方式制作智能体形象,同时支持用户通过...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前三,超越了谷歌的 Gemini-1.5-Pro 和 GPT-4v,仅次于 GPT-4o(69.9)和 Clau...……更多
告别搜索引擎!讯飞星火认知大模型评测:改变人机交互方式 还能帮你写代码!
一、前言:面向用户使用场景 打造高效的生产力工具6月9日,讯飞星火大模型V1.5正式亮相,时隔一个月后,星火大模型的各项能力获得了持续的提升,此次更新的重点正是突破开放式问答、多轮对话能力和数学能力。在开放式...……更多
好未来自研数学大模型MathGPT开启内测 用AI实现因材施教
...IEval-Math、APE5K、CMMLU-Math、高考数学和Math401等6个公开数学评测集合的测试结果中,好未来的MathGPT取得了多项测试的最高分数。同时,MathGPT在C-Eval的初高中的全科测试集合上也均有不错的表现。MathGPT在C-Eval榜单初高中各科成绩 ..……更多
科学家建立新评价基准,助力评估大模型数据分析能力
...集。虽然这类数据的生成成本较低、人力需求不高,但是评测方法的开发却需要他们逐一校验,因为数据分析的结果并不仅仅依赖于执行的一致性。例如,在生成分类器的问题上,即便参考代码的执行结果和预测代码的结果不一...……更多
从AI搜索到语音陪练,腾讯元宝全面评测来了!大模型C端玩家谁更胜一筹?
《科创板日报》5月31日讯(记者 朱凌)直至五月尾声,AI应用市场的火热态势依旧不减。30日,基于混元大模型的AI助手App“腾讯元宝”上线,标志着BAT终于在AI消费C端应用领域聚首。据介绍,自2023年9月首次亮相以来,腾讯混...……更多
dxomark公布galaxys23ultra相机评测结果
DxOMark网站于今天放出了GalaxyS23Ultra的相机评测结果,排名第10位。该机的综合得分为140分,其中拍照单项成绩为139分,视频为137分。DxOMark中文官网暂时并未放出关于GalaxyS23Ultra的详细评测信息。附官网对GalaxyS23Ultra的主要优缺点...……更多
...实则为了利益许多评测机构标榜自己是“第三方”,相关评测结果“客观中立”, 但由此引发的消费乱象时常出现。这不仅没有维护消费者的正常权益,反而扰乱了市场秩序。记者发现,相同品类的产品,不同机构的评测结果...……更多
泰州交警公布“红榜”企业和“黑榜”企业评测结果
...市医药高新区大队(高港大队)辖区3月份快递外卖企业评测结果,“顺丰快递”登了“红榜”,“美团外卖”因骑手违章较多上“黑榜”。据介绍,交警部门要对上“黑榜”的快递、外卖企业负责人进行约谈,督促企业加强对...……更多
9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了
...空间。最近的一次,第一财经曾在6月报道过,根据司南评测体系OpenCompass的高考全卷测试,包括GPT-4在内,7个大模型在高考测试中语文和英语考试水平普遍不错,但数学这科全不及格,最高分也只有75分。在批阅大模型的数学试...……更多
“礼遇四川”四川特色伴手礼评测结果揭晓 50款伴手礼上榜
本文转自:人民网-四川频道人民网成都9月27日电 (赵祖乐)9月26日,2024年“礼遇四川”四川特色伴手礼评测活动在成都落下帷幕。经过长达数月的精心筹备与激烈角逐,最终50款极具地域特色和文化底蕴的伴手礼脱颖而出,获...……更多
更多关于科技的资讯:
据gamesradar+当地时间周五报道,Netflix在观众指出问题后,撤下了一张疑似由AI生成的《英雄联盟:双城之战》第二季海报
2024-11-24 21:58:00
三星为其北美市场的 Galaxy 手机/平板的“三星游戏中心”应用新增云游戏服务,用户无需耗费流量/存储空间安装手游,即可利用网络远程畅玩
2024-11-24 21:59:00
真显眼包!Caviar定制款Vision Pro亮相
11月21日消息,说起Caviar,大家最不陌生的就是他们推出的各种定制款手机了,堪称数码界的奢侈品。现在,他们又开始对苹果VisionPro下手了
2024-11-24 22:33:00
字母全部大写!Redmi变成REDMI,这次不用花200万
前不久有细心的网友发现Redmi红米手机公众号名称更改为“REDMI红米手机”,据此推测红米可能会迎来新的品牌标识升级
2024-11-24 22:34:00
RTX 4050显卡继续生产不停产:新的太贵怕消费者不接受
目前NVIDIA已经开始全力为RTX50系显卡做着准备,其中就包括停产海量的RTX40系显卡,我们也报道过由于NVIDIA的停产
2024-11-24 22:34:00
OPPO Find X8 Pro体验:双潜望长焦加AI
相信去年OPPOFindX7系列给不少喜爱影像的小伙伴留下了深刻的印象,Ultra版本双潜望长焦配置一枝独秀,再加上不断OTA更新优化体验
2024-11-24 22:35:00
AMD计划2026年推出UDNA架构显卡
关于AMD下一代显卡实在是没有什么特别期待的,毕竟就现在的消息可知,AMDRadeonRX8000显卡基于RDNA4架构打造
2024-11-24 22:35:00
紧跟苹果脚步:三星也要推出Galaxy S25 Slim手机
目前关于iPhone17Air手机的消息是越来越多,例如苹果希望将其打造成苹果旗下最为轻薄的iPhone手机,不过也有消息称
2024-11-24 22:36:00
iPhone再现bug,备忘录数据丢失,苹果紧急给出修复方案
11月19日消息,近年来,苹果时不时会出现一些极为影响使用体验的bug,近日,就又爆出了丢失备忘录的bug。据部分用户反馈
2024-11-24 22:36:00
苹果M4 Max 在显卡渲染测试中超越RTX 4070
前不久我们曾报道,苹果M4Max相较于最新的英特尔酷睿Ultra9285K以及AMDRazen9950X在CPU单核与多核性能上都具有领先的优势
2024-11-24 22:36:00
开始青苗不接了:RTX 50系显卡还没到,40系显卡开始断货
NVIDIARTX50系显卡可以说是目前最受大家关注的显卡,尤其是RTX50系显卡更是如此,特别是RTX5090这样的显卡巨兽
2024-11-24 22:36:00
英特尔又要挤牙膏:酷睿Ultra 200U纯马甲
英特尔目前似乎在CPU市场上频频触壁,刚刚推出的酷睿Ultra200S处理器在游戏性能上也是落后于AMD的锐龙9000系处理器
2024-11-24 22:36:00
vivo X200 Pro影像体验:一个月后再看,还是真香!
2024年底的新机上市来得更早,刺刀见红也比去年更猛。MTK比去年早了约一个月,在10月9日发布新一代旗舰SoC天玑9400
2024-11-24 22:37:00
OPPO Reno 13公布外观:四种配色,11月25日发布
随着11月中旬的到来,下半年的第二批手机即将陆续和大家见面,这些手机相比较首批旗舰手机更加偏向于年轻用户,因此整体外观更加时尚
2024-11-24 22:37:00
AMD统一架构显卡2026年推出 同架构GPU将用于PS6
此前AMD已经官宣将再度统一游戏显卡以及服务器显卡的架构,在后续产品当中引入统一的UDNA架构。而最新的爆料表明,AMD基于下一代UDNA架构的Radeon游戏显卡将于2026年第二季度投入量产
2024-11-24 22:38:00