• 我的订阅
  • 科技

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

类别:科技 发布时间:2024-07-25 09:31:00 来源:量子位

刚刚,GPT-4o mini版迎来“高光时刻”——

登顶了lmsys大模型竞技场,和满血版并列第一,还把Claude 3.5甩在了身后。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

不同于一般的数据集测评,大模型竞技场是用户自己出题、用脚投票的结果,无法通过“刷题”来走捷径,因此更为真实。

这个成绩一出,连CEO奥特曼都激动起来了:

面对评估成绩,我们本来是尽量矜持的,但是看到GPT-4o mini表现和满血版一样,价格却只有1/20,内心还是很激动。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

网友看到之后表示OK,但更关心的还是GPT-4o发布会上演示的“Her”到底啥时候上线。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

与此同时,OpenAI也送来了另一个好消息,将为开发者送出福利——

GPT-4o mini的微调将逐步开放,目前已开放给tier 4和tier 5用户,然后会陆续扩展范围。

而且从即日起到9月23号,每天都能免费使用2百万的训练token。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

mini与满血版平起平坐

经过80多款模型上百万轮的1v1比拼,GPT-4o mini在lmsys榜单上的成绩与满血版只差7分。

按照lmsys榜单的排法,这7分的差距没有影响名次,把两个型号算作了并列第一。

紧随其后的是Claude 3.5和Gemini家族,还有GPT-4的另外两个版本。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

如果我们查看GPT-4o mini的原始数据,会发现它0.6的平均胜率仅次于满血版本。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

单独看两者比拼的结果,同样是打得不相上下。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

之所以lmsys的成绩受到关注,在于它拥有一套独特的比拼方式——

不用数据集,而是让用户自己出题,随机拉两个模型1对1battle,然后选择哪个模型表现更好。

在给出选择之前,模型是匿名的,用户也不知道是哪两个模型正在比拼,如果模型自己说漏嘴则投票无效。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

这样得到的分数更加真实,既避免了“刷题”获取虚高分数的可能,也更加接近用户体验。

这个大模型竞技场,最近还登上了机器学习顶会ICML2024。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

而且,lmsys的评测也非常受OpenAI的青睐,GPT-4o mini正式上线之前的早期版本,就曾化名为gpt-mini在其中打榜。

当时就已经排行第4,和GPT4-Turbo处在同一水平。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

更早一些,GPT-4o上线之前也是化名gpt2-chatbot,在lmsys上搞起了测试。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

不过也有人提出质疑,表示虽然GPT-4o mini表现确实很好,但是要说它超过了Claude 3.5 sonnet就有些言过其实了。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

有人更是直言,lmsys方法的完善性已经开始瓦解,需要做出改变,否则将不再是一个有用的测试基准。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

“小模型”也卷起来了

mini版本的推出,主打的就是一个性价比。

每百万输入/输出tokens,价格分别为15美分和60美分(约1.09/4.36人民币),甚至还不到3.5 Turbo的一半。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

如果和两年前GPT-3的text-davinci-003版(当时最好的模型)相比,价格更是下降了99%。

而且除了把小模型开放给用户,OpenAI还搞出了新鲜玩法——

在“超级对齐”团队的一篇遗作中,使用了参数量为大模型千分之一或百分之一的小模型,来对大模型进行优化。

实验中,大小两个模型相互“博弈”,大模型需要不断优化调整自己的输出,让小模型相信自己说的是真话。

在这个“博弈”的过程中,大模型的能力得到了提升,在精度没有明显损失的情况下获得了大幅度的可理解性提升。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

除了OpenAI,其他公司也都纷纷搞起了小模型。

比如在GPT-4o mini之前,谷歌和Anthropic就分别推出了Gemini Flash和Claude 3-Haiku。

甚至可以说,GPT-4o mini就是OpenAI对两家的反击,无论是性能还是价格都超越了这两个模型。

GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费

在GPT-4o mini发布的同一周,抱抱脸Hugging Face,以及“欧洲OpenAI”Mistral都相继推出了小号模型。

甚至苹果也推出了自己的7B模型,而且一次性开源了全部训练过程和资源。

总之,在性能足以满足使用需求的前提下,小模型无疑是一种更经济实惠的选择。

同时,更小的规模也意味着有可能在端侧运行,在隐私保护等方面显现出优势。

这样就不难理解,“小”模型为什么也越来越卷了。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-07-25 12:45:04

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

GPT-4omini为啥登顶竞技场?OpenAI刷分秘诀被扒,奥特曼早有暗示
...捏住了人类的心理啊。实际上,在GPT-4o mini刚刚发布时,奥特曼就暗示了这次特意的优化:大家一定会非常非常喜欢用这个新模型
2024-07-30 09:30:00
奥特曼晒“草莓”引热议 神秘新模型现身竞技场 网友第一波实测来了
...称自己是GPT-4系列模型一部分,吊足了大家的胃口。随后奥特曼又发了一个浮想联翩的推文,正是他花园里的草莓照片,并配文
2024-08-08 15:11:00
奥特曼小时候啥样,赛文调皮玩摔跤,艾斯将手含嘴里,奥父不容易
大家好,我是小飞,我们每个人都有自己的童年,奥特曼也不例外,别看如今的佐菲赛文初代他们在光之国都威风的很,个个都披上了象征长者的红色奥特披风,但他们童年的时候同样非常的可爱,曾经
2023-03-19 12:45:00
36氪首席内容官李洋:勇敢站在新周期的起点上|WISE2023 商业之王大会
...情几次翻转。有人在追剧、看热闹,有人可能根本不知道奥特曼是谁,而我们在场的所有人,关心未来的人,36氪所粘合的这个群体应该知道,热闹的背后意味着什么。OpenAI发生的事情用
2023-12-02 23:21:00
比尔·盖茨对话OpenAI CEO奥特曼:AI如何监管?白领和蓝领谁会更先失业?
...微软创始人比尔·盖茨在个人博客上传了和OpenAI CEO 山姆·奥特曼的访谈,这场访谈发生在奥特曼去年11月底被董事会解雇风波前
2024-01-12 17:05:00
GPT-5快抢走打工人饭碗了
...却意外地成为这场发布的真实注脚。在开场介绍GPT-5时,奥特曼简单回顾了下从GPT-3到4,再到5的历程。他自己比喻说
2025-08-09 11:33:00
《蛋仔派对》&奥特曼联动火热开启
...环生。8月11日,欢乐世界休闲竞技手游《蛋仔派对》&奥特曼联动火热开启,巨大的巴尔坦星人骤然袭击蛋仔岛,危难时刻奇迹降临,迪迦、赛罗、泽塔三位奥特曼集结前来迎战强敌。
2023-08-14 23:17:00
全国首例!AI自动生成奥特曼图片侵权案,法院判了
提供AI技术自动生成奥特曼形象图片,平台却因侵犯知识产权被告上法庭。4月21日,浙江省高院在2025年知识产权宣传周期间
2025-04-21 13:28:00
to B要挣钱、to C要谨慎,李开复的大模型坚持
...强盲测",援引这一榜单的科技大佬不止Open AI的CEO山姆·奥特曼和谷歌首席科学家杰夫·迪恩。根据李开复公布的总榜单
2024-10-17 09:58:00
更多关于科技的资讯:
兴趣-实践-视野:达芬奇金奖少年带来的教育启示录
摘要:2025“你是达芬奇”全球青少年科学与艺术创新赛圆满落幕,其中金奖获奖少年的亲身实践告诉我们,在AI赋能的新时代
2025-10-02 16:22:00
单日调用近1万亿次,高德助力北斗规模化民用跨入新量级
2025年10月1日,随着国庆长假首日出行高峰的到来,高德基于北斗卫星导航系统的定位数量接近1万亿次,支撑导航总里程数超90亿公里
2025-10-02 22:31:00
10月1日,从太钢获悉,今年以来,太钢不锈进料加工团队以“精准备案、高效协同”为核心,在进料铬铁镍铁资源利用方面取得突破性进展
2025-10-02 17:39:00
厦门网讯(厦门日报记者 林露虹)记者昨日从中国移动咪咕公司获悉,该公司打造的“鼓浪屿AI伴游”服务已正式上线。市民和游客只需打开“鼓浪屿元宇宙”微信小程序
2025-10-02 08:57:00
“中国脑机谷”落户新奥新智感知产业园 政企研协同构建脑机接口产业新生态
河北新闻网讯(张新)9月26日,脑机接口产业联盟首届“脑机接口50人论坛”暨天津脑机接口产业创新发展推进会举办。会上,由新奥集团旗下的天津新智感知科技有限公司
2025-10-01 08:40:00
国网三明供电公司:守护灯火庆华诞 主动运维显担当
国网三明供电公司检修人员及时更换损坏器件并调整传动系统并完成设备修复及全套试验。(纪长添 摄)东南网10月1日讯 9月28日
2025-10-01 09:19:00
9月26日,由华东政法大学与上海星瀚律师事务所联合主办的第三届“星瀚杯”走进企业的法律课公益大赛正式启动。腾讯云作为大赛的技术支持单位
2025-10-01 09:56:00
平望实小承办吴江区骨干教师(数学)讲学团活动
为进一步发挥吴江区骨干教师的示范和辐射作用,推进课堂教学改革,有效提升教师教学业务能力。2025年9月24日,由苏州市吴江区教师发展中心主办的2025年吴江区骨干教师(数学)讲学团活动在平望实验小学举行
2025-10-01 09:58:00
AI技术让抗战文物“活起来”,人民日报数字传播联合百度推抗战文物智能体
9月30日,由人民日报数字传播与中国国家博物馆、中国人民大学、百度文心大模型、百度百科联合出品的《80年,80件》智能体和3D文物词条正式上线
2025-10-01 10:00:00
新时达2025工博会圆满落幕 | STEP 2.0战略引领智能制造新篇章
2025年9月23日至27日,第二十五届中国国际工业博览会在国家会展中心(上海)盛大举行。新时达以"智拓无界 共创未来"为主题
2025-10-01 10:00:00
从课堂到产线,河北工大学子开展智慧物流与“地狼”系统自动化技术实训
河北新闻网讯(胡广涛)组装调试机器人、体验智慧仓储系统、探索自动化技术前沿……近日,河北工业大学人工智能与数据科学学院2022级自动化专业全体学生在廊坊分校
2025-10-01 11:12:00
中国青年报客户端讯(中青报·中青网记者 夏瑾)9月30日,由湖州师范学院音乐学院、湖州市音声数据挖掘与智能服务重点实验室主办的“1617系列明代魏氏乐虚拟乐器音源”全球发布会在浙江省杭州市举办
2025-10-01 14:11:00
“智慧武当”给游客带来数字文旅新体验
十堰广电讯(通讯员 汪伟 周琼 耿宇)“一部手机游武当”预约购票、AI导游、《入境武当》VR大空间、问道武当数字客厅……国庆假日
2025-10-01 18:35:00
津云文旅电商版块上线 首发“笑漾海河”优选线路 扫码阅读手机版
10月1日,天津鹏欣水游城14周年庆暨津云新媒体“笑漾海河”文旅电商线路首发仪式成功举办。近年来,随着“文旅+电商”模式的快速发展
2025-10-01 18:55:00
陕西数字贸易闪耀第四届数贸会 数字贸易合作成果丰硕
9月29日,为期5天的第四届全球数字贸易博览会(以下简称“数贸会”)在浙江杭州大会展中心圆满落下帷幕。此次盛会,陕西代表团表现亮眼
2025-10-01 18:58:00