• 我的订阅
  • 头条热搜
用过GPT-4 Turbo以后,我们再也回不去了
...,OpenAI CEO 山姆・奥特曼向我们介绍了迄今为止最强的大模型,和基于它的一系列应用,一切似乎就像当初 ChatGPT 一样令人震撼。OpenAI 在本周一的首个开发者日上推出了 GPT-4 Turbo,新的大模型更聪明,文本处理上限更高,价格也...……更多
刚刚,OpenAI震撼发布o1大模型!强化学习突破LLM推理极限
大模型领域的技术发展,今天起再次「从 1 开始」了。大语言模型还能向上突破,OpenAI 再次证明了自己的实力。北京时间 9 月 13 日午夜,OpenAI 正式公开一系列全新 AI 大模型,旨在专门解决难题。这是一个重大突破,新模型可...……更多
科学家建立新评价基准,助力评估大模型数据分析能力
...术背景人员不可或缺的工具。以 GPT-4 为代表的大型语言模型,它们已经能够理解自然语言查询,并能生成相应的代码或分析,让自动数据分析变得更加接近现实。例如,Devin 的成功,激发了人们对基于大语言模型的自动数据分...……更多
精准狙击Llama 3.1?Mistral AI开源Large 2,123B媲美Llama 405B
...所未有的速度加速,继 Meta 昨天推出其新的开源 Llama 3.1 模型之后,法国 AI 初创公司 Mistral AI 也加入了竞争。刚刚,Mistral AI 宣布其旗舰开源模型的下一代产品:Mistral Large 2,该模型拥有 1230 亿个参数,在代码生成、数学、推理...……更多
「世界开源新王」跌落神坛?重测跑分暴跌实锤造假,2人团队光速「滑跪」
...后,开发者们甚至还发现,Reflection可能就是个「套壳」模型,而且还是连套三家的那种(Claude/GPT/Llama)。这下子,Reddit和X等平台上,立刻掀起了质疑的声浪。 左右滑动查看为此,Shumer承诺将和Glaive创始人Sahil Chaudhary一起调查...……更多
AI科学家太多,谁靠谱一试便知!普林斯顿新基准CORE-Bench:最强模型仅有21%准确率
...简单任务的准确率可以达到60%,最难任务准确率仅有21%大模型的能力越来越强,用户在一些重要的任务中也可以依赖大模型,比如说辅助做科研。不过现有科研辅助相关的基准测试都太简单,跟现实世界的任务差距还是比较大的...……更多
传openai全球招外包大军手把手训练chatgpt取代码农
...车。 另外的40%则是实打实的程序员,他们正在为OpenAI的模型「手搓」数据,从而让AI学习软件工程任务。此前,OpenAI一直是用从GitHub上抓取的代码训练其模型。而这次,OpenAI想建立的数据集中,不仅有代码,还包括背后用自然...……更多
还在人工炼丹?自动提示工程指南来了,还带从头实现
...APE)是指自动生成和优化 LLM 提示词的技术,目标是提升模型在特定任务上的性能。其基于提示词工程的思路,即编写多个不同的提示词并对其进行测试,只不过是让整个过程自动化。后面我们会看到,这个过程非常类似于传统...……更多
Claude 3.5深夜觉醒,学会模仿人类用电脑!编程干翻o1,Agent一夜变天
...,进化后的Claude 3.5 Sonnet一举击溃OpenAI o1,堪称最强推理模型。它在各个方面得到了全面显著的提升,尤其是业界领先的编码能力。而Claude 3.5 Haiku与上一代最强Claude 3 Opus性能相当,成本、速度与上一代Haiku相近。甚至,Claude现在...……更多
马斯克官宣Grok-2测试版!xAI将继续拥抱开源路线吗?
继旗下xAI公司宣布正式开源大模型Grok-1后,特斯拉CEO马斯克再次在大模型市场扔下一颗重磅炸弹。当地时间8月11日晚,马斯克在X平台上透露人工智能模型Grok-2测试版将在不久后发布。事实上,马斯克在7月份就在X平台上确认,Gr...……更多
开源大模型新的里程碑!Llama 3.1 模型准时发布
...KER科技7月24日消息,今日凌晨,Meta官方正式发布了Llama3.1模型。本次Llama3.1模型共有三个版本,分别是8B、70B和405B。从基准测试结果来看,超大杯Llama3.1405B与OpenAI的GPT-4o和Claude3.5Sonnet在多个项目上能够媲美。在GSM8K任……更多
多模态LLM视觉推理能力堪忧,浙大领衔用GPT-4合成数据构建多模态基准
...的关注,但最近浙大、中科院等机构的学者们提出,先进模型在视觉推理方面同样不足。为此他们提出了一种多模态的视觉推理基准,并设计了一种新颖的数据合成方法。无论是语言模型还是视觉模型,似乎都很难完成更抽象层...……更多
马斯克承诺开源版大模型 来了!Grok-1:3140亿参数迄今最大,权重架构全开放
...之心开源社区有福了。说到做到,马斯克承诺的开源版大模型 Grok 终于来了!今天凌晨,马斯克旗下大模型公司 xAI 宣布正式开源 3140 亿参数的混合专家(MoE)模型‘Grok-1’,以及该模型的权重和网络架构。这也使得Grok-1成为当...……更多
阿里云发布通义千问2.5,性能赶超GPT-4 Turbo
通义大模型发布一周年之际,迎来重要的历史性时刻。5月9日,阿里云正式发布通义千问2.5,模型性能全面赶超GPT-4 Turbo,成为地表最强中文大模型。同时,通义千问1100亿参数开源模型在多个基准测评收获最佳成绩,超越Llama-3-7...……更多
限定120分钟科研挑战,o1和Claude表现超越人类
...长期科研还得靠人类在RE-Bench上,研究对比了基于大语言模型构建的Agent(目前主要公布了Claude 3.5 Sonnet、o1-preview)和50+人类专家的科研能力。值得注意的是,这些专家都有强大机器学习背景,其中很多人在顶级行业实验室或机...……更多
开源版OpenAI再出「神作」,小模型吊打Llama 3!Ministral系列问世,边缘AI革命开启
...生一周年之际,法国AI初创公司Mistral再次连发两个轻量级模型Ministral 3B和Ministral 8B,性能赶超Llama 3 8B。Mistral 7B仅仅发布一周年,法国AI初创小模型「les Ministraux」就打败它了。它堪称是,世界上最好的边缘模型。Ministra……更多
谷歌 Gemini 1.5 AI 模型再进化:成本更低、性能更强、响应更快
...日(9 月 24 日)发布博文,报道谷歌升级旗下 Gemini 1.5 AI 模型,推出了 Gemini-1.5-Pro-002和 Gemini-1.5-Flash-002,相比较此前版本成本更低、性能更强、响应更快。成本更低谷歌下调了 token 输入和输出费用,Gemini-1.5-Pro……更多
马斯克 xAI 推出 Grok-1.5 大语言模型
...公司 xAI 今天在官方博客中宣布,正式推出 Grok-1.5 大语言模型。Grok-1.5 具有改进的推理能力和 128k 的上下文长度,其中最显著的改进之一是其在编码和数学相关任务中的表现。Grok-1.5 将在未来几天内在 平台上向早期测试人员和...……更多
真·AI程序员,阿里云「通义灵码」全面进化,全流程开发仅用几分钟
...需要做的,只是输入包含几句话的提示词。数秒钟后,大模型就生成了代码,还列出了环境需求,复制完代码就可以使用了。这不是程序员父亲带自家小孩做的网红项目,而是人人都可以尝试的事。在大模型的帮助下,代码正在...……更多
开闭源模型「大乱斗」:看看哪个智能体最能窥见人类真实意图
...两人均为 THUNLP 成员。钱成主要研究兴趣为工具学习,大模型驱动智能体,即将就读 UIUC 博士。何秉翔主要研究兴趣为大模型对齐与安全,即将就读清华大学博士。本文通讯作者为从鑫与林衍凯,指导教师为刘知远副教授。在人...……更多
智能体首达Kaggle Grandmaster,华为结构化推理补齐思维链短板
前些时日,AI 大模型开始掌握操作计算机的能力,但整体而言,它们与物理世界互动的能力仍处于早期阶段。为了提高 LLM 在复杂的现实世界中的表现,研究者们提出了各种提示策略来提升大模型的推理和规划能力,比如思维链...……更多
田渊栋团队新作祭出Agent-as-a-Judge!AI智能体自我审判,成本暴跌97%
...改进的智能体系统铺平了道路。「法官」智能体,击败大模型现有评估方法,无法为智能体系统的中间任务解决阶段,提供足够的反馈。另一方面,通过人工进行更好的评估,代价太大。而智能体系统的思考方式,更像人类,通...……更多
这才是真开源模型!公开后训练一切,性能超越Llama 3.1 Instruct
开源模型阵营又迎来一员猛将:Tülu 3。它来自艾伦人工智能研究所(Ai2),目前包含 8B 和 70B 两个版本(未来还会有 405B 版本),并且其性能超过了 Llama 3.1 Instruct 的相应版本!长达 73 的技术报告详细介绍了后训练的细节。在...……更多
多样任务真实数据,大模型在线购物基准Shopping MMLU开源
谁是在线购物领域最强大模型?也有评测基准了。基于真实在线购物数据,电商巨头亚马逊终于“亮剑”——联合香港科技大学、圣母大学构建了一个大规模、多任务评测基准Shopping MMLU,用以评估大语言模型在在线购物领域的...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
...想要达成通用人工智能 AGI 的终极目标,首先要达成的是模型要能完成人类所能轻松做到的任务。为了做到这一点,大模型开发的关键指导之一便是如何让机器像人类一样思考和推理。诸如注意力机制和思维链(Chain-of-Thought)等...……更多
多模态模型评测框架lmms-eval发布!全面覆盖,低成本,零污染
...稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com随着大模型研究的深入,如何将其推广到更多的模态上已经成为了学术界和产业界的热点。最近发布的闭源大模型如 GPT-4o、Claude 3.5 等都已经具备了超强的图像理解能力,LLaVA-……更多
微软发布旗下最小语言模型phi-2
...会已拉开帷幕,微软在本次活动中发布了旗下最小的语言模型Phi-2,共有27亿参数,相比较此前版本有明显提升。注:微软于今年6月发布Phi-1,只有13亿代码,适用于QA问答、聊天格式和代码等等场景。该模型完全基于高质量数据...……更多
开源社区分水岭:Meta大模型Llama 3发布,参数最高或达4000亿
为了保持公司在AI(人工智能)开源大模型领域的地位,社交巨头Meta推出了旗下最新开源模型。当地时间4月18日,Meta在官网上宣布公布了旗下最新大模型Llama 3。目前,Llama 3已经开放了80亿(8B)和700亿(70B)两个小参数版本,...……更多
生成式AI创新游戏体验-亚马逊云科技助力沐瞳科技高效游戏运营
...、平台运营、企业提效和游戏智能体等方面,以及生成式AI模型Claude3在视觉能力、安全性、代码辅助等方面的优势。演讲重点介绍了亚马逊云科技如何通过Claude3等生成式AI模型,为游戏公司沐瞳科技提供高效的游戏运营解决方案,实...……更多
开源大模型杀疯了!Mistral新模型三分之一参数卷爆Llama 3.1
Llama 3.1 405B“最强模型”宝座还没捂热乎,就被砸场子了——Mistral AI发布最新模型Mistral Large 2,参数123B,用不到三分之一的参数量性能比肩Llama 3.1 405B,也不逊于GPT-4o、Claude 3 Opus等闭源模型。主打的就是一个高性价比。用官……更多
更多关于科技的资讯:
传美国计划将算能科技列入实体清单!被指偷偷找台积电代工
据路透社援引消息人士的话报道称,美国政府计划将中国科技公司中国厦门算能科技(SOPHGO)列入美国商务部的实体清单,理由是认为其充当了其他被禁企业间接获取台积电产能的角色
2024-12-21 12:02:00
主机硬件大战:微软Xbox 、索尼PS只能活一个 你会选谁
快科技12月21日消息,市场研究公司DFC Intelligence最新报告显示,下一世代索尼和微软两台游戏机“只能活一个”
2024-12-21 12:02:00
10年做到100万台!机械革命游戏本的昨天、今天、明天
如果要买一台既有高性能、还有高性价比的游戏本,你会考虑哪个品牌?是联想、华硕、惠普这些传统大厂?还是机械革命、雷神、机械师这些新兴品牌
2024-12-21 12:32:00
垄断真可怕!RTX 5090、5080售价再曝光:英伟达让两者相差近万元
快科技12月21日消息,随着2025年的CES展会临近,英伟达RTX 50系列也即将揭开神秘面纱,你是不是已经在持币等买了呢
2024-12-21 13:02:00
iPhone用户的五大痛点!2025年库克能给解决了吗
年末了,是时候盘点和思考这一年的收获。2024年的智能手机市场确实精彩,国产手机竞争激烈,苹果这一年在中国市场感受到了前所未有的压力
2024-12-21 13:02:00
《英雄联盟:双城之战2》首次全集限免:B站、腾讯视频免费看
快科技12月21日消息,《英雄联盟:双城之战》官方介绍,第二季全集限免将于12月28日16:00正式开启,届时在腾讯视频和B站可免费观看全集
2024-12-21 13:32:00
考研政治有多难 名师肖秀荣:近十年最难的一次
快科技12月21日消息,今日上午,2025年全国硕士研究生招生考试初试开考,上午11时30分,思想政治理论或管理类综合能力考试结束
2024-12-21 13:32:00
高通打赢芯片诉讼!未违反Arm许可协议
快科技12月21日消息,当地时间周五,高通公司在与芯片设计公司Arm进行的一场诉讼中取得胜利。据悉,Arm此前指控高通通过收购芯片创业公司Nuvia获得并使用了Arm的技术
2024-12-21 10:01:00
快买正版!国际唱片业:现在中国互联网每天上百万AI做的音乐都是非法盗版
快科技12月21日消息,国际唱片业协会大中华区总兼中国区首席代表郭彪公开表示,现在中国互联网上每天有上百万AI做的音乐
2024-12-21 10:01:00
女子每天凌晨2点多被隔壁鸡鸭声惊醒:一波接一波根本停不下来
12月21日消息,有过农村生活经验的朋友对公鸡打鸣肯定不陌生,这些叫声非常嘹亮,在安静的凌晨能传出非常远的距离。而且如果有多只公鸡
2024-12-21 10:31:00
于东来直播员工午休打麻将引围观:要让员工每周工作36小时、月薪8千+
快科技12月21日消息,一个企业的老板,公开直播手下员工打麻将,这是什么体验?昨天于东来个人账号开播,带网友云逛胖东来办公区域
2024-12-21 10:31:00
周鸿祎:AGI发展遇瓶颈 智能体和专业大模型将扛大旗
快科技12月21日消息,近两年AI发展迅速,但目前种种迹象表明,一些AI巨头寄予厚望的AGI(通用人工智能)之路似乎已经遭遇瓶颈
2024-12-21 10:31:00
江苏:2024世界智能制造大会在南京开幕
本文转自:人民网2024年12月20日,以“加快打造智能制造升级版,因地制宜发展新质生产力”为主题的2024世界智能制造大会在南京开幕
2024-12-21 11:10:00
大众帮办|遭美团强制调低房价,百元酒店陷“低价内卷”困局
“美团一单能给我们调低20元,现在快到年底了,调价幅度又要加大,调价助手又关不掉,后期也不给商家补偿,有时候害怕进订单
2024-12-21 11:18:00
三年破万!小鹏汽车欧洲第10000辆交付:中国新势力第一
快科技12月21日消息,小鹏汽车达成了一项新成就——首家在欧洲市场交付达成1万辆的中国造车新势力,这距离其首次向欧洲出口汽车仅3年时间
2024-12-21 11:31:00