• 我的订阅
  • 头条热搜
ChatGPT更聪明了!OpenAI推出GPT-4大型语言模型:在诸多测试中表现比人类都好
3 月 15 日消息,Open-AI 刚刚公布了其大型语言模型的最新版本 ——GPT-4(API 候补申请点此)。GPT-4 可以更准确地解决你的难题多模态的 GPT-4 还可以生成、编辑具有创意性或技术性的文章,在高级推理方面的表现超过其前辈(当...……更多
...,目前已经有多个人工智能系统学会了欺骗,在棋牌游戏中表现尤为明显。许多人工智能都能熟练地使用“虚张声势的策略”。对此,研究人员不无担忧地评价说,通过“习得性欺骗”,一些人工智能已经“系统性地”学会了“...……更多
智商超过99.9%人类,ChatGPT到底有多聪明?
...表示,ChatGPT十分适合作为一个被试,它不仅不会在测试中表现出应试焦虑、注意力不集中或放弃,也不会对智商测试和测试人员产生质疑。Roivainen采用第三版韦氏成人智力量表(the Wechsler adult intelligence scale, WAIS)对ChatGPT进行了...……更多
...下风,有着教育行业背景的讯飞星火大模型在一众大模型中表现抢眼,堪称“更会做题的大模型”。评测,还有很长的路要走评测作为对机器理解、处理、应用自然语言能力的一种评估和量化手段,是大模型领域技术水平和研究...……更多
chatgpt背后模型被证实具有人类心智
...的心智理论(TheoryofMind,ToM),已经出现在ChatGPT背后的AI模型上。”这是来自斯坦福大学的最新研究结论,一经发出就造成了学术圈的轰动:这一天终于猝不及防地来了。所谓心智理论,就是理解他人或自己心理状态的能力,包...……更多
微软华人团队发布全新基准AGIEval,专为人类考试而生
...的总体表现不错,但所有的语言模型都在复杂的推理任务中表现不佳,比如MATH、LSAT-AR、GK-physics和GK-Math,突出了这些模型在处理需要高级推理和解决问题技能的任务方面的局限性。观察到的处理复杂推理问题的困难为未来的研...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
...中,GPT-4o 是闭源模型中的效果最佳的,CogVLM2 是开源模型中表现最佳的。一个很有趣的现象是加入了图片对 CogVLM2 来说有了明显的帮助(在困难模式下提升了 20.3%),而对于 GPT-4o 而言反而结果有下降。在中文测试中,也有相似...……更多
更强更可靠!OpenAI公布GPT-4:可在考试中超过90%的人类
...的最新版本——GPT-4。该公司表示,GPT-4在许多专业测试中表现出超过绝大多数人类的水平。OpenAI于2020年发布了GPT(生成型预训练变换模型)-3(生成型预训练变换模型),并将其与GPT-3.5分别用于创建Dall-E和聊天机器人ChatGPT,这...……更多
...6月4日报道,以人工智能的旗舰产品GPT-4为代表的大语言模型在逻辑测试中的推理表现很糟糕:它们犯下前后不一致的错误,而且推理过程往往是荒谬的。近日发表在《皇家学会开放科学》杂志上的一项研究表明,大语言模型所...……更多
人工智能的偏见——基于全球大语言模型情商与智商偏见测试
...AGI-AIGC-GPT 评测 DIKWP(全球)实验室发布了全球大语言模型(LLM)情商(EQ)与智商(IQ)偏见测试。该测试旨在评估和比较国内外大语言模型分别在“男性”和“女性”视角下的智商和情商水平。(全球大语言模型(LLM)情商...……更多
LLM仍然不能规划,刷屏的OpenAI o1远未达到饱和
...结果。在这些模型中,LLaMA 3.1 405B 在常规 Blocksworld 测试中表现最佳,准确率达到 62.6%。然而模型在 Mystery Blocksworld 的表现却远远落后——没有一个 LLM 在测试集上达到 5%,并且在一个领域上的性能并不能清楚地预测另一个领域的...……更多
OpenAI直播最后一天放出“王炸”:下一代推理模型o3亮相
...越现有模型,吸引新的投资和用户。OpenAI在一篇博客文章中表示,o1模型已经能够推理复杂的任务,与以前的科学、编码和数学模型相比,它能解决更具挑战性的问题。而OpenAI新推出的o3和o3 mini模型目前正在进行内部安全测试,...……更多
科研也完了,AI暴虐170位人类专家!Nature子刊:大模型精准预测研究结果,准确率高达81%
【新智元导读】知识密集型工作也败了!大型语言模型在预测神经科学结果方面超越了人类专家,平均准确率达到81%,而人类专家仅为63%;模型通过整合大量文献数据,展现出了惊人的前瞻性预测能力,预示着未来科研工作中...……更多
ChatGPT中短期产业化方向主要为:文字模态的AIGC应用、代码开发相关、图像生成领域、智能客服
...Copilot是目前最成熟的AI代码补全工具,ChatGPT在目前测试中表现出的代码生成能力相比于Copilot更加灵活,但欠缺一些底层的稳定性。在进行针对性的优化后,基于新GPT模型的AI代码辅助工具也有望在中短期内落地。3)图像生成领...……更多
人类和AI在推理任务中的表现相似,Google DeepMind研究揭示AI局限性
...,揭示了当前人工智能(AI),特别是大型Transformer语言模型(LMs)在推理任务中的表现及其局限性。研究结果显示,尽管这些模型在处理自然语言方面表现卓越,但在复杂逻辑推理任务中,人类和语言模型都会受到语义内容合...……更多
苹果AI震撼上线iPhone,进化版Siri却没有ChatGPT!47页技术报告揭秘自研模型
...1到10。如图6所示,AFM-on-device在与Gemma-7B和Mistral-7B的比较中表现出相当或更优的性能。而AFM-server则显著优于DBRX-Instruct和GPT-3.5,甚至与GPT-4不相上下。值得注意的是,使用LLM评分会存在一些限制和偏见,例如长度偏见。 数……更多
谷歌大模型推理范式,主要分为两个阶段
... 在更细分的测试中,自发现步骤在需要世界知识的任务中表现最好,在算法、自然语言理解上超过CoT。在处理问题的推理调用方面,自发现步骤需要的调用次数明显少于CoT+SelfConsistency,而且准确性更高。如果想要达到和自发现...……更多
...写的文本误认为是有血有肉的人写的。换句话说,大语言模型毫不费力地通过了图灵测试。研究人员进行了一项简单的测试:他们要求大约500人与一名真人或一个基于GPT-4的聊天机器人进行5分钟的基于文本的对话。然后这些研究...……更多
刚刚,OpenAI震撼发布o1大模型!强化学习突破LLM推理极限
大模型领域的技术发展,今天起再次「从 1 开始」了。大语言模型还能向上突破,OpenAI 再次证明了自己的实力。北京时间 9 月 13 日午夜,OpenAI 正式公开一系列全新 AI 大模型,旨在专门解决难题。这是一个重大突破,新模型可...……更多
AI大模型行业报告:大模型发展迈入爆发期,开启AI新纪元(附下载)
...重点关注GPT-4视觉能力的安全部署。GPT-4V在多种应用场景中表现出了强大的视觉能力与综合任务解决能力。2023年11月,OpenAI在开发者大会上发布GPT-4 Turbo,引入了一系列技术升级,如:将模型内部知识库更新至2023年4月,将上下文...……更多
谷歌王者归来?最新推出的大模型到底有多强,能否挑战GPT-4
...学和工程努力之一。”在Gemini发布前夕,皮查伊曾在采访中表示,Gemini令人瞩目的一大原因是它从根本上是一个多模态模型,并称向AI的转变非常深刻,现在还处于早期阶段,前方充满了无限的机会:“当我们研发Gemini时,运用...……更多
大语言模型如何宣告心理学的死亡?
...的本质。但随着人工智能技术的飞速发展,特别是大语言模型(LLM)的兴起,我们似乎站在了一个新的十字路口。AI不再只是技术进步的象征,它已经开始挑战我们对心理学——甚至是我们对智能本身——的传统理解。人工智能...……更多
CMU&清华:让LLM自己合成数据来学习,特定任务性能同样大幅提升
...莹。虽然大规模语言模型(LLM)在许多自然语言处理任务中表现优异,但在具体任务中的效果却不尽如人意。为了提升模型在特定自然语言任务上的表现,现有的方法主要依赖于高质量的人工标注数据。这类数据的收集过程既耗...……更多
GPT-4不仅性能更强也更贵了:单次输出7.5万单词需6美元,是此前的30倍
...为“我要失业了!”3月15日凌晨,OpenAI正式发布多模态大模型GPT-4,它可以接受图像和文本输入。虽然在许多现实世界场景中的能力不如人类,但在各种专业和学术基准上表现出人类水平,比如在法律考试中可以打败90%的人类。...……更多
...预见它的到来并来得及向全世界发出警报?随着大型语言模型,如ChatGPT的兴起,这个问题最近受到了很多关注。这些模型随着规模的增长已经获得了大量新功能。一些研究结果指向了“涌现”现象,即人工智能模型以一种骤然...……更多
ChatGPT确实会看人下菜!OpenAI官方报告揭示大模型的刻板印象
...份的微妙线索(如姓名)对 ChatGPT 响应的影响。其在博客中表示:「这很重要,因为人们使用 ChatGPT 的方式多种多样,从帮助写简历到询问娱乐想法,这不同于 AI 公平性研究中的典型场景,比如筛选简历或信用评分。」论文标...……更多
语言≠思维,大模型学不了推理:一篇Nature让AI社区炸锅了
机器之心报道机器之心编辑部方向完全搞错了?大语言模型(LLM)为什么空间智能不足,GPT-4 为什么用语言以外的数据训练,就能变得更聪明?现在这些问题有 「标准答案」了。近日,一篇麻省理工学院(MIT)等机构发表在顶...……更多
GPT-4V暴露致命缺陷?JHU等发布首个多模态ToM 测试集
...即理解人们思维的能力,是开发具有类人社会智能的 AI 模型的重要基础。近日,来自 JHU, NYU, MIT, Harvard 等机构的研究团队开创了第一个多模态的 ToM 测试基准,发现现有的多模态模型和 LLM 都表现存在系统性缺陷,同时他们提出...……更多
OpenAI o1模型到博士水平了?复旦教授:没有真正推理能力,学到的还是概率相关性
...enAI放出了一个大招,预热了许久的“草莓”(Strawberry) 模型终于来了。“需要耐心等待的时刻结束了。”该公司CEO山姆·奥特曼(Sam Altman)说。这就是名为 o1的新模型,这次发布包括预览版o1-preview和小尺寸版o1-mini。OpenAI官方...……更多
谁在反对ChatGPT?
...lphabet的首席执行官桑达尔·皮查伊在最近的一档访谈节目中表示,尽管该AI行业的发展存在紧迫感,但不应让公司被竞争动态所席卷,AI开发商必须对此承担相应的后果。其次,早期的人工智能很容易模仿训练数据中的偏见,并...……更多
更多关于科技的资讯:
加油站错加汽油后奔驰大G趴窝:维修需要七八十万
1月19日消息,车辆加错油品后果相当严重,运转时有可能导致发动机直接报废。据1818黄金眼报道,刘女士有一辆奔驰G 400d
2025-01-19 12:58:00
帧率暴增8倍!NVIDIA揭秘DLSS进化背后:大型超算6年全天无休工作
快科技1月19日消息,NVIDIA近日NVIDIA 揭开了DLSS使游戏帧率暴增的背后技术支持,一台专门用于持续改进DLSS技术的超级计算机
2025-01-19 13:28:00
针对近日美国商务部发布的人工智能相关出口管制临时最终规则,中国贸促会在昨天的发布会上代表中国工商界做出回应,美方再次滥用出口管制措施
2025-01-19 13:53:00
华流才是顶流:美国网友已经准备在屋前屋后种菜
快科技1月19日消息,近日疯狂涌入小红书的美国网友们已经学到了非常多的新技能,而这些,往往都由中国网友传授。近日,在美国俄勒冈州
2025-01-19 13:58:00
绝美惊艳!钱塘江涌现千姿百态“奇树”
快科技1月19日消息,近日,据媒体报道,浙江钱塘江潮退之后,涌现出了千姿百态的“奇树”!这些“参天大树”栩栩如生,是潮水与滩涂共同绘就的绝美画卷
2025-01-19 13:58:00
比亚迪腾势N7迎来OTA升级:新增城市领航与车道辅助功能
快科技1月19日消息,据媒体报道,比亚迪腾势N7近日宣布启动新年首次OTA升级。此次升级覆盖了城市领航(CNOA)、车道领航(ICC)以及自动紧急制动(AEB)等多项功能
2025-01-19 14:28:00
日产汽车全球裁员9000人 董事高管职位同步削减
快科技1月19日消息,日产汽车计划在全球范围内裁员约9000人,其中包括日本本土员工,同时将在4月对现有的63名高层管理人员进行缩减
2025-01-19 14:28:00
江西省人大代表郑波:为江西高质量发展增添“智慧引擎”
本文转自:人民网-江西频道江西省人大代表、江西迅特通信技术有限公司董事长郑波在“代表通道”上接受采访。人民网记者 时雨摄人民网南昌1月19日电(记者时雨)19日
2025-01-19 16:20:00
AI助力:男子用3000美元在家实现核聚变
快科技1月19日消息,据媒体报道,近日一位加拿大男子声称在AI的帮助下,仅花费3000 美元就在家中成功实现了核聚变。该男子化名Hudzah在其Substack上分享了实验过程
2025-01-19 10:58:00
雷军晒三十多年前“大哥大”:一台两三万 比现在的手机贵多了
快科技1月19日消息,今日,雷军在微博晒出一组“大哥大”的照片称:“大家见过最早的手机吗?三十多年前,当时叫大哥大,一台两三万
2025-01-19 10:58:00
雷军来宁德时代开着小米SU7 走的时候红光满面
快科技1月19日消息,近日,小米集团创始人兼CEO雷军亲自前往宁德时代总部进行拜访,受到了宁德时代董事长曾毓群的热情接待
2025-01-19 10:58:00
不愧是我爱的极氪
极氪系在这次懂车帝冬测里还挺给力的,冰雪弯道、70码制动等都名列前茅。我就说它家的智能驾驶很稳定吧~
2025-01-19 11:43:00
那些用开塞露涂脸的人:后来都怎么样了
关于“生活中便宜好用的护肤品”,之前我们讲了凡士林(可回顾往期文章),评论区有人问甘油,今天就来聊聊~图片来源:科普中国评论区相信很多人知道
2025-01-19 11:58:00
比亚迪多车已支持 博主:双枪充电含金量在25年会不断提升
快科技1月19日消息,对于电动车补能,目前主流的方法要么是超快充,要么是换电,也有车企有自己的坚持,比如比亚迪的双枪快充
2025-01-19 11:58:00
NVIDIA RTX 5090 Vulkan/OpenCL性能首曝!比RTX 4090提升37%
快科技1月19日消息,NVIDIA最新的GeForce RTX 5090显卡的Geekbench OpenCL和Vulkan API测试成绩首次曝光
2025-01-19 11:58:00