• 我的订阅
  • 头条热搜
仅用4块GPU、不到3天训练出开源版GPT-4o,这是国内团队最新研究
LLaMA-Omni能够接收语音指令,同步生成文本和语音响应,响应延迟低至 226ms,低于 GPT-4o 的平均音频响应延迟 320ms。以 ChatGPT 为代表的大型语言模型(LLM)已成为强大的通用任务解决器,但大多数 LLM 仅支持基于文本的交互,这限...……更多
亚马逊开发史上最大文本转语音模型
2月18日消息,亚马逊人工智能研究团队宣布开发了一个据称是史上最大的文本转语音模型,该模型拥有最多的参数,并使用了最大的训练数据集。研究人员已经在arXiv预印本服务器上发表了一篇论文,详细描述了模型的开发和训...……更多
首个可保留情感的音频LLM!Meta重磅开源7B-Spirit LM,一网打尽「音频+文本」多模态任务
...研究领域,但现有的模型要么在仅包含语音的数据上进行训练,要么是关注特定任务,如文本转语音(TTS)、自动语音识别(ASR)或翻译,在其他模态数据和任务上的泛化能力十分有限。在大型语言模型(LLM)性能不断提升的情...……更多
首个VR端3D角色扮演AI发布!南洋理工公开SOLAMI技术报告,端到端VLA模型驱动,唱跳都能陪你玩
...VR中有更进一步的交流。近日,来自南洋理工大学的研究团队在VR中实现了第一个3D版角色扮演AI系统SOLAMI,并公开其详细的技术报告。没错,这意味着和各种角色在VR中沉浸式聊天已经是可实现的!项目主页:https://solami-ai.github.i...……更多
多个中国团队斩获EMNLP\\\'24最佳论文!UCLA华人学者中三篇杰出论文
...起来了~接下来,具体康康获奖论文有哪些~上交大CMU等团队获最佳论文此次共有5项研究成果获得EMNLP’24最佳论文奖。1、An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevance(图像能表达千言万语……更多
让大模型能听会说,国内机构开源首个端到端语音对话模型Mini-Omni
...进一步加强模型的语音推理能力。另一方面,本文所采用训练方案可有效迁移至任意语言大模型,通过增加少量参数及分阶段训练,在尽可能保留模型原始推理能力的同时,为模型加上 「听、说」的语音交互能力。 为了验证方...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
...其中Semi 赛道第一名由社交平台 Soul App 摘得,其语音技术团队凭借可行性创新技术方案拔得头筹。 不过,在揭秘 Soul 团队技术方案之前,我们有必要先来了解 AI 在多种模态中的情感识别能力。人机交互下一步要让 AI 懂情感如...……更多
一文看尽Meta开源大礼包!全面覆盖图像分割、语音、文本、表征、材料发现、密码安全性等
...模拟视觉相似物体和小物体,并且通过在较长的帧序列上训练模型并对「空间」和「物体指向记忆」(object pointer memory)的位置编码进行一些调整,提高了SAM 2的遮挡处理能力(occlusion handling capability)。研究人员还开源了SAM 2开...……更多
清华团队提出大模型“密度定律”;足球领域首个视觉语言基础模型
...的大模型前沿论文SwiftEdit:50 倍速文本引导图像编辑清华团队提出大模型“密度定律”足球领域首个视觉语言基础模型Aguvis:首个完全自主的纯视觉 GUI agentGoogle DeepMind:利用运动轨迹控制视频生成大模型数学新基准:成功率最...……更多
语音克隆达到人类水平,微软全新VALL-E 2模型让DeepFake堪比配音员
...来深度学习的快速进步,用录音室环境下的干净单人语音训练模型,已经可以达到人类同等水平的质量,但零样本TTS依旧是一个有挑战性的问题。「零样本」意味着推理过程中,模型只能参照一段简短的陌生语音样本,用相同的...……更多
...太空中收集能量。据外媒,来自美国加州理工学院的科研团队近期在这个方向上迈出了关键一步,他们成功利用轨道卫星收集到太阳能,并成功将其传输到地球。点评:这项实验为未来的太空太阳能站的建设和运营提供了重要的...……更多
...了语言覆盖方面的空白,并且性能优于现有的系统。研究团队说,本项研究工作或可为快速通用翻译铺平道路,其资源公开可用(用于非商业用途),以协助进一步研究包容性语音翻译技术。该论文介绍,科幻小说的读者可能很熟...……更多
刚刚,我们感受了一波最「像人」的国产AI,模型还是开源的
...索。具体到 GPT-4o 上,OpenAI 跨文本、视觉和音频端到端地训练了一个新模型,所有输入和输出都由同一神经网络处理。行业内认为,这是一种可以将音频直接映射到音频作为一级模态的技术方法,涉及 Token 化和架构等方面的研...……更多
迎战GPT-4V!谷歌PaLI-3视觉语言模型问世,更小、更快、更强
... Faster, Stronger”为题,已发表到预印本网站 arXiv 上。研究团队认为,仅有 50 亿参数的 PaLI-3 重新点燃了关于复杂 VLM 核心组成部分的研究,可能推动新一代规模更大的模型的发展。 更高分辨率的多模态学习最近,大型视觉语言...……更多
首个支持普通话和方言混说的TTS大模型:河南话、上海话说得溜
...Lab 的技术创新与突破为了解决上述难题,巨人网络 AI Lab 团队中的算法专家和语言学家共同努力,基于中国方言体系,构建了涵盖 20 种方言、超过 20 万小时的普通话和方言数据集。通过这一庞大的数据集,我们训练出了第一个...……更多
国家科学技术进步一等奖,为何给了这家AI国家队
...分钟;“三声有幸”项目,累计服务1368万人,助力公益团队创建无障碍应用超3万个。未来:智能语音+认知大模型,用人工智能建设美好世界记者了解到,因2021年、2022年国家科学技术奖暂停的缘故,2023年度国家科学技术奖积累...……更多
2022生成模型进展有多快,新论文盘点9类生成模型代表作
...上做出大突破。与DALL・E一样,两点依旧是CLIP模型,除了训练数据庞大,CLIP基于Transformer对图像块建模,并采用对比学习训练,最终帮助DALL・E2取得了不错的生成效果。下图是DALL・E2根据“一只戴着贝雷帽、穿黑色高领毛衣的柴...……更多
只用 13 天,OpenAI 做出了能听、能说、能自主决策的机器人大模型
...的速度已经接近人类速度Figure 的创始人 Brett Adcock 和 AI 团队的负责人 Corey Lynch 在 X 上解释了此次视频中机器人互动背后的原理。此次的突破,由 OpenAI 与 Figure 共同做出。OpenAI 提供负责提供视觉推理和语言理解,而 Figure 的神……更多
Meta提出“可持续思维链”,让大模型在连续潜空间中推理
今日值得关注的大模型前沿论文北大团队提出「自定义漫画生成」框架UniReal:通过学习真实世界动态实现通用图像生成和编辑苹果团队提出「可扩展视频生成」方法利用扩散 Transformer 进行视频运动迁移ObjCtrl-2.5D:无需训练的「...……更多
Sam Altman或筹数十亿美元自造AI芯片,DeepMind首席科学家或将辞职创业
...ma2自己给自己微调,性能超越了GPT-4Meta和纽约大学的研究团队最近提出了一种创新的“自我奖励语言模型”方法,使得微调后的Llama 2-70B模型在AlpacaEval 2.0排行榜中超越了GPT-4、Claude 2和Gemini Pro等领先的大语言模型。这项研究的突...……更多
...是国内支持最多方言、覆盖人口最多的语音大模型;研发团队首创“蒸馏+膨胀”联合训练算法,解决超大规模多场景数据集和大规模参数条件下,预训练坍缩的问题,实现1B参数80层模型稳定训练;星辰语音大模型也是业内首个...……更多
OpenAI机器人亮相,大模型有了“肉身”,英伟达微软都有投资
...,Figure 01不管是在理解能力,还是推理反应都非常强大。团队特别强调,所有这些行为都没有经过远程操作,而是通过机器人自主学习。并且整段视频没有任何加速,也没有任何剪辑,全部一镜到底拍摄。根据Figure团队负责人Cor...……更多
...具,如普林斯顿大学学生开发的GPTZero、斯坦福大学研究团队推出的DetectGPT等。我国一些研究团队也陆续发布各类检测工具,如西湖大学文本智能实验室研发的Fast-DetectGPT。人类的创作与AIGC之间存在哪些差异?AI检测工具如何根据...……更多
科大讯飞联手华为首次攻克全国产算力下推理模型训练难关
...讯飞星火坚持走全国产化路线。尽管在全国产算力平台上训练深度推理模型遭遇了诸多挑战,但科大讯飞携手华为,成功攻克了训练推理强交互、高吞吐推理优化以及国产算子优化等一系列难题,最终成功训练出我国首个基于全...……更多
Bonus独家 | 揭秘腾讯大模型新项目组「混元助手」人才地图
...职场Bonus从多处信源得知:该项目组将联合腾讯内部多方团队构建大参数语言模型,目标是“通过性能稳定的强化学习算法训练,完善腾讯智能助手工具,打造腾讯智能大助手,并能成为国内的业界标杆”。腾讯的底气之一,是...……更多
开源社区参数量最大的文生视频模型来了,腾讯版Sora免费使用
...及服务,能够节约大量人力及算力。同时,各大模型研发团队均可基于腾讯混元模型进行研究与创新,加速行业创新步伐。据技术报告,在混元视频生成模型架构设计与训练中,采用了多个创新技术:包括通过新一代本文编码器...……更多
AI识别方言困难!专家探索用算法度量方言差距,提议构建统一框架
...语形式流传,缺乏对应文字,并且难以收集,可用于模型训练的方言语料数据偏少。信也科技算法科学家倪博溢。10月24日,第八届信也科技杯算法大赛总决赛上,9支人工智能队伍角逐,探索利用AI技术识别和还原语音数据中的...……更多
本周硅谷发生了什么?|OpenAI推出5项更新;微软组建新的AI团队;Googe发布文生视频模型Lumiere
...。微软集中公司内部顶尖AI研究人员力量,组建新的GenAI团队研发小模型,减少对OpenAI的依赖。Adept AI发布多模态模型Fuyu-Heavy,官方称跑分表现仅次于GPT4-V和Gemini Ultra。同时,国内大模型也有不少进展,通义千问团队升级了视觉...……更多
OpenAI发布免费新品GPT-4o:可对音频、视觉和文本实时推理,与人自然对话,功能秒杀Siri
...音,也不能输出笑声、歌声或情感表达。利用GPT-4o,OpenAI训练了一个跨文本、视觉和音频的端到端新模型,这意味着所有输入和输出都由同一个神经网络处理,这是OpenAI第一个结合所有这些模式的模型,OpenAI仍在探索模型的功能...……更多
05后华人高中生兄弟创业AI教育,用AI给在街上游荡的孩子们讲故事
...备交给孩子。除了软件,敲敲门还配有相应的硬件产品,团队对不同的硬件设备做了适配。比如白天,孩子们可以在不伤眼的墨水书上使用AI绘本。来源:敲敲门AI而到了晚上,家长还可以用投影仪把故事投到天花板上,和孩子...……更多
更多关于科技的资讯:
齐鲁晚报·齐鲁壹点 闫丽君 邵舒琨1月26日,烟台市人民政府新闻办公室召开“一路山海·烟台购 2025烟台市惠民消费券”活动新闻发布会
2025-01-26 17:02:00
男子眼球内捉出4条蠕动线虫:左眼曾飞进去过一只苍蝇
1月26日消息,据媒体报道,浙江的杨先生到医院就诊,他感觉左眼里有虫子在钻。医生翻开病人上睑发现数条正在蠕动的白色寄生虫
2025-01-26 17:05:00
精心部署确保网络畅通,东营联通助力春晚圆满举行
近日,随着欢声笑语的弥漫,垦利区春节联欢晚会如期拉开帷幕。在这场文化盛宴的背后,东营联通垦利区分公司提前筹划、精心保障
2025-01-26 17:11:00
没用D加密:《忍者龙剑传2:黑之章》PC版发售日就被攻破
之前在Xbox直面会上,忍者龙剑传2复刻版《忍者龙剑传2 黑之章》正式公布。随后该作上架Steam并发售,售价298元
2025-01-26 17:36:00
大众网记者 张姝涵 兰帅 泰安报道岁末年初,让我们一起了解常见的非法金融活动手段,守住“钱袋子”,过好幸福年!(一)承诺高额回报
2025-01-26 18:03:00
2025国补增加手机数码 山东苏宁易购迎来年前换机高峰
鲁网1月26日讯1月23日,济南等地市家电手机数码国家补贴正式上线,国补指定卖场苏宁易购全面承接,12类家电单台国补至高2000元
2025-01-26 18:07:00
平安人寿聊城中支举办社区金融内推会宣讲会
为快速搭建平安人寿聊城中支社区金融管理层队伍,确保社区金融队伍高质量发展,平安人寿聊城中支于1月8日在聊城中支职场召开平安社区金融内推会
2025-01-26 18:14:00
潮声丨义乌“走播”,走出了啥?
“走播”主播 义乌市委宣传部供图“世界的义乌”,正在不知不觉间发生变化。眼下,随着新一轮国际贸易改革启动,义乌正在深化市场采购贸易改革
2025-01-26 18:45:00
运营商“二次号码”一键解绑已上线 覆盖150款互联网应用
中国消费者报北京讯(记者武晓莉)工业和信息化部近日通告2024年第四季度电信服务质量情况。数据显示,2024年线上办理业务量超九成
2025-01-26 19:12:00
周鸿祎宣布抽送100辆国产新能源车 车型网友决定!
周鸿祎送车一事今天迎来最新进展。1月26日中午,周鸿祎在个人微博宣布,将抽送100辆国产新能源汽车。周鸿祎在微博中表示
2025-01-26 19:36:00
美联航一波音787客机空中严重颠簸:6人受重伤
1月26日消息,海外媒体近日报道,本月24日,美联航一架从拉各斯飞往华盛顿的波音787客机在飞行途中发生严重颠簸事件,导致多名旅客及机组成员轻伤
2025-01-26 19:36:00
曝雷军亲自面谈高级别汽车研发人员 有时早上8点面试
小米能有今天的成就,在科技和汽车等领域全面开花,可以说离不开雷军对人才的成功招揽。据了解,在小米汽车业务上,雷军对于招聘工作更是亲力亲为
2025-01-26 19:06:00
京东快递深圳口岸自提点开业:香港用户下单后 口岸自提
快科技1月26日消息,据京东物流介绍,为方便香港市民购物,京东近期在港澳下调了运费门槛,香港消费者满188元即可享受免运费送货上门
2025-01-26 19:06:00
猜猜是谁:美国科技界亿万富豪1.39亿英镑买下伦敦白宫
快科技1月26日消息,近日,位于伦敦摄政公园内的“伦敦白宫”(The Holme)以1.39亿英镑(约合人民币12.6亿元)的价格售出
2025-01-26 19:06:00