• 我的订阅
  • 头条热搜
首个可保留情感的音频LLM!Meta重磅开源7B-Spirit LM,一网打尽「音频+文本」多模态任务
...加上相应的模态标记。文本数据:[TEXT]这是一个文本句子音频数据:[SPEECH][Hu262][Hu208][Hu499][Hu105]交错语音和文本(Interleaving Speech and Text)对于对齐的语音+文本数据集,通过在单词级别交错语音和文本来混合:[TEXT]th……更多
刚刚,我们感受了一波最「像人」的国产AI,模型还是开源的
...来的人与 AI 交互方式。具体来说,AI 能做到接收文本、音频和图像的任意组合作为输入,并实时生成文本、音频和图像的任意组合输出。如今,智谱清言的「情感语音通话」又一次推动了国产 AI 对标国际先进水平。情感语音模...……更多
...官米拉·穆拉蒂(Mira Murati)介绍,GPT-4o可以接收文本、音频和图像的任意组合作为输入,并实时生成文本、音频和图像的任意组合进行输出,其中“o”代表“omni全能”。一直以来,多模态人机交互便是AI领域重点研究发力方向...……更多
让大模型能听会说,国内机构开源首个端到端语音对话模型Mini-Omni
...6725 代码仓库:https://github.com/gpt-omni/mini-omni针对多层级的音频编码方案,本文采用不同层级延迟并行输出的方案减小音频推理长度,有效解决实时性问题。同时还提出了多任务同时推理的生成方法进一步加强模型的语音推理能力...……更多
GPT-4劲敌,谷歌进入高能+高产模式
...高达10,000,000 token的文本时,检索准确性仍然高达99.2%。在音频处理方面,Gemini 1.5 Pro能够在大约11小时的音频资料中,100%成功检索到各种隐藏的音频片段。在视频处理方面,Gemini 1.5 Pro能够在大约3小时的视频内容中,100%成功检索...……更多
出门问问重磅发布全新2.5D数字人系统 WetaAvatar 4.0
...同步性的模型 SyncNet 计算的音画同步置信度。相同的驱动音频和驱动视频,数值越高越好。TTS引擎MeetVoice Pro赋能数字人在第四代数字人系统WetaAvatar 4.0中,用户提交文本后,系统将调用出门问问的TTS引擎MeetVoice Pro,该引擎基于...……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
...的独特之处在于:1)Align-Anything 框架支持文本、图像、音频、视频等多种模态的输入和输出对齐,这在目前开源社区中是独一无二的。它填补了现有框架仅支持单一模态或少数模态对齐的空白,为全模态大模型的对齐提供了统...……更多
只有谷歌受伤的世界达成了,但“全能模型”到底该不该跟?
...特性,可以从三个方面理解:1.多模态。GPT-4o接受文本、音频和图像的任意组合作为输入,实时对音频、视觉和文本进行推理,生成相应的输出。相比ChatGPT的文生文、文生图,Sora的文生视频等,GPT-4o是一个原生多模态的融合体...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
...、语音和视觉多模态,在与社交紧密关联的文字、图片、音频和视频场景齐发力,让用户在立体、多感官的人机互动中体验有温度的 AI。结语2024 年被很多圈内人士称为 AIGC 应用元年,大家关注的焦点不再只是拼参数和基础能力...……更多
AI也会「刷抖音」!清华领衔发布短视频全模态理解新模型 | ICML 2024
...性和准确性。想要看懂短视频,除了视觉内容外,语音和音频等听觉信息,如视频音乐、音效、语音内容等,也对短视频的理解起到关键作用。音视频大语言模型(av-LLMs)在近几年取得了显著进展,但语音作为视频中人类语言...……更多
趣丸科技副总裁兼CTO谢睿:多模态智能激发应用新场景 | 新质生产力·AI Partner大会
...趣丸科技在人工智能方面的最新探索成果,以及赋能智能音频和数字安全方面的一些思考。首先,请允许我简单介绍一下趣丸科技。我们是一家成立于2014年的国家高新技术企业,可能有些朋友对我们的兴趣社交产品TT语音和TT电...……更多
云知声推出山海多模态大模型:实时生成文本、音频和图像
...通过整合跨模态信息,山海多模态大模型能够接收文本、音频、图像等多种形式作为输入,并实时生成文本、音频和图像的任意组合输出。▲云知声山海助手微信小程序IT之家获悉,山海多模态大模型有如下特点:实时秒回,自...……更多
Gemini引领多模态AI热潮,产业发展有望加速
...来里程碑Gemini1.0具有原生多模态的能力,能够处理视频、音频、图像、文本、代码等多种形式的内容,且性能优于现有的“拼接型”多模态大模型。据谷歌介绍,Gemini不仅可以进行双模态之间的转换,也能处理需要进行多模态转...……更多
喜马拉雅音频大模型亮相,AI赋能内容创作者
...术企业展示AI时代云上创新的潮流科技。喜马拉雅珠峰AI音频多模态大模型亮相云栖大会,在“人工智能+”主题馆吸引众多市民驻足围观体验。AI(人工智能)已经在深刻影响着我们的生活,也影响和改变着内容创作行业。作为...……更多
对比学习滥用隐私数据!中科院等发布「多步误差最小化」方法 | ACM MM2024
...,随着多模态学习的兴起,研究者们对结合文本、图像和音频等多种数据类型的模型产生了浓厚的兴趣。其中,多模态对比学习成为了这一领域的重要方法,如CLIP和ALIGN等模型利用对比损失训练,以增强图像和文本的相关性,进...……更多
...Qwen-72B的开源,通义千问还开源了18亿参数模型Qwen-1.8B和音频大模型Qwen-Audio。开源模型Qwen-1.8B,推理2K长度文本内容仅需3G显存,可在消费级终端部署。Qwen-Audio能够感知和理解人声、自然声、动物声、音乐声等各类语音信号。用...……更多
Google推出全新人工智能模型Gemini 2.0 用途更为广泛
...emini 2.0 Flash,该公司称其除文本外,还能原生生成图像和音频。 2.0 Flash 还可以调用第三方应用程序和服务,使其能够接入 Google 搜索、执行代码等。2.0 Flash 的实验版本将从今天开始通过 Gemini API 和 Google 的人工智能开发者平台AI...……更多
华中科技大学白翔教授发布多模态大模型
...类可以同时处理和整合多种感知数据(例如文本、图像、音频等)的AI架构。据介绍,Monkey模型在18个数据集上的实验中表现出色,特别是在图像描述和视觉问答任务方面,超越了众多现有知名的模型如微软的LLAVA、谷歌的PALM-E、...……更多
以假乱真,天工音乐大模型带来颠覆式AI体验
...探索方向中,“情感AGI”的重要意义。相比文本和图片,音频内容是理解人类情感最好的方式,而音乐又是人类情感表达最充沛、最不受地域和文化限制的内容载体,不论时代变幻,不论是战争还是灾祸,人们总是能通过音乐传...……更多
记者实测|速度更快成本更低,人机交互更自然,OpenAI新模型免费开放
...型GPT-4 Turbo的两倍,但成本仅为GPT-4 Turbo的一半,视频、音频功能得到改善。OpenAI CEO奥尔特曼(Sam Altman)在博客中表示,ChatGPT免费用户也能用上新发布的GPT-4o。此外,OpenAI还与苹果走到一起,推出了适用于macOS的桌面级应用。Ope.……更多
背水一战狙击GPT-4,谷歌最强大模型Gemini终发布,听说读写全能选手 | 焦点分析
...,Gemini终于揭开了面纱——展现了其文本、图像、视频、音频和代码的五大能力,一口气推出了大中小三个版本,从云上到手机、平板都可以跑。并且,Gemini还有大量的酷炫用例:AI对一段视频可以做出准确反应,AI能和你玩你...……更多
OpenAI发布GPT-4o,人工智能AIETF涨0.85%
...惊掉在场所有观众的下巴。在短短232毫秒内,GPT-4o就能对音频输入做出反应,平均为320毫秒。这个反应时间,已经达到了人类的级别!受消息面的催化,今日人工智能AIETF(515070)开盘冲高,截至发稿,人工智能AIETF(515070)涨0....……更多
Sora再度颠覆AI视频行业,A股哪些公司有相关布局?
...AI技术为基础的多媒体创作垂类大模型,由视频大模型、音频大模型、图片大模型、语言大模型组成,聚焦数字创意垂类创作场景。2月2日,万兴科技在互动平台表示,天幕大模型主要基于公司在数字创意领域二十年的产品开发...……更多
OpenAI推迟上线语音功能,GPT-5或要等到明年,大模型技术速度正在放缓
...发布会上对外展示,当时发布的新一代大模型GPT-4o集文本音频视觉于一身,支持文本、音频和图像的任意组合作为输入和输出,被OpenAI称为“迈向更自然的人机交互的一步”。根据当时公布的基准测试,GPT-4o在多语言、音频和视...……更多
神仙打架!谷歌新款大模型Gemini 和GPT-4谁能笑到最后?丨科技观察
...味着它接受包括多种媒体类型的输入,组合文本、图像、音频、视频和编程代码。未来,谷歌还计划将 Gemini添加到谷歌搜索引擎和 Chrome 网络浏览器等产品中,而全球有数十亿人在使用这些产品。谷歌首席执行官皮查伊 让GPT-4...……更多
创新工场李开复:大模型领域只投资“AI-First应用”
...实现认知和决策智能的转折点。现实世界的信息是文本、音频、视觉、传感器以及人类各种触觉的综合体系,要更为精准地模拟现实世界,就需要将各种模态能力打通,例如文本-图像、文本-视频等跨模态甚至全模态的综合能力...……更多
阿里CEO吴泳铭:生成式AI让世界有了一个统一的语言——Token
...以多种模态存在——自然语言、程序代码、图像、视频、音频、3D模型、数学符号……这些信息形式各自独立,彼此之间的“对话”几乎不存在。AI虽然能够在单一模态下表现出色,但面对多模态信息时,却往往显得力不从心。...……更多
vivo自研大模型全家桶炸场,亮出PhoneGPT智能体,蓝心小V一键搞定衣食住行
...V不仅可以对屏幕界面进行识别和操作,也可以通过接管音频进行自主对话,以完成用户交代的任务,例如帮助我们去订餐厅、订咖啡等等。第三个方面是重构人与物理世界的连接体验,vivo利用多模态大模型,让手机成为视障人...……更多
2022生成模型进展有多快,新论文盘点9类生成模型代表作
...基于文本输入的就有7种——图像、视频、代码、3D模型、音频、文本、科学知识……尤其2022年,效果好的AI生成模型层出不穷,又以OpenAI、Meta、DeepMind和谷歌等为核心,发了不少达到SOTA的模型。这不,立刻有学者写了篇论文,...……更多
谷歌史上最强大模型!Gemini 2.0正式发布
...,带来了更强的性能、更多的多模态表现(如原生图像和音频输出)和新的原生工具应用。Gemini 2.0关键基准测试中相较于前代产品Gemini 1.5 Pro实现了性能的大幅提升,速度甚至达到了后者的两倍。支持图像、视频和音频等多模态...……更多
更多关于科技的资讯:
2024平板电脑市场变天了:小米大增73%
市场调研机构Canalys公布了2024年全球平板电脑市场统计数据。最新数据显示,2024年第四季度全球平板电脑出货量达到3990万台
2025-02-08 17:15:00
软弹耐磨 鸿星尔克凌跃2.0跑鞋110元大促 吊牌299元
天猫【鸿星尔克官方旗舰店】鸿星尔克凌跃 2.0 跑鞋日常售价为 219 元,下单领取 70 元优惠券,首次购买用户叠加 7~10 元首购礼金
2025-02-08 17:15:00
韶音发布OpenFit 2 开放式耳机,开启舒适听音新时代
在2025年初举办的首届ShokzDay交流会上,作为开放式耳机、专业运动耳机赛道推动者的韶音,正式推出了新一代韶音舒适圈OpenFit2
2025-02-08 17:45:00
OPPO Find N5真机出炉:折痕最浅 机身全球最薄
快科技2月8日消息,今天下午,OPPO周意保晒出了Find N5折叠屏真机照。这款折叠屏不仅做到了全球最薄,折痕也是行业最浅
2025-02-08 17:45:00
小米回应春节期间夺手机第一:在不擅长的线下打败友商
快科技2月8日消息,据华尔街见闻援引供应链数据,2025年W5(1.27-2.2)春节期间,小米新机激活量达130万台
2025-02-08 17:45:00
七彩虹笔记本大升级!“虹光AI”智能助手接入满血DeepSeek
快科技2月8日消息,继联想“小天”之后,七彩虹科技升级全新“虹光AI”智能模型助手,正式将满血版DeepSeek R1模型引入
2025-02-08 18:15:00
2025年第一款双潜望旗舰!OPPO Find X8 Ultra 3月登场
快科技2月8日消息,博主数码闲聊站暗示,OPPO Find X8 Ultra会在3月份正式发布。对比上代Find X7 Ultra
2025-02-08 18:15:00
荣耀MagicBook Pro 14配置抢先曝光:酷睿Ultra 200H系列处理器 可流畅运行《黑神话:悟空》
快科技2月8日消息,2025年刚开年,荣耀就给了所有打算换本的同学一个大惊喜。昨晚,荣耀 PC 产品线总经理@朱臣才-荣耀 在微博上放出了新品笔记本荣耀MagicBook Pro 14的一段实测演示视频
2025-02-08 18:15:00
走出去 创未来丨亮晶晶:借数字化之力,破解潍企出海“密码”
大众网记者 杨晓玲 潍坊报道外贸是拉动经济增长的重要引擎,也是联结国内国际双循环的重要枢纽,跨境电商则是城市外贸经济的重要推动力
2025-02-08 18:38:00
胖东来:全村的希望
正月初五,胖东来蛇年营业第一天,不出意外的给其所在的小城——河南许昌,带来了一场市内“春运”。胖东来许昌地区门店每日总客流量超过30万人
2025-02-08 18:45:00
王腾包场请REDMI团队看《哪吒2》:大家都说REDMI和哪吒气质很像
快科技2月8日消息,今天,REDMI王腾包场请团队成员去看电影《哪吒2》。他表示,组织大家一起学习怎么打造优秀的产品,很多视觉效果对我们做设计和视觉都有借鉴意义
2025-02-08 18:45:00
ColorOS将全面接入DeepSeek:比友商方案更高效
快科技2月8日消息,ColorOS陈希宣布,本月底ColorOS将全面接入DeepSeek,小布助手将是首个和DeepSeek深度融合的系统智能助理
2025-02-08 18:45:00
提升购物体验,增加商业价值——揭秘电梯安装对购物中心
在繁华的都市中,购物中心如同一颗颗璀璨的明珠,吸引着无数消费者的目光。而电梯,作为购物中心的重要组成部分,其安装不仅提升了建筑的垂直交通效率
2025-02-08 19:25:00
2025年春节国际和港澳台漫游来访业务快速提升
本文转自:人民网人民网北京2月8日电 (记者申佳平)据工业和信息化部官网消息,2025年春节,得益于我国过境免签政策适用范围不断扩大
2025-02-08 19:38:00
负债千亿!苏宁系公告破产重整
快科技2月8日消息,苏宁系宣布破产!全国企业破产重整案件信息网发布苏宁电器集团有限公司、苏宁控股集团有限公司、 苏宁置业集团有限公司破产重整案件信息与一债会公告
2025-02-08 19:45:00