• 我的订阅
  • 头条热搜
首个可保留情感的音频LLM!Meta重磅开源7B-Spirit LM,一网打尽「音频+文本」多模态任务
...加上相应的模态标记。文本数据:[TEXT]这是一个文本句子音频数据:[SPEECH][Hu262][Hu208][Hu499][Hu105]交错语音和文本(Interleaving Speech and Text)对于对齐的语音+文本数据集,通过在单词级别交错语音和文本来混合:[TEXT]th……更多
刚刚,我们感受了一波最「像人」的国产AI,模型还是开源的
...来的人与 AI 交互方式。具体来说,AI 能做到接收文本、音频和图像的任意组合作为输入,并实时生成文本、音频和图像的任意组合输出。如今,智谱清言的「情感语音通话」又一次推动了国产 AI 对标国际先进水平。情感语音模...……更多
...官米拉·穆拉蒂(Mira Murati)介绍,GPT-4o可以接收文本、音频和图像的任意组合作为输入,并实时生成文本、音频和图像的任意组合进行输出,其中“o”代表“omni全能”。一直以来,多模态人机交互便是AI领域重点研究发力方向...……更多
让大模型能听会说,国内机构开源首个端到端语音对话模型Mini-Omni
...6725 代码仓库:https://github.com/gpt-omni/mini-omni针对多层级的音频编码方案,本文采用不同层级延迟并行输出的方案减小音频推理长度,有效解决实时性问题。同时还提出了多任务同时推理的生成方法进一步加强模型的语音推理能力...……更多
GPT-4劲敌,谷歌进入高能+高产模式
...高达10,000,000 token的文本时,检索准确性仍然高达99.2%。在音频处理方面,Gemini 1.5 Pro能够在大约11小时的音频资料中,100%成功检索到各种隐藏的音频片段。在视频处理方面,Gemini 1.5 Pro能够在大约3小时的视频内容中,100%成功检索...……更多
出门问问重磅发布全新2.5D数字人系统 WetaAvatar 4.0
...同步性的模型 SyncNet 计算的音画同步置信度。相同的驱动音频和驱动视频,数值越高越好。TTS引擎MeetVoice Pro赋能数字人在第四代数字人系统WetaAvatar 4.0中,用户提交文本后,系统将调用出门问问的TTS引擎MeetVoice Pro,该引擎基于...……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
...的独特之处在于:1)Align-Anything 框架支持文本、图像、音频、视频等多种模态的输入和输出对齐,这在目前开源社区中是独一无二的。它填补了现有框架仅支持单一模态或少数模态对齐的空白,为全模态大模型的对齐提供了统...……更多
只有谷歌受伤的世界达成了,但“全能模型”到底该不该跟?
...特性,可以从三个方面理解:1.多模态。GPT-4o接受文本、音频和图像的任意组合作为输入,实时对音频、视觉和文本进行推理,生成相应的输出。相比ChatGPT的文生文、文生图,Sora的文生视频等,GPT-4o是一个原生多模态的融合体...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
...、语音和视觉多模态,在与社交紧密关联的文字、图片、音频和视频场景齐发力,让用户在立体、多感官的人机互动中体验有温度的 AI。结语2024 年被很多圈内人士称为 AIGC 应用元年,大家关注的焦点不再只是拼参数和基础能力...……更多
AI也会「刷抖音」!清华领衔发布短视频全模态理解新模型 | ICML 2024
...性和准确性。想要看懂短视频,除了视觉内容外,语音和音频等听觉信息,如视频音乐、音效、语音内容等,也对短视频的理解起到关键作用。音视频大语言模型(av-LLMs)在近几年取得了显著进展,但语音作为视频中人类语言...……更多
趣丸科技副总裁兼CTO谢睿:多模态智能激发应用新场景 | 新质生产力·AI Partner大会
...趣丸科技在人工智能方面的最新探索成果,以及赋能智能音频和数字安全方面的一些思考。首先,请允许我简单介绍一下趣丸科技。我们是一家成立于2014年的国家高新技术企业,可能有些朋友对我们的兴趣社交产品TT语音和TT电...……更多
云知声推出山海多模态大模型:实时生成文本、音频和图像
...通过整合跨模态信息,山海多模态大模型能够接收文本、音频、图像等多种形式作为输入,并实时生成文本、音频和图像的任意组合输出。▲云知声山海助手微信小程序IT之家获悉,山海多模态大模型有如下特点:实时秒回,自...……更多
Gemini引领多模态AI热潮,产业发展有望加速
...来里程碑Gemini1.0具有原生多模态的能力,能够处理视频、音频、图像、文本、代码等多种形式的内容,且性能优于现有的“拼接型”多模态大模型。据谷歌介绍,Gemini不仅可以进行双模态之间的转换,也能处理需要进行多模态转...……更多
喜马拉雅音频大模型亮相,AI赋能内容创作者
...术企业展示AI时代云上创新的潮流科技。喜马拉雅珠峰AI音频多模态大模型亮相云栖大会,在“人工智能+”主题馆吸引众多市民驻足围观体验。AI(人工智能)已经在深刻影响着我们的生活,也影响和改变着内容创作行业。作为...……更多
对比学习滥用隐私数据!中科院等发布「多步误差最小化」方法 | ACM MM2024
...,随着多模态学习的兴起,研究者们对结合文本、图像和音频等多种数据类型的模型产生了浓厚的兴趣。其中,多模态对比学习成为了这一领域的重要方法,如CLIP和ALIGN等模型利用对比损失训练,以增强图像和文本的相关性,进...……更多
...Qwen-72B的开源,通义千问还开源了18亿参数模型Qwen-1.8B和音频大模型Qwen-Audio。开源模型Qwen-1.8B,推理2K长度文本内容仅需3G显存,可在消费级终端部署。Qwen-Audio能够感知和理解人声、自然声、动物声、音乐声等各类语音信号。用...……更多
Google推出全新人工智能模型Gemini 2.0 用途更为广泛
...emini 2.0 Flash,该公司称其除文本外,还能原生生成图像和音频。 2.0 Flash 还可以调用第三方应用程序和服务,使其能够接入 Google 搜索、执行代码等。2.0 Flash 的实验版本将从今天开始通过 Gemini API 和 Google 的人工智能开发者平台AI...……更多
华中科技大学白翔教授发布多模态大模型
...类可以同时处理和整合多种感知数据(例如文本、图像、音频等)的AI架构。据介绍,Monkey模型在18个数据集上的实验中表现出色,特别是在图像描述和视觉问答任务方面,超越了众多现有知名的模型如微软的LLAVA、谷歌的PALM-E、...……更多
紫东.太初再进化,揭秘全模态大模型的想象力
...首个三模态大模型紫东.太初1.0,可以利用文本、图片、音频三种模态数据进行跨模态的统一表征和学习。对应到全模态大模型,泛指可以利用文本、图片、音频、视频、3D等不同模态的数据进行跨模态的统一表征和学习,更接近...……更多
以假乱真,天工音乐大模型带来颠覆式AI体验
...探索方向中,“情感AGI”的重要意义。相比文本和图片,音频内容是理解人类情感最好的方式,而音乐又是人类情感表达最充沛、最不受地域和文化限制的内容载体,不论时代变幻,不论是战争还是灾祸,人们总是能通过音乐传...……更多
记者实测|速度更快成本更低,人机交互更自然,OpenAI新模型免费开放
...型GPT-4 Turbo的两倍,但成本仅为GPT-4 Turbo的一半,视频、音频功能得到改善。OpenAI CEO奥尔特曼(Sam Altman)在博客中表示,ChatGPT免费用户也能用上新发布的GPT-4o。此外,OpenAI还与苹果走到一起,推出了适用于macOS的桌面级应用。Ope.……更多
背水一战狙击GPT-4,谷歌最强大模型Gemini终发布,听说读写全能选手 | 焦点分析
...,Gemini终于揭开了面纱——展现了其文本、图像、视频、音频和代码的五大能力,一口气推出了大中小三个版本,从云上到手机、平板都可以跑。并且,Gemini还有大量的酷炫用例:AI对一段视频可以做出准确反应,AI能和你玩你...……更多
最快六月露面!GPT-5七大震撼能力首次揭秘
...经过一些内部调研,以下是七项GPT-5最具变革性的能力。1音频和视频处理——更强大的多模态处理能力GPT-5比GPT-4更加强大的数据理解能力,可以在多模态理解方面表现更出色。它将延续GPT-4的文本和图像处理功能,同时加入音频...……更多
AIGC在教育产品的商业化应用
...创建过程,同时满足用户的个性化需求。如图像、文本、音频、视频等。AIGC被认为是继UGC(用户生成内容)和PGC(专业生成内容)之后的一种新型内容创作方式。AIGC可以应用于各种领域,如艺术、教育、娱乐、营销等,提供丰...……更多
OpenAI发布GPT-4o,人工智能AIETF涨0.85%
...惊掉在场所有观众的下巴。在短短232毫秒内,GPT-4o就能对音频输入做出反应,平均为320毫秒。这个反应时间,已经达到了人类的级别!受消息面的催化,今日人工智能AIETF(515070)开盘冲高,截至发稿,人工智能AIETF(515070)涨0....……更多
Sora再度颠覆AI视频行业,A股哪些公司有相关布局?
...AI技术为基础的多媒体创作垂类大模型,由视频大模型、音频大模型、图片大模型、语言大模型组成,聚焦数字创意垂类创作场景。2月2日,万兴科技在互动平台表示,天幕大模型主要基于公司在数字创意领域二十年的产品开发...……更多
OpenAI推迟上线语音功能,GPT-5或要等到明年,大模型技术速度正在放缓
...发布会上对外展示,当时发布的新一代大模型GPT-4o集文本音频视觉于一身,支持文本、音频和图像的任意组合作为输入和输出,被OpenAI称为“迈向更自然的人机交互的一步”。根据当时公布的基准测试,GPT-4o在多语言、音频和视...……更多
神仙打架!谷歌新款大模型Gemini 和GPT-4谁能笑到最后?丨科技观察
...味着它接受包括多种媒体类型的输入,组合文本、图像、音频、视频和编程代码。未来,谷歌还计划将 Gemini添加到谷歌搜索引擎和 Chrome 网络浏览器等产品中,而全球有数十亿人在使用这些产品。谷歌首席执行官皮查伊 让GPT-4...……更多
创新工场李开复:大模型领域只投资“AI-First应用”
...实现认知和决策智能的转折点。现实世界的信息是文本、音频、视觉、传感器以及人类各种触觉的综合体系,要更为精准地模拟现实世界,就需要将各种模态能力打通,例如文本-图像、文本-视频等跨模态甚至全模态的综合能力...……更多
阿里CEO吴泳铭:生成式AI让世界有了一个统一的语言——Token
...以多种模态存在——自然语言、程序代码、图像、视频、音频、3D模型、数学符号……这些信息形式各自独立,彼此之间的“对话”几乎不存在。AI虽然能够在单一模态下表现出色,但面对多模态信息时,却往往显得力不从心。...……更多
更多关于科技的资讯:
影驰GeForce RTX 5080圣刃OC显卡评测:小尺寸高性能 高端玩家完美之选
一、前言:更贴近游戏玩家需求的准旗舰显卡NVIDIA在2025年开年推出了全新的GeForce RTX 50系显卡,旗舰级别的GeForce RTX 5090 D价格直接来到了16000元之上
2025-01-30 22:38:00
中国人是不是都会功夫 甄子丹这回答再也解释不清了
快科技1月30日消息,这下再也解释不清了,甄子丹喊话外国人中国人人都会功夫。在刚刚过去的蛇年春晚,“功夫巨星”甄子丹 带来武术节目《笔走龙蛇》
2025-01-30 22:38:00
五彩斑斓的黑!技嘉RTX 5080 MASTER显卡图赏
快科技1月30日消息,今日技嘉RTX 5080 MASTER显卡正式发布。现在这款新品已经来到我们评测室,下面为大家带来图赏
2025-01-30 22:38:00
丧心病狂!针对DeepSeek网络攻击暴增上百倍:职业打手开始下场攻击
快科技1月30日消息,随着DeepSeek的爆火,老外开始对它的攻击加大,而且力度也是越来越强。1月30日凌晨,即农历大年初二
2025-01-30 23:08:00
EA解散《龙腾世纪》团队
EA正在清理门户,《质量效应5》交由另一批人掌控,所有资深编剧及写手要么离开了BioWare,要么被调往其它单位。曾于2011至2016年间在BioWare任编剧的Ann Lemay在社交平台发帖称
2025-01-30 23:08:00
18.05亿元前所未有!蛇年大年初一票房创造历史新纪录
快科技1月30日消息,根据国家电影局统计,2025年春节大年初一(1月29日)票房为18.05亿元,观影人次为3515
2025-01-30 11:08:00
台湾嘉义县发生5.2级地震 福建多地震感明显
快科技1月30日消息,据中国地震台网正式测定:01月30日10时11分在台湾嘉义县(北纬23.25度,东经120.57度)发生5
2025-01-30 11:38:00
又一车企妥协:阿尔法·罗密欧即将放弃2027年全面电动化目标
快科技1月30日消息,日前,阿尔法·罗密欧宣布将放弃2027年在北美全面实现电动化的目标,转而采用多种动力形式并举的战略
2025-01-30 12:08:00
索尼PSN政策再度生变
如果没有发生PSN风波,地狱里的老司机应该比现在更多——索尼去年在PC平台同步推出GaaS游戏《地狱潜行者2》时,请君入瓮后又强制要求玩家登录PSN账号
2025-01-30 12:08:00
美国一架客机与一架直升机空中相撞坠河 客机上有约60名乘客
快科技1月30日消息,据美国联邦航空管理局消息,1月29日晚,在接近罗纳德·里根华盛顿国家机场跑道时,一架客机与一架直升机相撞
2025-01-30 12:08:00
余承东称将引发全国人民抢购!华为重磅新品3月发布:或是全新折叠产品
快科技1月30日消息,近日余承东直播时又主动爆料称,华为即将发布重磅新品。直播中,余承东透露了华为即将发布的一款意想不到的新品
2025-01-30 13:38:00
韩国客机烧出一个大洞:可能因充电宝 行李架蹿出火花
快科技1月30日消息,据报道,28日晚,釜山航空BX391次航班在准备起飞阶段突发火灾。在紧急撤离过程中,由于吸入烟气等原因
2025-01-30 13:38:00
为降低成本:日产宣布三家工厂裁员并减少班次
快科技1月30日消息,日产汽车宣布正在削减美国三家工厂的部分生产班次,并向田纳西州士麦那和密西西比州坎顿的整车装配厂以及田纳西州德彻德的发动机厂员工提供离职补偿方案
2025-01-30 15:38:00
赵雅芝 蛇年最忙的女人:73岁高龄身材、颜值依然抗打 网友感慨
1月30日消息,中国香港女演员赵雅芝可能是蛇年最忙碌的艺人之一。据悉,71岁的赵雅芝受国内9家电视台邀请,现身它们的“春晚”舞台
2025-01-30 15:38:00
法国耗资540亿欧元AI推出3天后下架:错误频出 建议用户吃牛蛋
快科技1月30日消息,据报道,法国近期斥资540亿欧元推出了一款名为Lucie的法语AI聊天机器人,然而,由于其表现过于离谱
2025-01-30 16:08:00