• 我的订阅
  • 头条热搜
87.8%准确率赶超GPT-4o登顶!谷歌DeepMind发布自动评估模型FLAMe
...型FLAMe系列,FLAMe-RM-24B模型在RewardBench上表现卓越,以87.8%准确率领先GPT-4o。大语言模型都卷起来了,模型越做越大,token越来越多,输出越来越长。那么问题来了,如何有效地评估大语言模型的长篇大论呢?要是输出长度长了但...……更多
空间智能版ImageNet来了!李飞飞吴佳俊团队出品
...验评估方面,HourVideo采用五选多任务问答(MCQ)任务,以准确率作为评估指标,分别报告每个任务以及整个数据集的准确率。由于防止信息泄露是评估长视频中的MCQ时的一个重要挑战——理想情况下,每个MCQ应独立评估,但这种...……更多
迈向多语言医疗大模型:大规模预训练语料,开源模型与全面基准测试
...学场景。 所有数据和代码、模型均已开源。MMedBench 上的准确率,图 d 展⽰了在 MMedC 上进⼀步预训练使模型性能相⽐于基线显著提升。大规模多语医疗语料(MMedC)构建在构建数据集方面,研究团队收集了一份多语言医疗语料库...……更多
无一大模型及格! 北大/通研院提出超难基准,评估长文本理解生成
...T4-8k、GPT3.5-turbo-6k、LlamaIndex这种商业模型,平均只有40%的准确率。而像开源模型表现就更不理想了…ChatGLM2-6B、LongLLaMa-3B、RWKV-4-14B-pile、LLaMA-7B-32K平均只有10%的准确率。目前该论文已被ACL 2024接……更多
媲美OpenAI事实性基准,这个中文评测集让o1-preview刚刚及格
...T-4o mini 仅 37.6 分,ChatGLM3-6B 和 Qwen2.5-1.5B 仅 11.2 和 11.1 的准确率。基于中文 SimpleQA,我们对现有 LLM 的事实性能力进行了全面的评估。并维护一个全面的 leaderboard 榜单。同时我们也在评测集上实验分析了推理 s……更多
指令跟随大比拼!Meta发布多轮多语言基准Multi-IF:覆盖8种语言,超4500种任务
...中表现显著衰减,表现最佳的o1-preview模型在三轮对话的准确率从87.7%下降到70.7%;在非拉丁文字语言上,所有模型的表现显著弱于英语。在大语言模型(LLMs)不断发展的背景下,如何评估这些模型在多轮对话和多语言环境下的指...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...过基于规则的匹配进行评估,研究团队对非编程任务使用准确率,并对编程任务使用公正的pass@k指标,定义如下: 本次评估中设定k = 1且n = 5,c表示通过所有测试用例的正确样本数量。奥林匹克竞技场奖牌榜:与奥运会使用的...……更多
多模态模型评测框架lmms-eval发布!全面覆盖,低成本,零污染
... 作为备选。最终的报告结果将基于得分转换为 0 到 100 的准确率指标。未来也可以在我们动态更新的榜单里查看多模态模型在每个月动态更新的最新评测数据,以及在榜单上的最新评测的结果。 ……更多
将偏好学习引入模型训练,北大李戈团队提出代码生成优化新框架
...提升测试结果显示,经过CodeDPO优化后,代码模型的生成准确率和效率,都获得了一定提升。★代码准确性实验研究团队在HumanEval(+),MBPP(+)和DS-1000三个数据集上进行了广泛实验,涵盖8种主流代码生成模型,包含Base模型和SF...……更多
平安保险核保依托AI自主学习,扩展多维立体评估
...数据融合进核保预测模型中,不断修正核保结论,训练核保准确率。这种基于数据的分析和修正过程,使得平安保险核保系统能够准确地评估风险,提高核保的效率和准确性。面对保险行业核保场景新一轮的挑战,平安保险始终与时俱...……更多
常见电子邮件分类算法的性能分析
...贝叶斯算法学习曲线,红色线代表测试集(学习过程中)的准确率(Score),绿色线代表该模型在测试集上的准确率,线两侧的半透明带的宽度代表方差(方差越小,模型稳定性越好,泛化性能越好)。从图1可看出,随着训练量(Train examp...……更多
支持1024帧、准确率近100%,英伟达「LongVILA」开始发力长视频
...的 LongVILA 模型在 1400 帧的大海捞针实验中实现了 99.5% 的准确率,相当于 274k 个 token 的上下文长度。此外, MM-SP 系统可以有效地将上下文长度扩展到 200 万个 token 而无需梯度检查点,与环形序列并行(ring sequence parallel……更多
扩散模型也能搞定社交信息推荐,港大数据智能实验室提出RecDiff
...估了模型的性能,结果显示相比现有方法,RecDiff在推荐准确率方面取得了显著提升。未来,RecDiff团队计划将RecDiff拓展到更多推荐场景中,并结合多模态信息,进一步探索该模型的潜力和应用价值。论文:http://github.com/HKUDS/RecDif...……更多
AI科学家太多,谁靠谱一试便知!普林斯顿新基准CORE-Bench:最强模型仅有21%准确率
...评估AI智能体在计算可重复性方面的表现,最简单任务的准确率可以达到60%,最难任务准确率仅有21%大模型的能力越来越强,用户在一些重要的任务中也可以依赖大模型,比如说辅助做科研。不过现有科研辅助相关的基准测试都...……更多
还在人工炼丹?自动提示工程指南来了,还带从头实现
...e given problem about geometric shapes.」可以看到,性能并不好,准确率只有 36%,应该有很大的改进空间。不过,在使用 APE 之前,让我们先尝试下一种提示技术:思路链(CoT)推理;这种技术虽然对原始提示词修改不多,但事实证明却...……更多
...模型预测的有效性,确保模型能准确反映市场动态。采用准确率、召回率等评估指标,对模型性能进行量化衡量,是这个阶段的关键操作。金融领域对预测准确性的要求极高,因此,模型要持续优化和更新以适应市场变化。(二)...……更多
...反馈,不断优化数据模型和算法,提高风险识别和预警的准确率。同时,根据实际业务需求和市场变化,持续改进数据管理流程和方法,提升金融风险数据资产的管理水平。信息化在金融风险数据资产建设方面发挥着重要作用。...……更多
MMMU华人团队更新Pro版!多模态基准升至史诗级难度:过滤纯文本问题、引入纯视觉问答
...多学科多模态理解和推理(MMMU)基准测试中取得了69.1%的准确率。不过,基准测试结果是否真的能反映模型对多样化主题的深入理解,仍然有争议,或者说模型是否只是利用了统计模式,而非依靠理解和推理的情况下就能得出正...……更多
AI 面试:蓝海还是“难海”?
...主研发的 AIGC HR 行业大模型和多模态算法,人机对比实验准确率超 92%,在国际处于技术领先水平,但却在融资和业务拓展中遭遇重重困难。在 AI 招聘的蓝海市场中,作为一家创业期的 AI 招聘公司,近屿智能如何向客户证明 AI ...……更多
...键步骤。统计学方法提供了各种性能指标,如均方误差、准确率、召回率和F1分数等,用于衡量模型的性能。这些指标允许我们量化模型的预测能力,并对不同模型进行比较。通过统计学方法,我们可以确定哪种模型在特定任务...……更多
AI诊断抑郁症,准确率高达97.53%的秘诀何在?
...结合语音和大脑活动数据后,这个模型在诊断抑郁症时的准确率高达97.53%,比其他方法都要好得多。“这是因为语音里有很多我们现在还无法从大脑里直接得到的信息。”Maskeliūnas解释道。参与这项发明的KTU博士生Musyyab Yousufi说...……更多
GPT-4批评GPT-4实现「自我提升」!OpenAI前超级对齐团队又一力作被公开
...的批评意见更长时,也更容易出现幻觉。这有点类似于「准确率」和「召回率」之间的权衡。FSBS能够激励CriticGPT在产生更长、更全面的批评时,减少「无中生有」或者「鸡蛋里挑骨头」的发生率。之后进行的消融实验也证明了FS...……更多
检索总结能力超博士后,首个大模型科研智能体PaperQA2开源了
...一组新的 101 个 LitQA2 问题。PaperQA2 在原始 147 个问题上的准确率与后一组 101 个问题的准确率没有显著差异,这表明在第一阶段的优化已经很好地推广到了新的 LitQA2 问题(下表 2)。 PaperQA2 性能分析研究者尝试改变 PaperQA2 的参...……更多
4轮暴训,Llama 7B击败GPT-4!Meta等让LLM「分饰三角」自评自进化
...是希望actor能生成更好的响应,但训练效率依赖于judge的准确率。因此,meta-judge作为训练judge的角色,可以同时提升模型作为actor和judge的性能。这三种角色组成的迭代训练模式如图1所示,在第t个步骤中,先收集模型M_t对提示x的...……更多
谷歌推出搜索增强事实评估器
...答中“满口跑火车”,甚至“造谣”。图源Pixabay防止AI大模型出现这种行为并非易事,且是一项技术性的挑战。不过据外媒Marktechpost报道,谷歌DeepMind和斯坦福大学似乎找到了某种变通办法。研究人员推出了一种基于大语言模型...……更多
...。经过测试,大模型能在一两秒内快速检索百万级数据,准确率高达95%。刘宏斌表示,CARES Copilot 1.0目前已在香港多家医院的不同科室进行了实地测试和优化,验证了其作为手术智能辅助工具的基础功能和关键技术。下一步,研...……更多
开启精准医疗的“钥匙”
...目已落地丽水,通过AI辅助当地医生提高多种癌症的筛查准确率和效率。AI技术在临床医学上的应用正在提速,这让生物医疗领域的未来有了更多想象空间,也让从前不可及的前沿医学成果快速实现转化,让普通百姓受益。“罗...……更多
谷歌版贾维斯即将问世,最强Gemini 2.0加持!AI自主操控电脑时代来临
...;模型也能够从解析后的屏幕中利用更多信息,动作预测准确率更高。因此,OmniParser结合了微调后的可交互图标检测模型、微调后的图标描述模型以及光学字符识别(OCR)模块的输出,可以生成用户界面的结构化表示,类似于...……更多
ChatGPT击败50名人类医生!疾病诊断准确率达90%
用ChatGPT诊断疾病,准确率已经超过了人类医生?!斯坦福大学等机构进行了一轮随机临床试验,结果人类医生单独做出诊断的准确率为74%。在ChatGPT的辅助之下,这一数字提升到了76%。有意思的是,如果完全让ChatGPT“自由发挥...……更多
长上下文能力只是吹牛?最强GPT-4o正确率仅55.8%,开源模型不如瞎蒙
...绩直接惨不忍睹,表现最好的Command R(simple)只有22.47%的准确率。——要知道,这考试瞎蒙也能得25分(四选一)。 当然,这也说明人家不是瞎蒙的,确实动脑子了。视觉上的长上下文另一篇研究来自UCSB,考察的是视觉大模型...……更多
更多关于科技的资讯:
京东工业携手浙江维派 共建包装机械设备行业数智供应链标杆
近日,京东工业与国内头部包装机械设备品牌浙江维派达成战略合作,浙江维派总经理周柯胜与京东工业相关负责人出席签约仪式并进行座谈交流
2025-01-17 20:28:00
• 秉持"以人为本"理念,江森自控凭借在人力资源战略和实践方面的出色表现,再次赢得杰出雇主调研机构的肯定1月16日,杰出雇主调研机构 (Top Employers Institute) 正式发布"中国杰出雇主2025"榜单
2025-01-17 20:36:00
全球知名专家学者齐聚深圳,国际给药趋势研讨会释放哪些讯息?
1月17日,由全球雾化科技龙头企业思摩尔旗下MOYAL岚至主办的“跨界视野下未来给药技术趋势研讨会”在深圳召开。本次会议深入探讨了未来给药的行业趋势与技术路径
2025-01-17 20:56:00
新突破!中国首套年产50万吨新一代瓶片装置投产
快科技1月17日消息,据报道,我国首套采用聚酯中黏工艺技术建设的50万吨/年瓶级切片装置在中国石化仪征化纤公司成功投产
2025-01-17 21:27:00
趵突泉锦鲤胖的跟猪一样 园区:再喂就噶了!
快科技1月17日消息,据媒体综合报道,近日,济南趵突泉的锦鲤要减肥冲上了热搜。据报道,在趵突泉景区海豹池,一个印有“锦鲤减肥中心”的指示牌被放置在了池内
2025-01-17 21:27:00
纯黑外观+铝合金背板!傲世ODYSSEY征途锐炫B570显卡图赏
快科技1月17日消息,Intel近期推出了其第二代锐炫独立显卡系列,首波亮相的型号为B580与B570。其中,B580已率先上市
2025-01-17 21:27:00
自主研制!东方风电120米海上风电叶片顺利完成测试
快科技1月17日消息,据“东方电气”官微发文,东方电气集团所属东方风电公司自主研发的120米海上风电叶片,凭借完全自主知识产权
2025-01-17 21:27:00
男子23.5万买捷豹新车却无法提车 4S店:合格证被押银行了
快科技1月17日消息,据报道,曹先生上个月在杭州运通和乔4s店买了一辆捷豹,车价23万5千元。曹先生介绍,4S店称预计1月10日交车
2025-01-17 21:27:00
颜值感受下!美国空姐发机舱内跳舞视频被开除引热议 才刚结束试用期
1月17日消息,近日,一段关于美国一名空姐因在机舱内跳舞而被开除的事件在网络上持续发酵。1月16日,这名空姐发布了一段众筹视频
2025-01-17 21:27:00
马斯克:加州莫斯兰丁发电站起火事故与特斯拉无关 Megapack运行良好
快科技1月17日消息,据报道,特斯拉CEO马斯克在社交平台发文称,美国加利福尼亚州莫斯兰丁发电站起火事故与特斯拉无关,其Megapack储能电池模块运行良好
2025-01-17 21:27:00
华为加大产能!Mate 70系列基本不加价卖了
快科技1月17日消息,上市已经有段时间的Mate 70系列,随着产能的增加,溢价率也在慢慢消失。现在,有数码博主曝光了华为Mate 70系列部分机型的渠道价格
2025-01-17 21:27:00
保护人体健康的防线!人体最大免疫器官竟是肠道
快科技1月17日消息,据了解,肠道是人体最大的免疫器官,它不仅仅是机体消化吸收的地方,而且时刻抵挡着大量的病菌的侵入。肠道黏膜面积超过400平方米
2025-01-17 21:27:00
“重庆特色伴手礼”点赞首日 这些品牌人气高
1月17日9时,重庆特色伴手礼品牌认定进入点赞第一天。100个候选当日哪些品牌人气高?快手、上游新闻分别发布首日“龙虎榜”——点赞排名前10品牌(截止时间为17日18时),一起来
2025-01-17 21:35:00
丰田子公司日野汽车同意就排放造假认罪:与美国达成117亿元和解协议
快科技1月17日消息,据报道,当地时间1月16日消息,丰田子公司日野汽车与美国政府,就发动机排放数据造假达成一项总额约16亿美元(约合人民币117亿元)的和解协议
2025-01-17 16:27:00
阿里巴巴内部调整:天猫精灵硬件团队与夸克融合 瞄准AI眼镜市场
快科技1月17日消息,天猫精灵硬件团队与夸克产品团队正在进行融合,这一举措预示着双方将共同探索包括AI眼镜在内的新兴硬件领域
2025-01-17 16:27:00