• 我的订阅
  • 头条热搜
关于LLM-as-a-judge范式,终于有综述讲明白了
...括:回复的帮助性,无害性,可靠性,生成 / 检索文档的相关性,推理过程中每一步的可行性,以及生成文本的综合质量。Methodology:如何评判 表 1:LLM-as-a-judge 训练方法(1)微调:最近许多工作开始探索如何使用微调技术来...……更多
推动大模型自我进化,北理工推出「流星雨计划」
...方法后 LLM 前后各维度的性能变化。在准确性、完整性、相关性、连贯性和可靠性方面,LLaMA3-8B-Instruct 和 Qwen2-7B-Instruct 取得了性能的提升(评估方法:通过 GPT-4 筛选进化前和进化后答案的 win rate)。未来工作该工作初步探索和...……更多
...CTL的高浸润与良好的治疗反应和延长的总生存率呈密切正相关性。据悉,该研究成果在线发表于知名学术期刊《Cancer Immunology Research》。(完) ……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
...是识别可见字符,而无需理解它们在图像叙事中的上下文相关性。相比之下,VCR 要求模型协同利用可用的部分像素级文本提示和视觉上下文来准确地重建被遮挡的内容。这不仅测试了模型处理嵌入文本和视觉元素的能力,还考...……更多
复旦微电董事会完成换届:多名复旦教授当选董事 三位元老级人物未留任|直击股东会
...集成电路与系统国家重点实验室从事集成电路设计与工艺相关性研究等工作,为复旦大学博士生导师及教授级高级工程师。2001年加入复旦微电,2023年9月起一直在复旦微电子公司担任董事。闫娜同样为复旦大学博导。复旦微电202...……更多
大模型“翻车”小学题?
...科生。实际上语言模型在这样的数据训练过程中学到的是相关性,使得AI在文字创作上达到人类平均水平,而数学推理更需要的是因果性,数学是高度抽象和逻辑驱动的,与语言模型处理的语言数据在本质上有所不同。这意味着...……更多
SEO 已死,LLMO 万岁
...将你的业务集成到搜索系统中,才能保证企业的可见性和相关性。上下文学习能以较低的成本向现有的 LLM 注入信息,只需要很少的训练示例就能运行原型。这对于非专业人士来说也容易上手,只需要自然语言接口即可。但是企...……更多
科研也完了,AI暴虐170位人类专家!Nature子刊:大模型精准预测研究结果,准确率高达81%
...样,所有大型语言模型都展现出准确性和置信度之间的正相关性。当大型语言模型对自己的决策有信心时,更有可能做出正确的选择。此外,研究人员还在个体层面上拟合了模型困惑度差异与正确性之间的逻辑回归,以及人类置...……更多
推理成本直降99%!百川智能「1+3」矩阵揭秘,两张4090玩转旗舰新模型
...,此时模型无需深层理解用户的全部行为,只需提供较高相关性的推荐即可。而在智能客服场景,银行、零售、物流等企业的在线客服系统往往有高并发的用户咨询,用户问题相对简单、重复性高,不涉及复杂情感理解和多轮对...……更多
Kimi爆火背后:访问量仅次于文心一言和阿里通义,国内外大模型都在卷上下文
...挑战。实际上,长文本能力已是国内外大模型追逐热点。复旦大学计算机科学技术学院教授张奇对搜狐科技表示,很多大模型仅停留在长度和简单的事实检索能力方面,在更加重要的阅读理解和推理能力方面还有待加强。上下文...……更多
牛津团队提出多年生DToU方案,能有效检查应用程序的使用请求
...程序)是否符合 DToU 的规定。义务识别和合规性检查存在相关性。但是更软性的规定,也就是数据使用者在被赋予了数据使用权之后,还需要额外做哪些事情来满足数据提供方的规定?一个典型例子就是“如果你使用了我们的数...……更多
迈向多语言医疗大模型:大规模预训练语料,开源模型与全面基准测试
...排序的量化分数。图 B 展示了自动指标和人类评估之间的相关性,其中 k 代表拟合直线的斜率,t 代表坎德尔相关系数。公开英文评测基准模型测评为了在英语基准测试上与现有的大型语言模型进行公平比较,研究团队还基于 MMe...……更多
再也不能用chatgpt写作业了,新算法给ai生成文本加水印
...成白名单的哈希函数,和其他不少重要的参数并没有什么相关性。这就让他人可以在下游水印检测器上做手脚,可以改变水印采样算法,重新部署水印,最终让原本生成的水印失效。就连OpenAICEOSamAltman也表示:创造完美检测AI抄...……更多
NeurIPS 2024 | 数学推理场景下,首个分布外检测研究成果来了
... Spearman 相关系数来计算 TV Score 和模型回答正确性之间的相关性。结果表明,TV Score 在该任务下仍然展现出了最优性能。 场景泛化:研究团队认为,TV Score 可以被推广到所有输出空间满足 “模式坍缩” 特性的场景,例如多项选...……更多
ChatGPT 火爆,程序员会不会被取代?答案都在这里!
...仰华、王文广、蒋涛、林咏华、于建岗、王千祥、王昊奋复旦大学教授肖仰华:大模型绝不仅仅是模型系统和算力,数据是非常重要的问题,我呼吁大家能够更多地关注大模型的数据治理。百度 AI 技术生态总经理马艳军:我们...……更多
零样本即可时空预测!港大、华南理工等发布时空大模型UrbanGPT | KDD 2024
...景中出现的复杂情况,本文设计的时空编码器在处理空间相关性时不依赖于特定的图结构。这是因为在零样本预测环境中,实体间的空间联系往往是未知的或难以预测的。这样的设计使得UrbanGPT能够在广泛的城市应用场景中保持...……更多
超级干货丨360AI搜索如何准确识别用户意图?
...化为用户的潜在意图,从而匹配上对应的广告,而且它的相关性更好。让搜索广告真正实现从购买“关键词”到购买“用户意图”的转变。比如用户想搜索旅游攻略,这背后可以转化成景点的搜索、交通的搜索、酒店的预定等多...……更多
...临床评估了母亲外周血中galectin-9水平与子痫前期发病的相关性,发现血清中galectin-9具有子痫前期早期预测的潜在价值。(完)【编辑:房家梁】 ……更多
我国学者发现乳腺癌化疗耐药“元凶”
...的耐药“元凶”被找到。为了解耐药“元凶”作用机制和相关性,以便为后续优化治疗策略找到方向,团队开展了相关试验。结果显示,当用相同剂量的多西他赛和阿霉素治疗时,与TSPAN8-CAFs相比,TSPAN8﹢CAFs存活率显著提高,并...……更多
谷歌DeepMind研究再登Nature封面,隐形水印让AI无所遁形
...种方式,采样算法把水印引入了next token中(即r(t)和x(t)的相关性),在检测水印的时候,就使用Scoring函数来衡量这种相关性。下面给出一个具体的例子:简单来说就是拿水印key和前几个token(这里是4个),过一个哈希函数,生...……更多
昆仑万维重磅发布天工AI高级搜索功能,做最懂金融投资、科研学术的AI搜索
...行的智能解答。在数据和信源的时效性、权威性、质量、相关性,以及内容索引丰富度等方向进行全方位升级,针对用户在复杂问题解决、金融投资、科研学术、文档分析等多领域的需求,带来专业优化和流畅体验。01在处理复...……更多
MOSS核心成员:我们低估了ChatGPT影响力
... 刘晓洁时下科技领域最热的概念莫过于ChatGPT。2月20日,复旦大学邱锡鹏团队推出中国版ChatGPT“MOSS”,这是国内第一个公布的对话式大型语言模型,热情的用户涌入一度导致其服务器被挤崩。21日晚,第一财经连麦学界、法律界...……更多
AI科研风暴来袭,中科院北大复旦大咖齐聚!海淀解锁千万算力补贴
【新智元导读】中科院北大复旦大佬齐聚的2024科学智能峰会,刚刚在位于北京海淀的北大百年纪念讲堂落下帷幕,现场演讲信息量爆棚。同期,海淀这片创新热土还有好消息传出:海淀区送算力补贴了,最高1000万!全世界大模...……更多
...词汇、句法结构、语义信息等,并捕捉它们之间的模式和概率分布,因此,它更倾向于基于统计规律生成回答,而非进行深入的逻辑推理或形成高级的认知能力。另外,它在生成文本时可能会受限于训练数据中存在的偏见和误导...……更多
疱疹病毒感染关键因子找到
...,干扰素诱导的跨膜蛋白1(IFITM1)与EB病毒感染有潜在负相关性。研究人员在上皮细胞中敲减IFITM1,上皮细胞在EB病毒中暴露3小时和72小时之后,EB病毒拷贝数和病毒感染阳性细胞比率均增加。研究人员证实,将外源可溶性IFITM1...……更多
4090笔记本0.37秒直出大片!英伟达联手MIT清华祭出Sana架构,性能秒杀FLUX
...。此外,他们还提出了一种基于clipscore的训练策略,根据概率动态选择与图像对应的多个描述中具有高clip分数的描述。 实验表明,这种方法改善了训练收敛和文本-图像对齐能力。此外,与广泛使用的Flow-Euler-Solver相比,团队提...……更多
字节跳动豆包大模型发布,火山引擎全栈AI服务助力企业智能化转型
...流式知识库索引更新,内嵌豆包向量化模型,提高搜索的相关性和准确性。除以上核心插件升级之外,火山方舟2.0也全面升级了系统承载能力、安全防护能力和算法服务能力。在系统承载力上,提供充沛的GPU算力资源,分钟级千...……更多
LeCun最新万字演讲:纯语言模型到不了人类水平,我们基本已放弃
...性。当然,这样还不够,因为变量之间可能仍然存在某种相关性。于是,我们采用了另一个技巧,即将SX的维度扩展到更高维的空间VX,然后在该空间中应用方差协方差正则化,这似乎足够了。 但这里有一个细节,我在这里最大...……更多
中文大模型最新评测出炉:腾讯混元国内第一!
...获得总分71.95的高分。评测标准涵盖了理解准确性、回应相关性和推理深度等维度,确保了评估的科学性和公正性。腾讯混元大模型在基础能力方面紧追海外顶尖模型,总成绩仅略低于GPT-4o,表现优于CLaude3.5-Sonnet和Gemini-1.5-Pro。...……更多
「衔远科技」,以ChatGPT助企业数智化创新
...队的成员分别来自北京大学、清华大学、中国科技大学、复旦大学、上海交通大学、哈尔滨工业大学、中国人民大学,及美国科罗拉多大学、密歇根州立大学,澳大利亚悉尼大学等国内外知名院校,拥有丰富的产业经验和深厚的...……更多
更多关于科技的资讯:
全国26家实验室参与!由雷沃支持的这场“田间论剑”举行
日前,2025年农业机械检测实验室间比对活动在山东潍坊举行。该活动由中国农业机械化协会主办、农机鉴定检测分会承办、潍柴雷沃智慧农业协助开展
2025-09-26 07:05:00
人们依托脑力开展思维活动,而人工智能则依赖算力进行“思考”。“十四五”期间,中国在算力建设上的投入力度相当大,发展成效显著
2025-09-26 07:31:00
王灿:以笔为犁 深耕“城事”
王灿。 臧翔宇 摄□胡欣玥芮天舒祁绩外出采访结束后,王灿轻轻推开南京报业传媒集团融媒中心时政新闻部的门。工位上屏幕亮起
2025-09-26 07:41:00
560余家企业携4.8万余个岗位来东大揽才“AI+”岗位热度不减,实战经验是核心指标□南京日报/紫金山新闻记者何洁 实习生黄佳琪杨久久9月25日
2025-09-26 07:41:00
厦门网讯(厦门日报记者 沈彦彦 应洁)明日,厦门岛外首家永辉“胖东来模式”调改店将在杏林万科里正式开业。作为厦门第二家
2025-09-25 08:53:00
9月24日,“青春华章・向西而歌”网络大思政课活动上,西安交通大学微电子学院集成电路工程专业博士研究生魏上杰介绍,集成电路是“国之重器”的“心脏”
2025-09-25 09:44:00
杜建英一持股公司被吊销,名下关联60家企业其中8家已注销或吊销
企查查APP显示,近日,杜建英持股的杭州芸台文化创意有限公司被吊销,原因是公司成立后无正当理由超过6个月未开业,或者开业后自行停业连续6个月以上
2025-09-25 11:20:00
雷军“五十来岁正是闯的年纪”,出生于1969年,和余承东、陈明永同龄
9月25日,雷军发文:这5年,小米一路摸爬滚打、跌宕起伏,依然启动了造车、芯片和高端化……没什么好犹豫的,五十来岁,正是闯的年纪
2025-09-25 11:20:00
贵州国企“智”变攻坚推动数实融合
赤水河畔,国内首台高温复合型仿生压曲机稳定运转,物联网实时优化发酵参数……这场酿酒的“数字革命”,也是贵州习酒公司以全链数智革新推动产业跃迁的生动缩影
2025-09-25 11:57:00
近8成职场人每周都会用AI工具 “人机互信”仍在磨合期
在人工智能技术日臻成熟的2025年,AI已是深度融入职场生态的“数字同事”,在AI辅助下的2025年职场迎来了哪些变化
2025-09-25 13:30:00
9月23日下午,2025北京文化论坛“破界共生:科技激发文化原创力”平行论坛在京举办。本场论坛由中国文联、中国作协指导
2025-09-25 13:38:00
国庆前夕,房山区物美超市“胖改店”、居然之家房山店、瑞莱广场分别于9月26日、27日、28日开业,进一步丰富了房山区消费场景
2025-09-25 13:38:00
OPPO杭州研发总部项目易主,山子高科接手公司95%股权
企查查APP显示,近日,负责OPPO项目的杭州逗酷软件科技有限公司发生工商变更,新增山子高科旗下浙江山子超影科技有限公司为股东
2025-09-25 16:25:00
雷军提前透露年度演讲细节,晒照新T恤“正是闯的年纪”被粉丝要链接
9月25日,雷军年度演讲将在今晚7点举行,这次不光是演讲,还是小米17系列等各种新品的发布会。关于今晚的演讲和发布会,25日下午
2025-09-25 17:34:00
齐鲁晚报·齐鲁壹点 记者 张召旭近日,为紧密配合《山东省食品经营许可审查细则》的落地施行,山东省全新改造升级的食品经营许可系统正式上线运行
2025-09-25 17:34:00