北大杨仝团队发布FairyR1模型:5%参数量数学和代码能力超越满血DeepSeek
北京大学杨仝教授团队近期发布了其在高效大型语言模型研究方向的一项新成果——FairyR1-32B模型。该模型基于DeepSeek-R1-Distill-Qwen-32B基座,通过结合微调与模型合并技术构建。研究探索了在参数量大幅减少的情况下,模型在特定任务上实现与更大模型相当甚至更优性能的可能性。该研究得到了国家自然科学基金委项目(624B2005, 62372009)的资助。FairyR1-32B模型已在huggingface开源:https://huggingface.co/PKU-DS-LAB/FairyR1-32B。
FairyR1-32B模型是在团队前期TinyR1工作基础上进行的进一步探索,沿用了“分合蒸馏”的研究思路,提出了多种改进方法,包括自我合并、多教师交叉蒸馏、轻蒸馏等方法,并在数据处理进行了优化,模型精度有了显著提升。
本次工作重点改进了蒸馏数据的构建流程,对来源于AI-MO/NuminaMath-1.5(数学)和open-thoughts/OpenThoughts-114k(代码)等数据集的原始数据,通过多个“教师模型”生成答案,随后对问答数据进行精心筛选、结构调整与思维链优化,并进行多阶段筛选。筛选过程包括基于答案的正确性验证(针对数学数据),以及基于长度的筛选(数学数据保留2k-8k tokens范围,代码数据保留4k-8k tokens范围),最终构建了更具针对性的约6.6k条数学数据和约3.8k条代码数据用于训练。
在模型结构方面,研究团队尝试训练两个领域(数学和代码)的专业模型进行合并,旨在进一步优化流程和资源消耗。这两个专业模型在一致的训练参数下(例如相同的学习率和批次大小)独立训练约5个周期后,利用AcreeFusion工具进行了合并。在多个公开基准测试中,FairyR1展现出了在低参数量下的竞争力表现。以下为FairyR1与DeepSeek-R1-671B及DeepSeek-R1-Distill-Qwen-32B在部分基准上的得分对比:
从测试结果可以看出,FairyR1-32B在AIME 2025和LiveCodeBench基准上得分略高于DeepSeek-R1-671B,在AIME 2024上表现接近。在GPQA-Diamond科学基准上,FairyR1的得分低于DeepSeek-R1-671B。这些结果表明,FairyR1在采用DeepSeek-R1-Distill-Qwen-32B基座并经过特定技术处理后,能够在约5%参数量的情况下,在数理和编程等领域实现与大型模型相当或略优的性能水平,但在科学等其他领域可能存在差距。这项工作探索了通过优化的数据处理和模型融合技术,在保证特定任务性能的前提下,大幅降低模型规模和潜在推理成本的可能性。
北京大学杨仝教授团队表示:“FairyR1-32B模型是我们探索高效大型语言模型技术路线的阶段性成果。通过对蒸馏和合并方法的改进,我们初步验证了在有限资源下实现高性能模型的可行性。”
团队成员:李旺、周俊廷、刘文睿、姚一伦、王融乐、杨仝
- 2025珠江国际贸易论坛:全球经贸新格局,金融如何助力外贸“稳存量、拓增量”?
- 如何申请ISO认证--ISO认证流程与费用
- EIG旗下MidOcean Energy收购Peru LNG 20%的股份
- 洲明科技闪耀2025央视春晚:科技与艺术共铸非凡盛典
- W. R. Berkley Corporation确认Mitsui Sumitomo Insurance Co.计划通过公开市场或与第三方的私下交易购买公司15%的股份
- 2025 第四届南昌大健康博览会:中部健康产业新引擎
- AMCAP集团专注科技金融赋能与研究
- “华中建陶第一展” 2024华中建陶精品荟盛大开幕
- 海南钧达新能源科技股份有限公司(股份代号: 02865)全球发售
- 统筹协议是什么意思?
- 斯维垦诚挚邀请您共襄第十五届中国奶业大会 推料机器人新品即将亮相
- 《清宫辞Ⅱ》开机:陈欣予旗装惊艳回归 重新演绎宫闱传奇
- 卤山川携手万店掌发布品牌发展白皮书,解码卤味炸串赛道成长新思路
- 雷鸟创新X2:不仅仅是AR眼镜,更是通用计算平台
- Bedford Metals Reaches Definitive Agreement for Ubiquity Lake Uranium Project in Athabasca, Canada
- 广州美博会盛大启幕!“稳”“进”创新高!
- 人机共融 智启健康 上海交通大学智慧健康与人因设计论坛成功举办
- Prime Biome Reviews (2025): Investigative Report Examines Whether This Gut-Skin Formula Is Scientifi
- 联合国大会期间,比利时王后 Mathilde、萨塞克斯公爵哈利王子 (Prince Harry, Duke of Sussex)、Forest Whitaker、联合国机构负责人和其他政要齐聚纽约,与
- 马爹利金燕赏“星”见证2025成都米其林指南全新发布
推荐
-
奥运冠军刘翔更新社交账号晒出近照 时隔473天更新动态! 2月20日凌晨2点,奥运冠军刘翔更新社交账号晒 资讯
-
中国减排方案比西方更有优势 如今,人为造成的全球变暖是每个人都关注的问 资讯
-
透过数据看城乡居民医保“含金量” 缴费标准是否合理? 记者从国家医保局了解到,近期,全国大部分地区 资讯
-
国足13次出战亚洲杯首次小组赛0进球 北京时间1月23日消息,2023亚洲杯小组 资讯
-
看新东方创始人俞敏洪如何回应董宇辉新号分流的? (来源:中国证券报) 东方甄选净利润大幅下滑 资讯
-
新增供热能力3200万平方米 新疆最大热电联产项目开工 昨天(26日),新疆最大的热电联产项目—&md 资讯
-
产业数字化 为何需要一朵实体云? 改革开放前,国内供应链主要依靠指标拉动,其逻 资讯
-
周星驰新片《少林女足》在台湾省举办海选,吸引了不少素人和足球爱好者前来参加 周星驰新片《少林女足》在台湾省举办海选,吸 资讯
-
男子“机闹”后航班取消,同机旅客准备集体起诉 1月4日,一男子大闹飞机致航班取消的新闻登上 资讯
-
私域反哺公域一周带火一家店! 三四线城市奶茶品牌茶尖尖两年时间做到GMV 资讯