【权威认证】DeepSeek超150万对手,成最受欢迎开源大模型
来源:迅捷云开发 时间:2025-02-24在今天凌晨3点,全球知名的开源平台huggingface联合创始人兼首席执行官Clement Delangue公布了最新数据:
在huggingface平台的150万模型中,中国开源大模型DeepSeek-R1脱颖而出,成为最受欢迎的开源大模型,点赞量突破1万。

此前,Clement还专门发文祝贺DeepSeek-R1下载量突破1000万次,这一成绩也让它成为huggingface平台有史以来热度最高的模型。
从Clement这接连的称赞就能看出,他是真的对DeepSeek-R1青睐有加,DeepSeek-R1的爆火也为平台带来了不少流量红利。

值得关注的是,DeepSeek-R1仅仅用了几周时间,就超越了诸多实力强劲的开源模型。比如类ChatGPT开源鼻祖Meta发布的Llama系列、国内开源大模型的佼佼者Qwen系列、微软开源的Phi系列,以及谷歌开源的Gemma系列。

甚至在开源文生图模型领域,大黑马FLUX.1和行业领导者Stable-Diffusion系列也都败下阵来。DeepSeek-R1这个“第一名”可谓是实至名归,是在众多开源高手的竞争中脱颖而出的。
有网友评价,DeepSeek-R1的开源极大地改变了AI领域的格局。

本周,Deepseek宣布将推出一系列新功能,这无疑会给AI领域带来更多惊喜。


Deepseek团队为开源事业做出了巨大贡献,他们改变了行业规则,让那些闭源模型都感受到了前所未有的压力。就连Perplexity、Azure、AWS等云平台,在选择模型时,也更倾向于Deepseek,而非他们自己投资的Sonar、OpenAI或Anthropic的模型。

下面来详细介绍一下DeepSeek-R1 : 在开发R1之前,DeepSeek先开发了纯强化学习版本R1- Zero。这个版本采用GRPO算法,不依赖传统的监督微调,训练出的模型性能不错,但存在可读性差、语言混合等问题。
基于R1- Zero的不足,团队又训练了R1模型,其训练过程包含4个阶段:
冷启动训练阶段:与R1-Zero不同,为了避免强化学习训练初期从基础模型开始的不稳定情况,R1团队构建并收集了少量长思维链数据,对DeepSeek-V3-Base模型进行微调,将其作为初始的强化学习参与者。在数据收集过程中,研究团队尝试了多种方法,比如用带有长思维链的少样本提示作示例、直接促使模型生成带反思和验证的详细答案、收集R1-Zero以可读格式输出的结果并通过人工标注后处理优化等,最终收集了数千条冷启动数据用于模型微调。
推理导向的强化学习阶段:这个阶段主要致力于提升模型在编码、数学、科学和逻辑推理等推理密集型任务中的能力,这些任务通常有明确的问题和解决方案。在训练中,团队发现思维链存在语言混合问题,特别是当强化学习提示涉及多种语言时。为解决这一问题,引入了语言一致性奖励,通过计算思维链中目标语言单词的比例来衡量。虽然消融实验显示这种调整会使模型性能稍有下降,但却符合人类偏好,提高了可读性。最后,将推理任务的准确性和语言一致性奖励直接相加得到最终奖励,并对微调后的模型进行强化学习训练,直到推理任务收敛。

拒绝采样和监督微调阶段:当推理导向的强化学习收敛后,利用得到的检查点收集监督微调数据,用于后续轮次的训练。与初始冷启动数据主要关注推理不同,该阶段的数据融合了其他领域的数据,以提升模型在写作、角色扮演和其他通用任务中的能力。在推理数据方面,精心策划推理提示,并通过对上述强化学习训练的检查点进行拒绝采样生成推理轨迹。
全场景强化学习阶段:为了让R1模型更好地符合人类偏好,实施了二次强化学习阶段。此阶段主要提高模型的有用性和无害性,同时进一步优化其推理能力。通过结合奖励信号和多样化的提示分布来训练模型。
对于推理数据,遵循R1-Zero中使用的方法,利用基于规则的奖励在数学、代码和逻辑推理领域引导学习过程;对于通用数据,则采用奖励模型来捕捉复杂和微妙场景中的人类偏好。
基于DeepSeek-V3的流程,采用类似的偏好对和训练提示分布。在评估有用性时,仅关注最终总结,确保评估重点在于响应对用户的实用性和相关性,同时尽量减少对底层推理过程的干扰;在评估无害性时,评估模型的整个响应,包括推理过程和总结,以识别和减轻生成过程中可能出现的任何潜在风险、偏差或有害内容 。


