> 自媒体 > (AI)人工智能 > DeepSeek GitHub星数超越OpenAI!大佬揭秘仅用450美元训推理模型
DeepSeek GitHub星数超越OpenAI!大佬揭秘仅用450美元训推理模型
来源:新智元
2025-02-08 09:02:31
214
管理

编辑:编辑部

【新智元导读】刚刚,DeepSeek的GitHub星数,超越了OpenAI!V3的Star数,如今已经碾压OpenAI最热门的项目。机器学习大神的一篇硬核博文,直接帮我们揭秘了如何仅用450美元,训出一个推理模型。

就在刚刚,历史性的一刻出现了。

DeepSeek项目在GitHub平台上的Star数,已经超越了OpenAI。

热度最高的DeepSeek-V3,Star数如今已达7.7万。

Sebastian表示,很多人都来询问自己对DeepSeek-R1的看法。

在他看来,这是一项了不起的成就。

作为一名研究工程师,他非常欣赏那份详细的研究报告,它让自己对方法论有了更深入的了解。

最令人着迷的收获之一,就是推理如何从纯强化学习行为中产生。

甚至,DeepSeek是在MIT许可下开源模型的,比Meta的Llama模型限制更少,令人印象深刻。

在本文中,Sebastian介绍了构建推理模型的四种方法,来提升LLM的推理能力。

为什么开发蒸馏模型?可能有两个关键原因:

1 较小的模型更高效。小模型运行成本更低,还能在配置较低的硬件上运行。对研究人员来说很有吸引力。

2 纯SFT的案例研究。这些模型展示了在没有RL的情况下,单纯靠SFT能把模型优化到什么程度。

接下来一个有趣的方向是把RL SFT和推理时扩展结合起来,OpenAI的o1很有可能是这样做的,只不过它可能基于一个比DeepSeek-R1更弱的基础模型。

R1和o1相比如何?

Sebastian认为,DeepSeek-R1和OpenAI o1大致在同一水平。

不过引人注目的一点是,DeepSeek-R1在推理时间上更高效。

这就揭示了二者的区别:DeepSeek可能在训练过程中投入了更多,而OpenAI更依赖于o1的推理时扩展。

而很难直接比较两个模型的难点,就在于OpenAI并没有披露太多关于o1的信息。

现在关于o1,还有很多未解之谜。

比如,o1也是一个MoE吗?它究竟有多大?

或许,o1只是GPT-4o的一个略微改进版本,加上最小量的强化学习和微调,仅在推理时进行大规模scaling?

不了解这些细节,是很难直接比较的。

预算只有几十万美元,能开发推理模型吗

不过,想开发一个DeepSeek-R1这样的推理模型,哪怕是基于开放权重的基础模型,也可能需要几十万美元甚至更多资金。

这对预算有限的研究人员或工程师来说,实在是望而却步。

好消息是:蒸馏能开辟新路径!

模型蒸馏提供了一个更具成本效益的替代方案。

DeepSeek团队的R1蒸馏模型证明了这一点,尽管这些模型比DeepSeek-R1小得多,推理表现却强得惊人。

不过,这种方法也不是完全没有成本。他们的蒸馏过程用了80万条SFT样本,这需要大量的计算资源。

有趣的是,就在DeepSeek-R1发布的前几天,关于Sky-T1的文章中,一个团队用1.7万条SFT样本,就训练出了一个32B参数的开放权重模型。

总成本仅有450美元,甚至比大多数人AI会议的注册费还低。

Sky-T1的表现和o1大致相当,考虑到它的训练成本,着实令人惊叹。

项目链接:https://novasky-ai.github.io/posts/sky-t1/

预算有限的纯强化学习:TinyZero

TinyZero是3B参数的模型,它借鉴了DeepSeek-R1-Zero的方法,其训练成本不到30美元。

令人意外的是,尽管只有3B参数,TinyZero仍展现出一些突现的自我验证能力,这证明了小模型通过纯RL也能产生推理能力。

这两个项目表明,即使预算有限,也可以进行有趣的推理模型研究。

两者都借鉴了DeepSeek-R1的方法,一种聚焦于纯RL(TinyZero),另一种聚焦于纯SFT(Sky-T1)。

超越传统SFT:旅程学习

旅程学习被视作捷径学习的替代方案。捷径学习是传统的指令微调方法,模型仅通过正确的解题路径来训练。

旅程学习不仅包括正确的解题路径,还包括错误的解题路径,让模型从错误中学习。

这种方法和TinyZero在纯RL训练中展现的自我验证能力有相通之处,不过它完全依靠SFT来优化模型。让模型接触错误推理路径及修正过程。

旅程学习或许有助于加强自我纠错能力,提升推理模型的可靠性。

论文链接:https://arxiv.org/abs/2410.18982

这一方向对于未来的研究极具吸引力,特别是在低预算的推理模型开发场景中,RL方法可能由于计算成本过高而难以落地。

当前在推理模型领域正有诸多有趣的研究,Sebastian充满期待地表示:相信在未来几个月,还会看到更多令人兴奋的成果!

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
法拉利电动SUV在国内上路了?原来是民间大神的“阿维法”..
什么!法拉利首款纯电SUV来了?而且还在国内各个城市里无任何伪装曝光上..
新车 | 售价498.8万元起,法拉利Purosangue实拍,配6.5升V12发动机..
文:懂车帝原创 高帅鹏[懂车帝原创 产品] 日前,法拉利Purosangue实车到..
新车 | 售价49.9-57.8万欧元,搭载V12动力,法拉利812特别版发布..
文:懂车帝原创 史景旭/潘梓春[懂车帝原创 产品] 5月5日,法拉利812特别..
目前最便宜的法拉利,试驾法拉利Roma,它真的是\u0026#34;弱鸡\u0026#34;吗..
文:孙少爷说到法拉利,我相信大家的脑海里肯定会最先想到的就是他们的F1..
血脉传承,新王当立!法拉利全新旗舰公路超跑F80
位于三翼面前翼下方有主动式反向襟翼设计,它的开闭状态来控制车身前部的..
比高铁开的还快?上赛场试驾法拉利全系车型
好吧,我承认,当领导在微信上问“有个法拉利的试驾,你去不去?”的时候..
新车 | 海外售价约273万元起,法拉利SUV实车亮相,国内或10月上市..
文:懂车帝原创 高帅鹏[懂车帝原创 产品] 在9月14日官图发布后,法拉利全..
只要88万就能买一辆11款法拉利458,真有这种好事?
哈喽,大家好~检车家老司机又和大家见面了!我是体重180,身高180, 穿着..
试驾玛莎拉蒂Levante:搭3.8T V8法拉利引擎,超帅、超拉风..
【有车以后 有车试驾】作为意大利的超豪华品牌,有着跑车血统的玛莎拉蒂..
关于作者
舞月(普通会员)
文章
873
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40398 企业收录2981 印章生成236772 电子证书1047 电子名片60 自媒体48699

@2022 All Rights Reserved 浙ICP备19035174号-7
0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索