分享

TinyZero:低成本复现 DeepSeeK

 老庄走狗 2025-01-30
TinyZero 是一个基于 veRL 的强化学习模型,旨在复现 DeepSeeK-R1 Zero 在倒计时和乘法任务中的表现。令人惊讶的是,该项目仅需 30 美元的运行成本(使用 2xH200,每小时 6.4 美元,不到 5 小时),就能实现与 DeepSeeK-R1 Zero 相同的顿悟效果。通过强化学习(RL),3B 基础语言模型(LM)能够自主开发自我验证和搜索能力。用户可以通过简单的安装步骤和训练过程,体验到 TinyZero 的强大功能和创新性。

    本站是提供个人知识管理的网络存储空间,所有内容均由用户发布,不代表本站观点。请注意甄别内容中的联系方式、诱导购买等信息,谨防诈骗。如发现有害或侵权内容,请点击一键举报。
    转藏 分享 献花(0

    0条评论

    发表

    请遵守用户 评论公约

    类似文章 更多