RWKV-7 1.5B 基底模型发布,我们必将能在手机高效跑 1T 参数模型

除夕快乐!在除旧迎新之际,我们也正式发布 RWKV-7-World-1.5B-v3 基底模型!(下文简称为 RWKV-7-1.5B 模型)

RWKV-7-1.5B 模型基于 RWKV World v3 数据集(共 3.1T 数据)训练而来。在英文和多语言评测中,RWKV-7-1.5B 模型的评分对比其他同参数模型处于绝对领先地位。

英文和多语言测评

RWKV-7-1.5B 模型的英文和多语言能力显著超越所有同尺寸模型,包括历史版本 RWKV-6,以及 Qwen2.5、SmolLm 等其他开源模型。

MMLU 测评

选择题形式的 MMLU 测试上,RWKV-7-1.5B 模型得分为 44.84%。作为对比,上一版本的 RWKV-6-1.5B-V2.1 模型 MMLU 评分是 26.34%。

RWKV-7-1.5B 基底模型的性能提升完全通过常规训练实现,未针对任何评测进行“优化”,也没有采取退火或 post-training 等优化策略。

模型下载

RWKV-7-World-1.5B 现已上传到 Hugging Face,可以从以下仓库下载:

在线 Demo

可在 Hugging Face Demo 在线体验 RWKV-7-1.5B 模型:

RWKV-7-1.5B 生成案例

以下是 RWKV-7-World-1.5B 的生成案例(使用 Hugging Face Demo 运行):


RWKV-7-1.5B 模型的强大能力,得益于 RWKV-7 架构的精妙改进。在应用了“动态 State 演化机制”后,RWKV-7 拥有强大的 in-context-learning(上下文学习)能力,在推理过程中更好地学习上下文的关系,生成的内容生更精简、更合理。

RWKV-7 的架构思路和细节请查看此文章:RWKV-7:极先进的大模型架构,长文本能力极强

RWKV-7-World-2.9B 预计将于二月初发布。请关注我们的公众号“RWKV元始智能”,第一时间获取 RWKV 动态!

加入 RWKV 社区

RWKV 是一种创新的深度学习网络架构,它结合了 Transformer 与 RNN 的优点,同时实现高度并行化训练与高效推理。

欢迎大家加入 RWKV 社区!您可从 RWKV 官网了解 RWKV 模型,也可加入我们的官方论坛、QQ 频道和群聊,一起探讨 RWKV 模型。

优秀的个人博客,低调大师

微信关注我们

原文链接:https://www.oschina.net/news/332178

转载内容版权归作者及来源网站所有!

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

相关文章

发表评论

资源下载

更多资源
优质分享Android(本站安卓app)

优质分享Android(本站安卓app)

近一个月的开发和优化,本站点的第一个app全新上线。该app采用极致压缩,本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

Apache Tomcat7、8、9(Java Web服务器)

Apache Tomcat7、8、9(Java Web服务器)

Tomcat是Apache 软件基金会(Apache Software Foundation)的Jakarta 项目中的一个核心项目,由Apache、Sun 和其他一些公司及个人共同开发而成。因为Tomcat 技术先进、性能稳定,而且免费,因而深受Java 爱好者的喜爱并得到了部分软件开发商的认可,成为目前比较流行的Web 应用服务器。

Eclipse(集成开发环境)

Eclipse(集成开发环境)

Eclipse 是一个开放源代码的、基于Java的可扩展开发平台。就其本身而言,它只是一个框架和一组服务,用于通过插件组件构建开发环境。幸运的是,Eclipse 附带了一个标准的插件集,包括Java开发工具(Java Development Kit,JDK)。

Sublime Text 一个代码编辑器

Sublime Text 一个代码编辑器

Sublime Text具有漂亮的用户界面和强大的功能,例如代码缩略图,Python的插件,代码段等。还可自定义键绑定,菜单和工具栏。Sublime Text 的主要功能包括:拼写检查,书签,完整的 Python API , Goto 功能,即时项目切换,多选择,多窗口等等。Sublime Text 是一个跨平台的编辑器,同时支持Windows、Linux、Mac OS X等操作系统。