开源强化学习框架 AReaL v0.5.0 发布，新增解耦式 Agentic RL-低调大师

开源强化学习框架 AReaL v0.5.0 发布，新增解耦式 Agentic RL

2025-12-16 51

AReaL 是一个面向算法设计，以开发效率和灵活性为核心的强化学习框架，由蚂蚁百灵大模型团队开源。它通过极简的 API 和可扩展的插件机制降低用户的学习曲线和使用心智负担，让开发者聚焦于算法本身而非系统细节，具备大规模扩展、无侵入 Agentic RL、故障感知与自恢复等能力。

该项目近日发布新版本 v0.5.0，带来了解耦式 Agentic RL，以及 Single Controller 架构两个核心特性。

解耦式 Agentic RL

AReaL 通过 OpenAI API 代理，提供了一套解耦化的智能体训练服务解决方案，便于环境提供者、算法开发者和系统开发者形成复杂工程中的零障碍流水线，极大提升了开发效率与系统可维护性。

AReaL Agentic RL 的架构设计建立在两个核心原则之上：

1. Agent 完全独立运行（Agent Autonomy）

在 AReaL 框架中，Agent 本身不依赖任何 RL 框架的组件，也不感知自身正在被用于训练。它只是一个标准的、基于大语言模型（LLM）的决策系统，按照既定的编排逻辑接收输入、调用工具、生成动作并输出结果。这种设计确保了 Agent 的纯净性与可移植性——同一个 Agent 实现既可以用于在线推理，也可以无缝接入离线训练，真正做到"一套代码，两处复用"。

2. RL 训练作为外部观察者（RL as Observer）

AReaL 不主动干预 Agent 的执行流程，而是通过"代理请求"的方式，监听并记录 Agent 与环境交互的完整轨迹（Trajectory）。这些轨迹包括：用户输入、Agent 的思维链（Thought）、调用的动作（Action）、环境反馈（Observation）以及最终的奖励信号（Reward）。通过这种方式，AReaL 将复杂的 Agent 执行过程转化为标准的 RL 训练数据，从而可以使用任意成熟的 RL 算法进行策略优化。

Single Controller 架构

消除了 SPMD (Single Program, Multiple Data) 模式的长尾和数据不均匀问题，这种分层设计既能提升推理扩展性、增强系统层面精细化控制，又能保留算法编排的灵活易用性，降低算法开发者代码迁移的成本。

Single Controller 架构如下：

下载地址：https://github.com/inclusionAI/AReaL/releases/tag/v0.5.0

微信关注我们

原文链接：https://www.oschina.net/news/390162

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

SamWaf v1.3.18 已经发布，轻量级网站应用防火墙

SamWaf v1.3.18 已经发布，轻量级网站应用防火墙。此版本更新内容包括：新增：CC防御新增启动规则条件感谢(@blue991989) 新增：一键修改增加还原文件感谢(@SONGjiemo) 新增：查询分析器新增：WAF管理端添加HTTPS证书配置，使用HTTPS访问SamWaf。新增：风险和访问日志数据列表上一键将IP添加到黑名单新增：隧道日志中访客IP端口服务端口对应显示感谢（一只喵鱼）新增：主库与日志库切换至gormigrate管理新增：检测指定时间范围错误数量进行封禁IP，感谢(@SONGjiemo) 新增：IP黑名单导出功能, 感谢（@tuokang）新增：消息通知到飞书钉钉可订阅不同类型消息新增：是否检测beta版本的更新控制，感谢（@netcns）新增：命令行支持 execsql执行命令新增：支持http3的支持,感谢（@qiulaidongfeng）新增：丰富自定义响应代码界面功能新增：系统防火墙IP管理功能新增：主动删除风险标签感谢(@Sky-Sparkle) 新增：新增日志相关配置面板新增：规则内检测是否是搜索爬虫Bo...

2025-12-16

31

v1.1.0 更新内容： 1、新增 Excel 导入、导入核心类库； 2、新增 OSS 云存储核心类库； 3、修复近期用户反馈的 BUG；项目介绍基于 SpringBoot3、SpringSecurity、MybatisPlus、Vue3、TypeScript、Vite、ArcoDesign、MySQL 等技术栈实现的单体前后端分离后台管理系统；后端基于 Java 语言采用 SpringBoot3、SpringSecurity、MybatisPlus、MySQL 等主流技术栈，前端基于 Vue3、TypeScript、Vite 等技术栈实现，采用 ArcoDesign 前端 UI 框架，基于目前 Vue 前后端分离主流设计思想，为了实现精细化分工，模块化、组件化开发模式，目前采用完全前后端分离架构实现，前端应用通过 API 调用后端服务的方式实现数据交互；整套系统拥有完善的 RBAC 权限架构体系，权限颗粒度精细至按钮级别，支持多主题切换模式，多端兼容手机客户端、PAD 平板、PC 电脑等终端设备，提升了用户使用体验；同时为了简化开发，本身集成了基础模块，如用户模块、角色模块、菜单...

2025-12-17

28

资源下载

更多资源

优质分享App

近一个月的开发和优化，本站点的第一个app全新上线。该app采用极致压缩，本体才4.36MB。系统里面做了大量数据访问、缓存优化。方便用户在手机上查看文章。后续会推出HarmonyOS的适配版本。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。