
Polar 框架开源:无需修改底层代码,智能体跑分提升显著
英伟达发布 Polar 框架,通过无感拦截和轨迹重建,显著提升 Codex 等智能体的跑分,同时提高训练效率。
Polar 框架介绍
英伟达最新开源的 AI 框架 Polar,能够在不修改底层代码的情况下,大幅提升智能体的跑分。该框架通过在模型 API 边界进行优化,使得 Codex、Claude Code、Qwen Code 等智能体框架能够无缝接入 GRPO 强化学习训练。
解决强化学习痛点
传统的强化学习基础设施要求将复杂逻辑强行改写成环境接口,这增加了接入成本并丢失了关键训练信号。Polar 通过不修改智能体框架的方式,解决了这一问题。
核心机制
Polar 在执行框架和推理服务器之间放置了一个模型智能体,它兼容多种 API 请求,并在转发请求时记录相关信息,随后重建为训练器可消费的轨迹。

系统结构
- Rollout Server:负责任务提交、会话调度等。
- Gateway Node:负责会话执行的全生命周期。
Polar 通过将初始化、运行中和后处理拆分到独立工作池,并设置 READY 缓冲区,有效减少了长尾任务对 GPU 训练的阻塞。
效果显著
在软件工程任务测试中,Polar 配合 GRPO 训练后,Codex 的跑分提升了 594%,训练效率提高了 5.4 倍。