openrlhf-training
High-performance RLHF framework with Ray+vLLM acceleration. Use for PPO, GRPO, RLOO, DPO training of large models (7B-70B+). Built on Ray, vLLM, ZeRO-3. 2× faster than DeepSpeedChat with distributed architecture and GPU resource sharing.
core - 许可证明确许可证 MIT需人工复核11746 Stars更新 2026-06-16
- A许可证宽松许可证,通常可商用
- C维护半年内更新过
- C安全命中需复核规则
- 目录
06-post-training/openrlhf- 质量分
- 0.84
- 安全规则命中
- 3 项,使用前请阅读 SKILL.md
打开 Skill 目录 查看 SKILL.md 原文 在目录中搜索
安装到你的 Agent
命令默认装到 ~/.claude/skills/(Claude Code 全局目录)。Codex / Cursor 等其他 Agent 请换成它们各自的 skills 目录;只对当前项目生效时改成 .claude/skills/。运行前请先看一眼下面的安全体检。
只装 SKILL.md(最快)
mkdir -p ~/.claude/skills/openrlhf-training && curl -fsSL https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/773a52944ba4747a18bd4ae9ade53fff041adcbc/06-post-training/openrlhf/SKILL.md -o ~/.claude/skills/openrlhf-training/SKILL.md连同附件一起装(推荐)
git clone --depth 1 --filter=blob:none --sparse https://github.com/Orchestra-Research/AI-Research-SKILLs /tmp/openrlhf-training-src && git -C /tmp/openrlhf-training-src sparse-checkout set 06-post-training/openrlhf && cp -r /tmp/openrlhf-training-src/06-post-training/openrlhf ~/.claude/skills/openrlhf-training在本页阅读 SKILL.md
原文实时取自 GitHub(按提交哈希锁定的版本)。命中安全规则的行会被标红,并附中文解释。
安全体检报告
需人工复核 命中 3 条安全规则,许可证判定:宽松许可证。
- 删除文件会删除或覆盖本地文件。
file_deletion - 涉及密钥 / 凭据SKILL.md 中出现 API Key、token 等字样,安装后可能要求你提供凭据。
mentions_secrets - 提权包含 sudo / 管理员权限相关操作。
privilege_escalation
许可证:MIT · 通常可商用,保留版权声明即可。
评估基于对公开 SKILL.md 的自动扫描,不替代人工审阅,也不构成法律建议。
本站只保存元数据与外链,不转存 SKILL.md 正文。引用或商用前请自行确认上游许可证与权限边界。数据快照来自公开仓库,可能滞后于上游。