POST-TRAINING / RL / AI INFRA
TRAIN.
EVALUATE.
SCALE.
关于大模型后训练、强化学习与 AI INFRA 的工程笔记。
从算法到系统,记录可复现、可度量、可扩展的实践。
开始阅读 ↓
PUBLISHED
№ 000
TRAIN
EVAL
SERVE
EVAL
SERVE
POST-TRAINING ✳ RLHF ✳ GRPO ✳ REWARD MODELING ✳ EVALUATION ✳ AI INFRA ✳ POST-TRAINING
/ LATEST DISPATCHES
最近写作
00 ENTRIES
SYNCED BY MIX SPACE
还没有发布文章在 Mix Space 后台发布的文章会显示在这里。
ABOUT / 关于本站
让模型学得更好,
让系统跑得更稳。
/ WORKING STACK
研究工具箱
- 01PYTORCH
- 02VERL / TRL
- 03VLLM
- 04RAY