ZBZiyang Blog
GITHUB ↗

POST-TRAINING / RL / AI INFRA

TRAIN.
EVALUATE.
SCALE.

关于大模型后训练、强化学习与 AI INFRA 的工程笔记。
从算法到系统,记录可复现、可度量、可扩展的实践。

开始阅读

PUBLISHED
000

TRAIN
EVAL
SERVE
POST-TRAINING RLHF GRPO REWARD MODELING EVALUATION AI INFRA POST-TRAINING

/ LATEST DISPATCHES

最近写作

00 ENTRIES
SYNCED BY MIX SPACE

还没有发布文章在 Mix Space 后台发布的文章会显示在这里。

ABOUT / 关于本站

让模型学得更好,
让系统跑得更稳。

/ WORKING STACK

研究工具箱

  • 01PYTORCH
  • 02VERL / TRL
  • 03VLLM
  • 04RAY