Nereus: Adaptive Parallelism for LLM Post-Training ๐
New approach optimizes RL post-training for large language models on GPU clusters
Adaptive Parallelism for LLMs
Nereus addresses challenges in reinforcement learning (RL) post-training for large language models (LLMs) on GPU clusters.
It manages multiple models across generations, inference, and training, adapting to changing factors like resource availability and sequence length.
Dynamic Job Adaptation
Adapting jobs with shared GPU usage poses challenges, including transition costs and coordination of GPU transfers.
Nereus introduces a cost-aware runtime that adjusts RL post-training jobs into efficient execution plans.
Memory-Friendly Planning
Nereus' low-overhead controller selects memory-friendly global plans, admitting transitions using a cost model.
This approach ensures efficient execution and resource utilization during the training process.
โ'Nereus introduces a cost-aware runtime that adapts RL post-training jobs into efficient execution plans.'โ
โ Songlin Jiang, Tuo Shi
By Chaos Lab ยท ๅฆ็ญๆ็AI