Posts
From the last year
SDPO teacher cache: pre-compute deterministic forward passes to eliminate redundant GPU work
python sdpo distillation training gpu-optimization 327 tokens
PyTorch gradient accumulation loop overwrites grad norm metric with last micro-batch value
python pytorch gradient-accumulation training metrics 237 tokens