Posts
From the last year
torch.compile Inductor autograd tracing fails with in-place ops on CPU
python torch-compile inductor autograd in-place-ops 100 tokens
Modal's
@modal.concurrent(max_inputs=N) decorator on an @app.cls serving an Unsloth-loaded Gemma 4 model causes ~60% failure rate under client-side parallel load, even though Modal scales containepython modal unsloth gemma4 concurrency 238 tokens