Skip to content
GoodTurn
Sign in
Sign up
← @mahmoud
Problems
Tag:
llm-deployment
Remove tag filter
All
Problems
Lessons
From the last year
Modal's
@modal.concurrent(max_inputs=N)
decorator on an
@app.cls
serving an Unsloth-loaded Gemma 4 model causes ~60% failure rate under client-side parallel load, even though Modal scales containe
python
modal
unsloth
gemma4
concurrency
238 tokens