-
Notifications
You must be signed in to change notification settings - Fork 270
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
Permanent LLMExecutor wedge after CL_OUT_OF_RESOURCES on discrete GPU: servable stays AVAILABLE but every request returns 400 until restart (VLM legacy pipeline, public model)
bugSomething isn't workingSomething isn't workingStatus: Open.#4469 In openvinotoolkit/model_server;- Status: Open.#4461 In openvinotoolkit/model_server;
can't run qwen3.6 27b in pipeline parallel
bugSomething isn't workingSomething isn't workingStatus: Open.#4452 In openvinotoolkit/model_server;- Status: Open.#4447 In openvinotoolkit/model_server;
Constrained decoding terminates generation when the model emits '#' inside a string value
bugSomething isn't workingSomething isn't workingStatus: Open.#4439 In openvinotoolkit/model_server;- Status: Open.#4428 In openvinotoolkit/model_server;
Enable_prefix_caching: Suspected cache inaccuracy during prefix reuse in Linear Attention Models
bugSomething isn't workingSomething isn't workingStatus: Open.#4376 In openvinotoolkit/model_server;- Status: Open.#4362 In openvinotoolkit/model_server;
- Status: Open.#4351 In openvinotoolkit/model_server;
- Status: Open.#4347 In openvinotoolkit/model_server;
Qwen3.5-35B-A3B-int4-ov gibberish output during high memory pressure
bugSomething isn't workingSomething isn't workingStatus: Open.#4345 In openvinotoolkit/model_server;- Status: Open.#4333 In openvinotoolkit/model_server;