vLLM est exposé à un déni de service dans les déploiements avec désagrégation prefill/decode et connecteur NIXL : des requêtes de complétion multi-prompts peuvent arrêter le worker de décodage.
Analyse technique
Le cache de préfixes du connecteur NIXL ne valide pas correctement les nombres de blocs entre prompts de longueurs différentes. Cela provoque un échec d'assertion dans NixlBaseConnectorWorker._apply_prefix_caching et termine le worker decode.
Impact, versions et correctif
Détection / vérification
Surveiller les arrêts ou redémarrages de workers decode et les erreurs d'assertion provenant de NixlBaseConnectorWorker._apply_prefix_caching.
Action recommandée
Identifier les instances utilisant NIXL avec prefill/decode désagrégé, réduire l'exposition des endpoints de complétion et suivre le correctif amont référencé.
Sources
Priorisation DFS : P3 · confiance de recoupement standard · 1 source(s).