TensorCast réduit jusqu’à 93,2 % le délai avant le premier token des LLM
Un utilisateur attend le premier mot d’un agent IA tandis que le système répartit de longues sessions à plusieurs tours entre plusieurs serveurs. Lors de tests, une nouvelle couche d’infrastructure baptisée TensorCast a réduit jusqu’à 93,2 % le délai médian avant le premier token dans des charges de travail d’agents à forte concurrence. Le projet est issu de l’Université de Pékin, de StepFun et de l’Université des postes et télécommunications de Pékin.
Le problème ne se résume pas à la vitesse de calcul d’un GPU. Les grands modèles déplacent également les poids, les activations et le KV Cache — l’état d’attention conservé qui permet à un modèle de poursuivre une conversation sans tout recalculer — entre les moteurs de calcul, les réseaux et le stockage. Aujourd’hui, ces tâches sont généralement réparties entre des systèmes distincts dédiés au chargement des modèles, à la migration du KV Cache et à la restauration des checkpoints. Ils effectuent des opérations similaires, mais restent liés à des frameworks et des backends individuels.
TensorCast fait des tenseurs des objets système de premier ordre, dotés de leur propre identité et de leur propre cycle de vie. Un développeur peut gérer les poids des modèles, le KV Cache et les états intermédiaires via la même couche programmable, sans avoir à suivre le serveur qui les héberge actuellement. Son Global Store conserve les métadonnées du cluster, tandis que les nœuds Worker effectuent les opérations sur les données au moyen de RDMA, une technologie de transfert rapide sur réseau, et du transfert zero-copy, qui évite les copies inutiles en mémoire.
Les chercheurs ont intégré le système à vLLM et SGLang. Avec le modèle Qwen3-235B-A22B, ils rapportent que le démarrage lors de la mise à l’échelle élastique est devenu jusqu’à 228,6 fois plus rapide qu’avec des systèmes de fichiers distribués courants. Dans SGLang HiCache, TensorCast a égalé le système spécialisé Mooncake KV Cache, ce qui suggère qu’une couche généraliste ne doit pas nécessairement sacrifier les performances d’une solution spécialisée.
Qu’est-ce que cela change en pratique ? Lorsqu’une session doit être déplacée parce qu’une instance est surchargée, TensorCast peut exprimer la migration sous la forme d’un programme de cycle de vie, au lieu d’exiger des modifications séparées de l’ordonnanceur, du backend KV Cache et du moteur d’inférence. Cela pourrait réduire le travail d’ingénierie nécessaire pour adapter les services d’IA à mesure que les agents et le raisonnement à plusieurs tours créent des charges de travail plus dynamiques. Pour l’instant, il s’agit de résultats obtenus par le projet dans le cadre d’une intégration expérimentale.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter