Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
PrototypeSource unique

TensorCast réduit jusqu’à 93,2 % le délai avant le premier token des LLM

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Un utilisateur attend le premier mot d’un agent IA tandis que le système répartit de longues sessions à plusieurs tours entre plusieurs serveurs. Lors de tests, une nouvelle couche d’infrastructure baptisée TensorCast a réduit jusqu’à 93,2 % le délai médian avant le premier token dans des charges de travail d’agents à forte concurrence. Le projet est issu de l’Université de Pékin, de StepFun et de l’Université des postes et télécommunications de Pékin.

Le problème ne se résume pas à la vitesse de calcul d’un GPU. Les grands modèles déplacent également les poids, les activations et le KV Cache — l’état d’attention conservé qui permet à un modèle de poursuivre une conversation sans tout recalculer — entre les moteurs de calcul, les réseaux et le stockage. Aujourd’hui, ces tâches sont généralement réparties entre des systèmes distincts dédiés au chargement des modèles, à la migration du KV Cache et à la restauration des checkpoints. Ils effectuent des opérations similaires, mais restent liés à des frameworks et des backends individuels.

TensorCast fait des tenseurs des objets système de premier ordre, dotés de leur propre identité et de leur propre cycle de vie. Un développeur peut gérer les poids des modèles, le KV Cache et les états intermédiaires via la même couche programmable, sans avoir à suivre le serveur qui les héberge actuellement. Son Global Store conserve les métadonnées du cluster, tandis que les nœuds Worker effectuent les opérations sur les données au moyen de RDMA, une technologie de transfert rapide sur réseau, et du transfert zero-copy, qui évite les copies inutiles en mémoire.

Les chercheurs ont intégré le système à vLLM et SGLang. Avec le modèle Qwen3-235B-A22B, ils rapportent que le démarrage lors de la mise à l’échelle élastique est devenu jusqu’à 228,6 fois plus rapide qu’avec des systèmes de fichiers distribués courants. Dans SGLang HiCache, TensorCast a égalé le système spécialisé Mooncake KV Cache, ce qui suggère qu’une couche généraliste ne doit pas nécessairement sacrifier les performances d’une solution spécialisée.

Qu’est-ce que cela change en pratique ? Lorsqu’une session doit être déplacée parce qu’une instance est surchargée, TensorCast peut exprimer la migration sous la forme d’un programme de cycle de vie, au lieu d’exiger des modifications séparées de l’ordonnanceur, du backend KV Cache et du moteur d’inférence. Cela pourrait réduire le travail d’ingénierie nécessaire pour adapter les services d’IA à mesure que les agents et le raisonnement à plusieurs tours créent des charges de travail plus dynamiques. Pour l’instant, il s’agit de résultats obtenus par le projet dans le cadre d’une intégration expérimentale.

93,2%Réduction maximale du délai médian avant le premier token

Sources — lire les originaux(heure de Paris)

PandailyEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter