Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A user waits for the first word from an AI agent while the system is balancing long, multi-turn sessions across servers. In tests, a new infrastructure layer called TensorCast cut median time-to-first-token by up to 93.2% in high-concurrency agent workloads. The project comes from Peking University, StepFun and Beijing University of Posts and Telecommunications.
Un utilisateur attend le premier mot d’un agent IA tandis que le système répartit de longues sessions à plusieurs tours entre plusieurs serveurs. Lors de tests, une nouvelle couche d’infrastructure baptisée TensorCast a réduit jusqu’à 93,2 % le délai médian avant le premier token dans des charges de travail d’agents à forte concurrence. Le projet est issu de l’Université de Pékin, de StepFun et de l’Université des postes et télécommunications de Pékin.
The problem is not only how quickly a GPU calculates. Large models also move weights, activations and KV Cache, the stored attention state that lets a model continue a conversation without recomputing everything, between compute engines, networks and storage. Today, those jobs are commonly split among separate systems for model loading, KV Cache migration and checkpoint recovery. They perform similar operations, but remain tied to individual frameworks and back ends.
Le problème ne se résume pas à la vitesse de calcul d’un GPU. Les grands modèles déplacent également les poids, les activations et le KV Cache — l’état d’attention conservé qui permet à un modèle de poursuivre une conversation sans tout recalculer — entre les moteurs de calcul, les réseaux et le stockage. Aujourd’hui, ces tâches sont généralement réparties entre des systèmes distincts dédiés au chargement des modèles, à la migration du KV Cache et à la restauration des checkpoints. Ils effectuent des opérations similaires, mais restent liés à des frameworks et des backends individuels.
TensorCast makes tensors first-class system objects, with their own identity and lifecycle. A developer can manage model weights, KV Cache and intermediate states through the same programmable layer, without tracking which server currently holds them. Its Global Store maintains cluster metadata, while Worker nodes perform data operations using RDMA, a fast network-transfer technology, and zero-copy transfer, which avoids unnecessary copying in memory.
TensorCast fait des tenseurs des objets système de premier ordre, dotés de leur propre identité et de leur propre cycle de vie. Un développeur peut gérer les poids des modèles, le KV Cache et les états intermédiaires via la même couche programmable, sans avoir à suivre le serveur qui les héberge actuellement. Son Global Store conserve les métadonnées du cluster, tandis que les nœuds Worker effectuent les opérations sur les données au moyen de RDMA, une technologie de transfert rapide sur réseau, et du transfert zero-copy, qui évite les copies inutiles en mémoire.
The researchers integrated the system into vLLM and SGLang. Using the Qwen3-235B-A22B model, they report that elastic-scaling startup became up to 228.6 times faster than with common distributed file systems. In SGLang HiCache, TensorCast matched the specialized Mooncake KV Cache system, suggesting that a general layer need not give up the performance of a narrowly focused one.
Les chercheurs ont intégré le système à vLLM et SGLang. Avec le modèle Qwen3-235B-A22B, ils rapportent que le démarrage lors de la mise à l’échelle élastique est devenu jusqu’à 228,6 fois plus rapide qu’avec des systèmes de fichiers distribués courants. Dans SGLang HiCache, TensorCast a égalé le système spécialisé Mooncake KV Cache, ce qui suggère qu’une couche généraliste ne doit pas nécessairement sacrifier les performances d’une solution spécialisée.
So what changes in practice? When a session has to move because one instance is overloaded, TensorCast can express the migration as a lifecycle program instead of requiring changes to the scheduler, KV Cache backend and inference engine separately. That could reduce the engineering work needed to adapt AI services as agents and multi-turn reasoning create more dynamic workloads. For now, these are project results from an experimental integration.
Qu’est-ce que cela change en pratique ? Lorsqu’une session doit être déplacée parce qu’une instance est surchargée, TensorCast peut exprimer la migration sous la forme d’un programme de cycle de vie, au lieu d’exiger des modifications séparées de l’ordonnanceur, du backend KV Cache et du moteur d’inférence. Cela pourrait réduire le travail d’ingénierie nécessaire pour adapter les services d’IA à mesure que les agents et le raisonnement à plusieurs tours créent des charges de travail plus dynamiques. Pour l’instant, il s’agit de résultats obtenus par le projet dans le cadre d’une intégration expérimentale.