Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
On August 21, iFLYTEK CEO Liu Qingfeng partly explained the company's absence from the latest code- and agent-focused AI wave by pointing to the cost of extremely long context windows on domestic computing infrastructure. His response is not to wait for faster hardware, but to extract more from the chips already available. iFLYTEK says its domestic accelerators can lag Nvidia's H200 by up to roughly fivefold in training efficiency when context extends beyond 256K tokens.
Le 21 août, le CEO d’iFLYTEK Liu Qingfeng a expliqué en partie l’absence de l’entreprise dans la dernière vague de l’IA axée sur le code et les agents en évoquant le coût des fenêtres de contexte extrêmement longues sur les infrastructures de calcul nationales. Sa réponse n’est pas d’attendre du matériel plus rapide, mais de tirer davantage parti des puces déjà disponibles. iFLYTEK affirme que ses accélérateurs nationaux peuvent accuser un retard pouvant atteindre environ cinq fois celui du H200 de Nvidia en matière d’efficacité d’entraînement lorsque le contexte dépasse 256 K tokens.
That gap matters less for the workloads iFLYTEK is targeting than it does for frontier experiments. The company says 90% to 95% of use cases across education, healthcare, automotive and state-owned enterprises do not need million-token context windows. It is therefore tuning the whole stack at once: model architecture, operators, communications, memory and training frameworks, while validating techniques for long-sequence inference.
Cet écart compte moins pour les charges de travail ciblées par iFLYTEK que pour les expérimentations de pointe. L’entreprise affirme que 90 % à 95 % des cas d’usage dans l’éducation, la santé, l’automobile et les entreprises publiques n’ont pas besoin de fenêtres de contexte d’un million de tokens. Elle ajuste donc toute la pile simultanément : architecture des modèles, opérateurs, communications, mémoire et frameworks d’entraînement, tout en validant des techniques d’inférence sur de longues séquences.
The strategy has produced a concrete deployment. Spark X2-Flash, launched in April, became the first 30-billion-parameter Mixture-of-Experts model that iFLYTEK says was trained and deployed entirely on Huawei Ascend 910B clusters. Spark X2 arrived in February, Spark X2-VL followed in June, and the company said a new all-domestic flagship general model was due in late August, including at its annual 1024 Developers Festival.
La stratégie a déjà débouché sur un déploiement concret. Spark X2-Flash, lancé en avril, est devenu le premier modèle Mixture-of-Experts à 30 milliards de paramètres qu’iFLYTEK affirme avoir entièrement entraîné et déployé sur des clusters Huawei Ascend 910B. Spark X2 est arrivé en février, Spark X2-VL a suivi en juin, et l’entreprise a indiqué qu’un nouveau modèle général phare entièrement national était attendu fin août, notamment lors de son 1024 Developers Festival annuel.
The engineering push also reaches the infrastructure underneath the models. In July, iFLYTEK shared a national first prize for the Pengcheng Cloud Brain, a large-scale domestic intelligent compute project led by Pengcheng National Laboratory. On the commercial side, its LLM API and MaaS — model as a service — revenue grew about 70% year on year in the first half. The company is combining trillion-scale cloud models with on-device models and selling outcomes rather than tokens.
Cette offensive d’ingénierie s’étend également à l’infrastructure sous-jacente aux modèles. En juillet, iFLYTEK a partagé un premier prix national pour le Pengcheng Cloud Brain, un projet national de calcul intelligent à grande échelle dirigé par le Pengcheng National Laboratory. Sur le plan commercial, ses revenus tirés des API de LLM et du MaaS — modèle en tant que service — ont progressé d’environ 70 % sur un an au premier semestre. L’entreprise combine des modèles cloud à l’échelle du billion de paramètres avec des modèles exécutés sur les appareils, et vend des résultats plutôt que des tokens.
For those sectors, the company argues that most deployments can avoid million-token context windows. Liu says the approach protects iFLYTEK's margin and focus as domestic chip ecosystems mature, although the performance figures come from the company and no independent reproduction is cited here. Liu expects the compute disadvantage against domestic rivals to level out within two years; that is a forecast, not a completed result.
Pour ces secteurs, l’entreprise soutient que la plupart des déploiements peuvent éviter les fenêtres de contexte d’un million de tokens. Liu affirme que cette approche protège la marge et les priorités d’iFLYTEK à mesure que les écosystèmes de puces nationaux arrivent à maturité, même si les chiffres de performance proviennent de l’entreprise et qu’aucune reproduction indépendante n’est citée ici. Liu prévoit que le désavantage en matière de calcul face aux acteurs nationaux se résorbera dans les deux ans ; il s’agit d’une prévision, et non d’un résultat acquis.