Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A coding task can now carry a surprisingly different price tag depending on how the AI system is arranged around the model. In late July, Sarvam AI said its Sarvam Code agent averaged about $2 per task on Terminal-Bench 2.1, compared with $4.1 to $27.8 for Claude Code and OpenAI’s Codex. The difference, Sarvam said, came partly from how the system split work between planner, worker and verifier agents and routed it between models.
Une tâche de programmation peut désormais afficher un prix étonnamment différent selon la manière dont le système d’IA est organisé autour du modèle. Fin juillet, Sarvam AI a indiqué que son agent Sarvam Code coûtait en moyenne environ 2 dollars par tâche sur Terminal-Bench 2.1, contre 4,1 à 27,8 dollars pour Claude Code et le Codex d’OpenAI. Selon Sarvam, cette différence s’expliquait en partie par la manière dont le système répartissait le travail entre des agents chargés de planifier, d’exécuter et de vérifier, et l’orientait entre différents modèles.
That surrounding software is known as an agent harness: it decides what information an agent receives, how a task is divided and how often the model is called. Kausal Malladi, chief technology officer for investments at INDmoney, said a long task can repeatedly resend earlier conversation, instructions and context. Caching — reusing information the model has already processed — can reduce effective cost by roughly 80%, he estimated.
Cette couche logicielle environnante est appelée infrastructure d’agent : elle détermine quelles informations un agent reçoit, comment une tâche est divisée et à quelle fréquence le modèle est appelé. Kausal Malladi, directeur technique chargé des investissements chez INDmoney, a déclaré qu’une tâche longue pouvait renvoyer à plusieurs reprises la conversation, les instructions et le contexte précédents. La mise en cache — qui consiste à réutiliser des informations déjà traitées par le modèle — peut réduire les coûts effectifs de environ 80 %, a-t-il estimé.
The second lever is model selection. Melento, a document automation company formerly known as SignDesk, routes routine requests to smaller, faster models and sends genuinely complex cases to frontier models. Founder and CEO Krupesh Bhat’s rule is simple: match the price of the model to the difficulty of the task. Enterprises can track the share handled by smaller models, average cost per transaction and task success rate to see whether savings are real rather than merely shifting work elsewhere.
Le deuxième levier est le choix du modèle. Melento, une entreprise d’automatisation documentaire auparavant connue sous le nom de SignDesk, oriente les demandes courantes vers des modèles plus petits et plus rapides, et réserve les cas réellement complexes aux modèles de pointe. La règle de Krupesh Bhat, son fondateur et CEO, est simple : adapter le prix du modèle à la difficulté de la tâche. Les entreprises peuvent suivre la part des tâches prises en charge par de petits modèles, le coût moyen par transaction et le taux de réussite des tâches pour déterminer si les économies sont réelles plutôt que de simplement déplacer le travail ailleurs.
The third lever is more radical: stop treating every step as an AI problem. Arjun Nagulapally, CTO at AIONOS, said a telecom project processing more than a million interactions a month moved roughly 30% of routine steps to ordinary software, including databases and business rules. AIONOS said the cost of resolving each interaction fell by 35%, with the largest saving coming from work that no longer required a model.
Le troisième levier est plus radical : cesser de considérer chaque étape comme un problème d’IA. Arjun Nagulapally, CTO d’AIONOS, a déclaré qu’un projet télécom traitant plus d’un million d’interactions par mois avait transféré environ 30 % des étapes courantes vers des logiciels classiques, notamment des bases de données et des règles métier. AIONOS a indiqué que le coût de résolution de chaque interaction avait baissé de 35 %, l’économie la plus importante venant des tâches qui ne nécessitaient plus de modèle.
So what changes in practice? Teams can use the same AI budget to complete more work by reducing repeated context, reserving expensive models for difficult decisions and removing unnecessary model calls. But higher throughput is not automatically lower spending: the company must also see lower costs for models, people or rework while keeping success rates stable. The reported figures come from the companies themselves.
Alors, qu’est-ce qui change dans la pratique ? Les équipes peuvent utiliser le même budget d’IA pour accomplir davantage de travail en réduisant les répétitions de contexte, en réservant les modèles coûteux aux décisions difficiles et en supprimant les appels inutiles aux modèles. Mais une capacité de traitement supérieure ne signifie pas automatiquement une baisse des dépenses : l’entreprise doit également constater une diminution des coûts liés aux modèles, au personnel ou aux reprises, tout en maintenant des taux de réussite stables. Les chiffres cités sont communiqués par les entreprises elles-mêmes.