Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

Trois leviers pour réduire les coûts de l’IA d’entreprise

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · anglais
Three levers can cut enterprise AI costs
Traduction · français
Trois leviers pour réduire les coûts de l’IA d’entreprise
Original · anglais
Sarvam Code reported about $2 per Terminal-Bench 2.1 task, versus $4.1 to $27.8 for named rivals.
Traduction · français
Sarvam Code a indiqué environ 2 dollars par tâche sur Terminal-Bench 2.1, contre 4,1 à 27,8 dollars pour ses concurrents nommés.
Original · anglais
Caching can reduce effective AI costs by roughly 80% by avoiding repeated context sent to models.
Traduction · français
La mise en cache peut réduire les coûts effectifs de l’IA d’environ 80 % en évitant d’envoyer plusieurs fois le même contexte aux modèles.
Original · anglais
A telecom project moved 30% of routine steps to ordinary software and cut interaction costs by 35%.
Traduction · français
Un projet télécom a transféré 30 % des étapes courantes vers des logiciels classiques et réduit de 35 % les coûts d’interaction.
Original · anglais

A coding task can now carry a surprisingly different price tag depending on how the AI system is arranged around the model. In late July, Sarvam AI said its Sarvam Code agent averaged about $2 per task on Terminal-Bench 2.1, compared with $4.1 to $27.8 for Claude Code and OpenAI’s Codex. The difference, Sarvam said, came partly from how the system split work between planner, worker and verifier agents and routed it between models.

Traduction · français

Une tâche de programmation peut désormais afficher un prix étonnamment différent selon la manière dont le système d’IA est organisé autour du modèle. Fin juillet, Sarvam AI a indiqué que son agent Sarvam Code coûtait en moyenne environ 2 dollars par tâche sur Terminal-Bench 2.1, contre 4,1 à 27,8 dollars pour Claude Code et le Codex d’OpenAI. Selon Sarvam, cette différence s’expliquait en partie par la manière dont le système répartissait le travail entre des agents chargés de planifier, d’exécuter et de vérifier, et l’orientait entre différents modèles.

Original · anglais

That surrounding software is known as an agent harness: it decides what information an agent receives, how a task is divided and how often the model is called. Kausal Malladi, chief technology officer for investments at INDmoney, said a long task can repeatedly resend earlier conversation, instructions and context. Caching — reusing information the model has already processed — can reduce effective cost by roughly 80%, he estimated.

Traduction · français

Cette couche logicielle environnante est appelée infrastructure d’agent : elle détermine quelles informations un agent reçoit, comment une tâche est divisée et à quelle fréquence le modèle est appelé. Kausal Malladi, directeur technique chargé des investissements chez INDmoney, a déclaré qu’une tâche longue pouvait renvoyer à plusieurs reprises la conversation, les instructions et le contexte précédents. La mise en cache — qui consiste à réutiliser des informations déjà traitées par le modèle — peut réduire les coûts effectifs de environ 80 %, a-t-il estimé.

Original · anglais

The second lever is model selection. Melento, a document automation company formerly known as SignDesk, routes routine requests to smaller, faster models and sends genuinely complex cases to frontier models. Founder and CEO Krupesh Bhat’s rule is simple: match the price of the model to the difficulty of the task. Enterprises can track the share handled by smaller models, average cost per transaction and task success rate to see whether savings are real rather than merely shifting work elsewhere.

Traduction · français

Le deuxième levier est le choix du modèle. Melento, une entreprise d’automatisation documentaire auparavant connue sous le nom de SignDesk, oriente les demandes courantes vers des modèles plus petits et plus rapides, et réserve les cas réellement complexes aux modèles de pointe. La règle de Krupesh Bhat, son fondateur et CEO, est simple : adapter le prix du modèle à la difficulté de la tâche. Les entreprises peuvent suivre la part des tâches prises en charge par de petits modèles, le coût moyen par transaction et le taux de réussite des tâches pour déterminer si les économies sont réelles plutôt que de simplement déplacer le travail ailleurs.

Original · anglais

The third lever is more radical: stop treating every step as an AI problem. Arjun Nagulapally, CTO at AIONOS, said a telecom project processing more than a million interactions a month moved roughly 30% of routine steps to ordinary software, including databases and business rules. AIONOS said the cost of resolving each interaction fell by 35%, with the largest saving coming from work that no longer required a model.

Traduction · français

Le troisième levier est plus radical : cesser de considérer chaque étape comme un problème d’IA. Arjun Nagulapally, CTO d’AIONOS, a déclaré qu’un projet télécom traitant plus d’un million d’interactions par mois avait transféré environ 30 % des étapes courantes vers des logiciels classiques, notamment des bases de données et des règles métier. AIONOS a indiqué que le coût de résolution de chaque interaction avait baissé de 35 %, l’économie la plus importante venant des tâches qui ne nécessitaient plus de modèle.

Original · anglais

So what changes in practice? Teams can use the same AI budget to complete more work by reducing repeated context, reserving expensive models for difficult decisions and removing unnecessary model calls. But higher throughput is not automatically lower spending: the company must also see lower costs for models, people or rework while keeping success rates stable. The reported figures come from the companies themselves.

Traduction · français

Alors, qu’est-ce qui change dans la pratique ? Les équipes peuvent utiliser le même budget d’IA pour accomplir davantage de travail en réduisant les répétitions de contexte, en réservant les modèles coûteux aux décisions difficiles et en supprimant les appels inutiles aux modèles. Mais une capacité de traitement supérieure ne signifie pas automatiquement une baisse des dépenses : l’entreprise doit également constater une diminution des coûts liés aux modèles, au personnel ou aux reprises, tout en maintenant des taux de réussite stables. Les chiffres cités sont communiqués par les entreprises elles-mêmes.

Revenir à l’article