Trois leviers pour réduire les coûts de l’IA d’entreprise
Une tâche de programmation peut désormais afficher un prix étonnamment différent selon la manière dont le système d’IA est organisé autour du modèle. Fin juillet, Sarvam AI a indiqué que son agent Sarvam Code coûtait en moyenne environ 2 dollars par tâche sur Terminal-Bench 2.1, contre 4,1 à 27,8 dollars pour Claude Code et le Codex d’OpenAI. Selon Sarvam, cette différence s’expliquait en partie par la manière dont le système répartissait le travail entre des agents chargés de planifier, d’exécuter et de vérifier, et l’orientait entre différents modèles.
Cette couche logicielle environnante est appelée infrastructure d’agent : elle détermine quelles informations un agent reçoit, comment une tâche est divisée et à quelle fréquence le modèle est appelé. Kausal Malladi, directeur technique chargé des investissements chez INDmoney, a déclaré qu’une tâche longue pouvait renvoyer à plusieurs reprises la conversation, les instructions et le contexte précédents. La mise en cache — qui consiste à réutiliser des informations déjà traitées par le modèle — peut réduire les coûts effectifs de environ 80 %, a-t-il estimé.
Le deuxième levier est le choix du modèle. Melento, une entreprise d’automatisation documentaire auparavant connue sous le nom de SignDesk, oriente les demandes courantes vers des modèles plus petits et plus rapides, et réserve les cas réellement complexes aux modèles de pointe. La règle de Krupesh Bhat, son fondateur et CEO, est simple : adapter le prix du modèle à la difficulté de la tâche. Les entreprises peuvent suivre la part des tâches prises en charge par de petits modèles, le coût moyen par transaction et le taux de réussite des tâches pour déterminer si les économies sont réelles plutôt que de simplement déplacer le travail ailleurs.
Le troisième levier est plus radical : cesser de considérer chaque étape comme un problème d’IA. Arjun Nagulapally, CTO d’AIONOS, a déclaré qu’un projet télécom traitant plus d’un million d’interactions par mois avait transféré environ 30 % des étapes courantes vers des logiciels classiques, notamment des bases de données et des règles métier. AIONOS a indiqué que le coût de résolution de chaque interaction avait baissé de 35 %, l’économie la plus importante venant des tâches qui ne nécessitaient plus de modèle.
Alors, qu’est-ce qui change dans la pratique ? Les équipes peuvent utiliser le même budget d’IA pour accomplir davantage de travail en réduisant les répétitions de contexte, en réservant les modèles coûteux aux décisions difficiles et en supprimant les appels inutiles aux modèles. Mais une capacité de traitement supérieure ne signifie pas automatiquement une baisse des dépenses : l’entreprise doit également constater une diminution des coûts liés aux modèles, au personnel ou aux reprises, tout en maintenant des taux de réussite stables. Les chiffres cités sont communiqués par les entreprises elles-mêmes.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter