Cinq millions de jetons consommés en une nuit, alors que l'utilisateur dormait.

Un agent IA autonome fonctionnait en toute indépendance, enchaînant les requêtes et mobilisant des GPU quelque part aux États-Unis. Cela représente environ 1 000 fois la consommation énergétique d'un utilisateur moyen, sans personne aux commandes.

C'est avec ce scénario presque banal que James Martin a ouvert la discussion lors de Sopht Connect 2026. Le fondateur de BetterTech a partagé la scène avec Amiel Sitruk, fondateur de Terra Cognita, un cabinet d'ingénierie spécialisé dans l'IA frugale et éthique.

L'un a exposé le problème, chiffres à l'appui. L'autre a expliqué comment y remédier, en s'appuyant sur des cas clients concrets.

Ensemble, ils ont soulevé une question qu'il devient de plus en plus difficile d'éluder : comment les entreprises peuvent-elles continuer à déployer l'IA sans laisser ses coûts environnementaux, énergétiques et financiers devenir insoutenables ?

L'addition arrive

Il est utile de revenir sur ces chiffres, car ils permettent de remettre en perspective le débat actuel sur l'IA.

Les GPU qui alimentent l'IA générative consomment nettement plus d'énergie que les processeurs traditionnels.

Alors que l'essor de l'IA stimule la demande en puissance de calcul, la consommation électrique des centres de données est en passe de tripler aux États-Unis comme en Europe. La consommation d'eau associée devrait, quant à elle, quadrupler.

Les modèles de raisonnement, qui décomposent une tâche en plusieurs étapes avant de produire une réponse, peuvent consommer jusqu'à 30 fois plus d'énergie que les modèles standards. Et un agent IA — un système autonome qui délègue des tâches à d'autres systèmes IA en boucle — peut consommer jusqu'à 1 000 fois plus qu'une simple recherche web, selon l'Agence internationale de l'énergie.

Colossus est sans doute le symbole le plus frappant de la direction que prend cette trajectoire. xAI a construit son supercalculateur en seulement quatre mois pour en faire l'une des plus grandes installations de calcul IA au monde. Pour aller aussi vite, Elon Musk n'a pas attendu un raccordement au réseau électrique. Des générateurs au méthane ont été acheminés par camion et installés dans un quartier défavorisé de Memphis, déjà exposé à la pollution industrielle. Les niveaux d'oxyde d'azote y ont presque doublé en un an.

Douze projets similaires de centres de données alimentés au gaz ont été approuvés depuis aux États-Unis.

Et selon les calculs de James, si l'on examine le budget de calcul d'Anthropic, environ une requête Claude sur trois correspondrait, en termes d'énergie, à ce type d'infrastructure.

En d'autres termes, il ne s'agit plus seulement d'un problème macroéconomique. Il se manifeste dans chaque requête IA.

Le piège de l'efficacité

C'est là que les choses deviennent contre-intuitives.

Face à cette trajectoire, la réponse instinctive de l'industrie est de rendre les modèles plus efficaces : moins de paramètres pour un même résultat, des architectures plus légères, un meilleur matériel. Tout cela est nécessaire. Mais ce n'est pas suffisant et, dans certains cas, cela peut même se retourner contre nous.

Sacha Luccioni, qui étudie ces questions depuis des années, a récemment réuni des experts de premier plan à Paris pour explorer précisément cette question. Le consensus a été frappant : à mesure que les modèles deviennent plus efficaces, l'industrie les rend également plus grands. Les gains d'efficacité sont alors annulés par l'augmentation de l'échelle.

C'est l'effet rebond appliqué à l'IA.

Optimiser la technologie sans remettre en question son usage revient à courir plus vite sur un tapis roulant qui ne cesse d'accélérer.

Une approche différente est nécessaire. C'est ce qu'Amiel a ensuite expliqué.

Qu'est-ce que l'IA frugale ?

L'IA frugale est souvent mal comprise. Il ne s'agit pas d'un compromis environnemental qui signifierait offrir un service de moindre qualité. C'est une approche d'ingénierie structurée et documentée.

La France a développé un cadre national pour l'IA frugale avec l'AFNOR et a intégré cette approche dans sa stratégie nationale à l'horizon 2030.

Le principe repose sur deux dimensions : l'efficacité et la sobriété.

D'abord, l'efficacité : pour un besoin donné, choisir le modèle et l'architecture qui consomment le moins de ressources.

Ensuite, la sobriété : questionner le besoin lui-même avant de s'engager dans une solution.

Cela nécessite-t-il vraiment un LLM ? Un modèle plus petit, plus ancien, ou même un système basé sur des règles pourrait-il résoudre le problème plus efficacement ? L'IA est-elle réellement indispensable ?

Amiel a illustré cette idée avec un iceberg.

Les entreprises arrivent souvent avec un problème déjà formulé comme un cas d'usage d'IA générative. Mais sous la surface, le besoin sous-jacent est généralement plus modeste, plus spécifique et plus facile à résoudre autrement.

Cinq exemples d'IA frugale en pratique

Les preuves les plus convaincantes proviennent d'applications concrètes. Amiel a partagé plusieurs exemples issus des projets de Terra Cognita, chacun remettant en question une idée reçue sur l'IA.

1. Un petit modèle peut surpasser un grand modèle

Pour un cas d'usage de traitement de documents impliquant du contenu manuscrit et multimodal, notamment des photographies de documents administratifs avec des ombres, des tampons et une écriture irrégulière, le choix évident aurait pu être Gemini 2.5 Pro, avec ses deux billions de paramètres.

Au lieu de cela, Terra Cognita a sélectionné un petit modèle spécialisé, calibré sur les données propres du client.

Le résultat ? Des performances comparables pour une fraction du coût.

Première leçon : un modèle bien calibré peut souvent surpasser un grand modèle généraliste pour une tâche spécifique.

2. Les modèles peuvent être considérablement réduits sans perdre leur valeur

Le deuxième exemple est issu du Frugal AI Challenge organisé par le ministère de la Transition écologique.

Un modèle Gemma de 4 milliards de paramètres a été soumis à des techniques d'optimisation poussées, incluant l'élagage, la quantification et la distillation de connaissances.

Le résultat : 80,7 % des capacités initiales ont été conservées tout en utilisant seulement 14 % de l'énergie initiale.

Un modèle existant peut souvent être réduit de manière significative sans sacrifier ce qui le rend réellement utile.

3. L'IA générative ne doit pas être le choix par défaut

Un client recevait environ 250 e-mails de bons de commande par jour et souhaitait automatiser l'extraction d'informations.

La solution évidente aurait été de connecter un LLM.

Terra Cognita a emprunté une voie différente. L'équipe a identifié des modèles récurrents et a construit un pipeline déterministe traditionnel, n'utilisant l'IA générative qu'en solution de secours pour les cas inhabituels.

Le résultat : le même résultat pour un coût bien moindre.

L'IA générative est devenue le filet de sécurité, et non le moteur.

4. Parfois, l'IA non générative est tout simplement meilleure

Sur une ligne d'assemblage aéronautique, un client avait besoin de détecter des anomalies visuelles.

Un algorithme non génératif de 2023 appelé PatchCore s'est révélé plus léger, plus rapide et plus précis que les solutions génératives testées.

Le même principe a été appliqué à l'analyse de sentiment réalisée avec l'INA sur des dizaines de milliers de tweets. Des modèles Transformer légers tournant sur CPU ont suffi à obtenir les résultats escomptés.

L'IA générative n'est qu'un sous-ensemble de l'IA et, parfois, ce n'est tout simplement pas l'outil adapté.

5. Parfois, vous n'avez pas besoin d'IA du tout

Le cinquième exemple était le plus radical.

Un client souhaitait optimiser un système de primes pour ses employés. L'équipe a d'abord analysé les données et cherché où se situaient les problèmes réels.

La conclusion ? L'IA n'était absolument pas nécessaire.

La solution a consisté à discuter avec l'opérateur, à modifier les instructions et à repenser le système de primes.

Résultat : des dizaines de milliers d'euros économisés presque immédiatement, sans aucun coût de développement et sans empreinte IA supplémentaire.

« J'adore l'IA », a conclu Amiel, « mais nous devons arrêter de céder à la peur de manquer quelque chose. »

Les entreprises qui tireront le meilleur parti de l'IA ne seront pas nécessairement celles qui l'utilisent partout. Ce seront celles qui sauront quand ne pas l'utiliser.

Rendre l'impact de l'IA visible

Choisir un modèle plus petit, le compresser ou concevoir un pipeline déterministe exige avant tout une chose : savoir ce que vous consommez.

Sans mesure, il n'y a pas d'IA frugale, seulement des suppositions.

L'un des exemples les plus frappants vient de la SNCF. Ses quelque 300 000 employés n'utilisent pas ChatGPT directement. Ils accèdent plutôt à SNCF-GPT, une interface LLM interne qui intègre EcoLogits pour afficher l'empreinte carbone de chaque réponse.

Pour une requête standard, le compteur affiche environ 8 à 9 grammes de CO₂.

Mais lorsqu'un utilisateur a demandé au modèle de rechercher des informations sur Internet, ce chiffre a bondi à 3 000 grammes de CO₂, soit environ 300 fois l'impact et 400 fois le coût.

Dans ce cas de figure, il est plus judicieux de rechercher l'information par vous-même.

Ce type de comportement ne devient possible que lorsque l'impact environnemental et financier de l'IA est visible au moment de l'utilisation.

Pourquoi l'IA frugale est un enjeu stratégique

Il convient d'ajouter un autre point : dans le contexte actuel, l'argument environnemental ne suffit pas toujours à convaincre les décideurs.

La force de l'IA frugale réside dans sa capacité à répondre simultanément à plusieurs priorités métier.

Les modèles plus petits, souvent open source, sont plus faciles à auditer, ce qui les rend mieux adaptés aux exigences réglementaires en constante évolution. Ils peuvent être déployés là où les organisations le souhaitent, renforçant ainsi la souveraineté numérique. Leur coût d'exploitation est moindre, ce qui améliore la rentabilité. Enfin, ils réduisent la dépendance à l'égard d'une poignée d'hyperscalers dont la capacité à tenir leurs propres engagements climatiques est de plus en plus remise en question, y compris par les entreprises elles-mêmes.

L'IA frugale n'est pas un compromis. C'est une ingénierie supérieure.

Pour les organisations qui cherchent à déployer l'IA à grande échelle sans perdre le contrôle de leurs coûts, de leur conformité ou de leur autonomie stratégique, il s'agit peut-être de l'approche la plus déterminante pour les mois à venir.

Un grand merci à James et Amiel pour cette discussion lucide et pour nous avoir donné matière à réflexion sur l'avenir de l'IA.

‍