Vous avez déployé ChatGPT ou un modèle équivalent pour automatiser une tâche métier précise. Vous payez, la plupart du temps, pour une capacité de raisonnement que vous n’utilisez jamais.

En effet, les modèles les plus performants du marché peuvent par exemple résoudre un problème mathématique inédit, ou générer une nouvelle image sur la base d’une simple description. Mais si vous cherchez des solutions pour répondre à une question sur une procédure RH ou classer une facture, vous n’avez pas besoin de toutes ces ressources… Et le dimensionnement de votre projet IA va avoir de sérieux impacts sur son budget global !

Le prix d’une question, multiplié par le volume

Les fournisseurs de LLM (comme Open AI avec Chat GPT ou Microsoft avec Copilot) facturent à l’usage, au token. Pour donner un ordre de grandeur concret, GPT-4o d’OpenAI est tarifé, en 2026, à 2,50 $ par million de tokens en entrée et 10 $ par million de tokens en sortie.

Sur la base de ce tarif, prenons l’exemple d’un assistant interne qui répond aux questions de vos équipes sur les procédures, sollicité 50 000 fois par mois, avec un contexte de 2 000 tokens envoyés à chaque question (l’historique de conversation, les extraits de documents pertinents) et une réponse de 300 tokens. Cela représente 100 millions de tokens en entrée et 15 millions en sortie chaque mois, soit environ 400 $ de facturation API rien que pour cet usage. Multipliez ce calcul par le nombre de cas d’usage que vous avez déployés ou prévoyez de déployer en un an (support interne, aide à la rédaction, veille documentaire, assistance commerciale) et la facture cumulée dépasse largement ce que vous aviez budgété au moment du premier projet pilote.

Ce chiffre ne dit d’ailleurs rien du prix que vous payez pour un raisonnement inutilisé. Concrètement, un grand modèle généraliste consacre, à chaque question, une partie de sa capacité de calcul à des mécanismes que la tâche ne sollicite pas.

Finalement, c’est comme si vous financiez un outil taillé pour l’exception, sur des usages qui relèvent de la routine.

Le ROI que vous ne calculez pas au moment du projet pilote

Un projet pilote impressionne toujours : la démonstration fonctionne, vos équipes adoptent l’outil, vous validez le budget. Le calcul du ROI intervient rarement à ce stade, et pour cause : le coût réel n’apparaît qu’à l’échelle, quand l’usage se généralise à plusieurs services.

Trois postes de coût s’additionnent alors, rarement présentés ensemble dans le même tableau :

  • La licence ou l’abonnement au fournisseur, facturé en continu et proportionnel au volume ;
  • L’exposition de vos données, qui transitent par l’infrastructure du fournisseur à chaque requête ;
  • Votre dépendance à ce fournisseur unique, qui peut modifier ses tarifs ou ses conditions d’accès sans aucun recours de votre côté… Un vrai risque lié à l’IA, parmi d’autres comme celui de la dette cognitive. 

Ce dernier poste de coûts ne se chiffre pas directement en euros, mais il pèse sérieusement sur votre décision : un outil devenu central dans vos processus métier, et dont la continuité ne dépend que d’un tiers, n’a pas le même profil de risque qu’un outil que vous hébergez et maîtrisez en interne.

Ce que change un modèle IA pensé pour votre entreprise

Un modèle généraliste est construit pour répondre à tout le monde, sur toutes les tâches imaginables. Cette polyvalence a un prix, et vous la payez intégralement, même quand vos besoins réels tiennent en quelques cas d’usage précis : interroger votre documentation interne, classer vos courriers entrants, orienter vos équipes vers la bonne procédure.

Un modèle spécialisé (SLM), entraîné sur votre vocabulaire, vos procédures et vos documents, inverse la logique de facturation. L’entraînement représente un coût ponctuel, réalisé une fois sur une infrastructure dédiée. Une fois déployé sur le matériel que vous possédez déjà (un poste, un serveur local), chaque question posée ne vous coûte plus rien à l’usage : pas de facturation au token, pas de processeur graphique à louer, pas de connexion obligatoire vers un tiers.

Reprenons votre assistant interne à 50 000 requêtes mensuelles : sur un an, la facture API d’un grand modèle généraliste tourne autour de 5 000 $, et continue de croître avec chaque nouveau cas d’usage que vous ajoutez. Un modèle spécialisé, sur ce même périmètre, ramène votre coût marginal par requête à un niveau proche de zéro une fois l’entraînement amorti. Le point de bascule se calcule cas par cas, mais il arrive presque toujours plus tôt que vous ne l’imaginez, dès que le volume dépasse quelques milliers de requêtes par mois sur un usage cadré.

En matière d’IA, la performance n’est pas toujours la bonne question

La question n’est pas de savoir quel modèle est le plus performant, mais quel modèle est suffisant, et adapté à vos besoins.

Dans les faits, un grand modèle généraliste garde toute sa pertinence sur les tâches ouvertes : du code complexe, un raisonnement inédit, une génération d’image. Mais sur des usages répétitifs et cadrés (la majorité de ceux que vous rencontrez au quotidien), un modèle dimensionné à la tâche vous coûte moins cher à l’usage et protège mieux vos données.

Cette réalité suppose un changement de réflexe : ne plus choisir le modèle le plus puissant disponible sur le marché, mais faire concevoir le modèle adapté à ce que vous cherchez réellement à accomplir. Un modèle entraîné sur vos données, hébergé selon vos contraintes, dimensionné pour vos volumes plutôt que pour ceux d’un fournisseur mondial.

Le ROI d’un projet IA ne se joue pas au moment de la démonstration. Il se joue dans le choix du modèle, avant même d’écrire la première ligne de code, et ce choix vous appartient !