Deux phases, cinq étapes chacune

Évaluer une solution IA avant de l'acheter, puis avant de la déployer.

Les démonstrations fournisseurs se ressemblent toutes et se passent toujours bien. Elles ne disent rien de ce qui compte : le comportement de la solution sur vos données, vos cas limites et vos volumes. Methodia est la méthode que j'applique pour trancher sur des faits observés plutôt que sur une impression favorable, d'abord sur le marché, ensuite chez vous.

Transposable à tout secteur et à tout type de solution. À la fin de la mission, la grille et le jeu d'évaluation restent chez vous.

Le problème

Acheter sur la foi d'une démonstration, c'est acheter à l'aveugle.

Une démonstration est un objet préparé. Elle est jouée sur des exemples choisis par celui qui vend, dans un ordre choisi par lui, sur une version qu'il maîtrise. Elle prouve que la solution sait faire ce qu'on lui a appris à montrer. Elle ne dit rien de la suite.

Le coût de l'erreur, lui, ne se révèle qu'une fois le déploiement engagé : quand les cas réels arrivent, quand les volumes montent, quand un cas ambigu tombe sur un agent qui doit rendre une décision. À ce moment, le contrat est signé et le projet est lancé.

Puis vient le second piège, celui d'après. La solution est choisie, une expérimentation démarre, les premiers retours sont encourageants, et plus personne ne sait à quelle condition on arrêterait. L'expérimentation s'installe, devient un service de fait sans budget ni propriétaire, et la décision finit par se prendre toute seule, sans avoir jamais été prise.

La difficulté n'est technique dans aucun des deux cas, elle est méthodologique. Personne ne manque d'outils pour tester. Ce qui manque, c'est un protocole qui rende les résultats comparables et opposables, et des critères de décision fixés avant d'avoir vu les résultats.

Les trois pièges les plus fréquents

  • Le jeu de test fourni par l'éditeur. Il est calibré sur ce que la solution sait faire. Qui construit le jeu décide de qui gagne.
  • Le passage unique. Un système génératif ne répond pas deux fois exactement pareil. Une bonne réponse observée une fois n'est pas une bonne réponse.
  • Les critères réécrits après coup. On découvre à la fin que la vraie valeur du projet était ailleurs, précisément là où les résultats sont bons.
La méthode

Deux phases. La première dit quoi choisir, la seconde dit s'il faut y aller.

Chaque étape a un livrable et un critère de passage. On ne passe pas à la suivante parce que le calendrier l'impose, on passe parce que le critère est rempli.

Phase 1 En amont, sur le marché Que vaut ce qui existe, et laquelle de ces solutions mérite qu'on aille plus loin ?
1

Qualifier la maturité avant de comparer

L'échelle TRL pour situer une technologie et éviter de traiter un sujet de recherche comme un produit disponible. Beaucoup de projets échouent parce qu'ils étaient prématurés, pas parce qu'ils étaient mal conduits.

2

Construire un jeu d'évaluation ancré sur le métier

Le jeu se constitue avec vos experts, à partir de cas réels et notamment des cas difficiles et ambigus, jamais à partir des exemples fournis par l'éditeur.

3

Faire concourir les solutions sur un protocole identique

Mêmes entrées, mêmes critères, plusieurs passages. Qualité de la réponse, couverture fonctionnelle, robustesse aux cas limites, coût à l'usage, conformité.

4

Itérer en campagnes successives

Une campagne unique mesure un instant, sur un état de version. Plusieurs campagnes mesurent une trajectoire, et c'est la trajectoire qui permet de s'engager sur plusieurs années.

5

Produire un livrable décisionnel

Une grille comparée, une recommandation argumentée et les conditions de réussite. Pas un rapport de tests que personne ne lit.

Jalon : une solution est retenue, ou aucune ne l'est.

Si aucune ne l'est, la démarche s'arrête ici et elle a fait son travail, pour le prix d'une évaluation.

Phase 2 Chez vous, en conditions réelles La solution retenue tient-elle dans votre organisation, et faut-il l'industrialiser ?
1

Cadrage

Une note courte qui pose l'enjeu, le périmètre et les indicateurs de décision, fixés dès le départ. On passe quand l'enjeu est formulé de façon vérifiable, pas seulement intéressante.

2

Diagnostic

État des lieux partagé de l'organisation, des données, de la technologie et des contraintes réglementaires. On passe quand les options sont réduites à celles qui méritent un test réel.

3

Expérimentation ciblée

Une hypothèse précise, un périmètre limité, un délai borné, un protocole explicite. On passe quand des résultats observables existent, favorables ou non.

4

Évaluation mesurée

Grille renseignée sur la faisabilité, l'impact métier réel, la maturité et les risques, confrontée aux critères du cadrage, sans les réécrire après coup.

5

Décision : industrialiser, ajuster ou arrêter

Une note argumentée, qui vaut autant si elle conclut à l'arrêt. L'arrêt documenté est une décision de gestion, pas un échec à dissimuler.

Ce que vous avez à la fin

  • Le jeu d'évaluation
    Les cas réels, la vérité de référence établie par vos experts.
  • La grille renseignée
    Les critères, les poids, les notes et le cas qui porte chaque note.
  • Le protocole
    De quoi rejouer la campagne l'an prochain, avec ou sans moi.
  • Les deux notes de décision
    Quelle solution retenir, puis faut-il l'industrialiser et à quelles conditions.
La méthode est transposable à tout secteur et à tout type de solution. Je vous laisse la grille pour conduire vos évaluations suivantes sans moi.
Le terrain

Cette méthode n'a pas été écrite pour un site, elle a été construite en la pratiquant.

Appliquée à des sujets très différents au sein d'une DSI de 1 500 personnes, avec les équipes métier concernées.

5

campagnes successives d'évaluation de grands modèles de langage pour l'aide à l'indemnisation, sur un jeu de 129 questions

9

solutions de reconnaissance vocale comparées sur un protocole identique

4

plateformes low code comparées avant engagement

TRL

qualification d'une technologie de langue des signes sur l'échelle de maturité, avant toute comparaison

Ces travaux ont surtout servi à écarter des solutions séduisantes en démonstration, et à sécuriser celles qui sont effectivement passées en production. Une évaluation qui conclut à l'arrêt est une décision de gestion, pas un échec.

La grille

Un outil, pas une plaquette.

La promesse de la méthode est que vous puissiez la rejouer sans moi. Autant commencer tout de suite : la page suivante contient le constructeur de grille. Vous choisissez les familles de critères, vous ajustez les poids, vous nommez les solutions candidates, et vous repartez avec un fichier prêt à remplir.

Tout se passe dans votre navigateur. Aucune donnée n'est transmise, aucune inscription n'est demandée, aucun compte n'est créé.

Les six familles de critères

  • Qualité de la réponse
  • Couverture fonctionnelle
  • Robustesse aux cas limites
  • Coût à l'usage
  • Conformité
  • Réversibilité, dépendance et souveraineté
La position

Un évaluateur qui vend la solution qu'il évalue n'évalue rien.

C'est la raison d'être de cette page. Le seul intérêt que j'ai dans le résultat de votre évaluation, c'est qu'il soit juste.

Ce que je ne fais pas

  • Pas de développement
  • Pas de revente de solution
  • Pas de partenariat éditeur, pas de commission d'apport
  • Pas de reconduction automatique
  • Pas de publication de vos résultats, sous aucune forme

Une décision à prendre, et une démonstration qui s'est bien passée.

Un premier échange de trente minutes suffit à dire si la méthode s'applique à votre cas, sur quelle phase, et dans quel délai. S'il n'y a pas matière, je le dis à ce moment.