Comment on évalue
Les quatre barreaux
L’échelle est fixe et identique sur toutes les fiches. Elle ne mesure pas la qualité d’une solution, elle mesure son poids : ce qu’il faut mettre en marche, faire tourner, surveiller et payer pour obtenir le résultat.
N0 — Règle et algorithme classique. Une expression régulière, une requête, un automate, un parseur, un tri. Le code fait exactement ce qu’il dit, à chaque fois, et vous pouvez le lire en entier.
N1 — Modèle classique léger. Une régression logistique, un TF-IDF, un gradient boosting, des plus proches voisins. Un modèle assez petit pour être versionné à côté du code qui s’en sert, entraîné sur vos données, et qui tourne sur un processeur ordinaire.
N2 — Petit modèle spécialisé auto-hébergé. Un encodeur distillé, un modèle d’embeddings, un moteur de reconnaissance optique, un modèle de traduction. Il pèse des centaines de mégaoctets, il tourne chez vous, et il fait une chose.
N3 — API de modèle généraliste. Un appel à un fournisseur externe. Le modèle sait tout faire à peu près, rien exactement, et il ne vous appartient pas.
Tous les barreaux ne sont pas présents sur toutes les fiches. Un barreau absent est marqué absent, avec une raison courte et réelle. Il n’est jamais laissé vide : une case vide se lit comme un oubli, pas comme une décision.
Comment un verdict est déterminé
Le verdict est le barreau le plus léger qui fait le travail correctement, pour le cas d’usage le plus courant du besoin.
Trois questions, dans cet ordre :
- Est-ce que ce barreau fait vraiment le travail ? Pas « à peu près », pas « dans la plupart des cas si on ne regarde pas de trop près ». Le point de rupture de chaque barreau est écrit sur la fiche, et il est démontré par un test qui échoue exprès.
- Est-ce que le barreau suivant apporte quelque chose que celui-ci ne peut pas ? Si la réponse est non, le barreau suivant est du poids ajouté sans contrepartie.
- Est-ce que ce que ça coûte en retour est acceptable ? Sortie de données, perte de déterminisme, dépendance à un fournisseur, périmètre réglementaire.
Le badge « recommandé » peut se poser sur n’importe quel barreau, y compris N3. Certaines fiches recommandent franchement un modèle généraliste, parce que c’est la bonne réponse. Ce sont elles qui rendent crédibles celles qui recommandent l’inverse.
Quand un verdict dépend d’une condition, la fiche le dit dans sa justification. Un verdict n’est pas une prescription universelle, c’est un point de départ argumenté.
Comment le code est vérifié
Aucune fiche n’est publiée si son code n’a pas été exécuté. C’est la règle la plus importante du projet.
Chaque extrait vit dans un fichier réel du dépôt, avec un test à côté de lui. La fiche importe le fichier, elle ne contient pas de code recopié. Si un test échoue, le site ne se construit pas.
Deux niveaux de preuve sont possibles, et chaque extrait déclare le sien, affiché au-dessus du code :
Code exécuté tel quel. L’extrait tourne avec ses vraies dépendances, et son test tourne à chaque construction du site. C’est le cas de tous les barreaux N0 et N1.
Code exécuté, service externe simulé. L’extrait tourne, mais son test remplace le service externe par un double local. C’est le cas des barreaux N2 et N3 : télécharger un modèle de plusieurs centaines de mégaoctets à chaque construction, ou appeler une API payante, n’est pas tenable. Ce que le test vérifie alors : la requête construite, la réponse décodée, les cas d’erreur. Ce qu’il ne vérifie pas : la qualité de la réponse du modèle. C’est dit sur la page, sous chaque extrait concerné.
Nous préférons une preuve partielle affichée comme telle à une preuve complète affirmée sans l’être.
Pourquoi il n’y a pas de prix
Les tarifs des fournisseurs changent tous les trimestres, et pas toujours dans le sens qu’on croit. Une valeur absolue écrite aujourd’hui serait fausse dans six mois, et une fiche fausse jette le doute sur toutes les autres.
Les coûts sont donc exprimés en ordres de grandeur, avec un vocabulaire fixe :
| Terme | Ce qu’il veut dire |
|---|---|
| nul | aucun coût marginal |
| négligeable | moins d’un euro par million d’opérations |
| faible | de l’ordre de l’euro par million d’opérations |
| modéré | de l’ordre de la dizaine d’euros par million d’opérations |
| élevé | de l’ordre de la centaine d’euros par million d’opérations, ou plus |
Les latences suivent le même principe, avec cinq classes : <1 ms, ~10 ms, ~100 ms,
~1 s, >1 s.
Ce vocabulaire est volontairement grossier. Il suffit pour décider, et il ne périme pas.
Comment l’empreinte est estimée
Ce sont des estimations, et une mesure exacte est impossible côté client d’une API.
Quand vous appelez un modèle chez un fournisseur, vous ne connaissez ni le matériel employé, ni le taux de remplissage du serveur, ni la part de l’entraînement à amortir sur votre requête, ni le mix électrique du centre de données à cet instant. Le fournisseur, lui, les connaît, et ne les publie pas. Toute personne qui vous annonce des grammes de CO₂ par requête d’API vous donne le résultat d’un modèle d’estimation, pas une mesure.
Overkill n’annonce donc aucun chiffre d’empreinte. Les fiches emploient des ordres de grandeur relatifs : négligeable, faible, modérée, élevée. Ils comparent les barreaux entre eux sur une même tâche, ce qui est la seule comparaison que nous puissions faire honnêtement.
Ces ordres de grandeur s’appuient sur les travaux publiés suivants, cités nommément :
- Green Algorithms, Lannelongue, Grealey et Inouye, Advanced Science, 2021 — une méthodologie et un calculateur pour estimer l’empreinte d’un calcul à partir du matériel, de la durée et du lieu. green-algorithms.org
- Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model, Luccioni, Viguier et Ligozat, 2022 — l’une des rares études publiées qui décompose entraînement, fabrication du matériel et inférence pour un grand modèle de langue. arxiv.org/abs/2211.02001
- Software Carbon Intensity, Green Software Foundation — une spécification pour calculer l’intensité carbone d’un logiciel, devenue la norme ISO/IEC 21031. sci.greensoftware.foundation
- AFNOR SPEC 2314, Référentiel général pour l’IA frugale, 2024 — un cadre français pour évaluer et réduire l’impact environnemental d’un système d’intelligence artificielle. normalisation.afnor.org
- Boavizta — des données et des outils ouverts sur l’impact environnemental du numérique, matériel compris. boavizta.org
Si vous constatez qu’un ordre de grandeur d’une fiche contredit l’une de ces sources, c’est une erreur de notre part et nous voulons le savoir.
Pourquoi la couleur des barreaux n’exprime pas de jugement
L’échelle des barreaux est une rampe de neutres chauds, du plus clair au plus foncé. Ce n’est pas un dégradé du vert au rouge, et ce ne le sera jamais.
Un dégradé vert-rouge dirait « N0 c’est bien, N3 c’est mal ». C’est faux, et ce serait le contraire du propos de ce site. Un modèle généraliste appelé sur la bonne tâche est un bon choix d’ingénierie. Une expression régulière employée là où elle ne peut pas tenir est un mauvais choix, quelle que soit sa légèreté.
La rampe mesure le poids, c’est-à-dire une quantité, pas une valeur. La seule couleur qui porte un jugement sur ce site est le vert du badge « recommandé », et ce badge se pose sur le barreau qui convient au besoin, quel qu’il soit.
Ce que nous ne faisons pas
Nous n’écrivons pas de conseil juridique. Le bloc « périmètre réglementaire » de chaque barreau décrit, de façon factuelle et datée, ce que l’approche vous fait entrer dans le périmètre de, et ce dont elle ne vous dispense pas. Aucune fiche ne dit à personne qu’il est conforme ou non. C’est une information générale ; faites valider votre situation par un professionnel.
Nous ne comparons pas les fournisseurs. Le site n’a ni publicité, ni partenariat, ni programme d’affiliation, et il n’en aura pas. Quand une fiche nomme un outil, c’est parce que le code en a besoin pour tourner, pas parce qu’on le recommande.
Nous ne mesurons pas notre audience. Aucun cookie, aucun traceur, aucune ressource tierce. Le poids de chaque page est affiché en pied de page, calculé à la construction du site.
Nous n’appelons aucune API de modèle depuis le site. Le site ne contient pas d’IA. Ce n’est pas une contrainte technique, c’est un argument.
Comment signaler une erreur
Une fiche fausse est plus nuisible qu’une fiche absente. Si vous en trouvez une :
- ouvrez une issue sur le dépôt, en citant la fiche et le point contesté
- ou écrivez directement, si vous préférez ne pas passer par le dépôt
Une correction de fond est traitée avant tout ajout de contenu. Si vous avez raison, la fiche change, et la date de révision avec elle.
Révisée le