Si deux scores de modèle proviennent de tâches, d’ensembles de données ou d’échafaudages d’agents différents, ils ne constituent pas un seul classement. Cette méthodologie de référence IA maintient les comparaisons utiles en rendant visibles les variables cachées.
Le but n’est pas de fabriquer un seul gagnant. L'objectif est de répondre à la vraie question d'un acheteur ou d'un ingénieur : quel système est suffisamment fiable pour ce flux de travail, à ce prix, avec ce niveau de supervision ?
Les cinq couches dont chaque partition a besoin
Avant d'enregistrer un numéro, capturez cinq couches :
- Tâche — Que devait faire le système : réparer un référentiel, modifier un fichier, résoudre un algorithme, répondre à une question scientifique ou faire fonctionner un terminal ?
- Ensemble de données – Quelles versions, plages de dates, combinaisons de langues et contrôles de contamination ont été utilisés ?
- Système — S'agissait-il d'un modèle brut, d'une configuration API, d'un assistant IDE ou d'un agent de codage avec des outils ?
- Metrique : le pourcentage de résultat résolu, la correspondance exacte, le taux de réussite, le taux de victoire, la latence, le coût ou un score de préférence humaine ?
- Preuve — Un lecteur peut-il inspecter la carte modèle, la ligne du classement, le papier ou le cahier de reproduction ?
Si l'un de ces champs est manquant, étiquetez le numéro comme étant incomplet plutôt que de le présenter comme une comparaison de modèle claire.
Classes sources séparées
La première décision éditoriale est la classification des sources. Gardez les lignes séparées même lorsqu'elles discutent du même modèle.
| Classe source | Ce que ça peut te dire | Ce qu'il ne peut pas prouver |
|---|---|---|
| Rapport de version du fournisseur | Tâches choisies par le fournisseur, configuration et résultat optimal | Que le même résultat sera transféré à votre flux de travail |
| Classement tiers | Une vision plus indépendante sous un harnais publié | Que chaque ligne utilise les mêmes outils ou budget d'inférence |
| Évaluation communautaire | Signaux rapides sur les modèles émergents et les frictions pratiques | Reproductibilité scientifique stable |
| Reproduction interne | Comment le modèle fonctionne dans votre environnement exact | Performance générale en dehors de votre échantillon de tâches |
La Comparaison de référence LLM utilise cette séparation dans ses tableaux. Les mesures des fournisseurs restent dans les lignes des fournisseurs ; Aider et SWE-bench restent liés à leurs propres contextes d’évaluation publique.
Enregistrez l'échafaudage, pas seulement le modèle
Les scores de codage agent incluent souvent la récupération, la sélection de fichiers, l'exécution du shell, les exécutions de tests, les tentatives, la réparation des correctifs et une politique d'approbation. Ces couches ne sont pas du bruit. Ils font partie du produit qu’une équipe adopte réellement.
Pour chaque référence d'agent, enregistrez :
- nom du modèle et version ;
- fenêtre contextuelle et mode de raisonnement ;
- outils disponibles pour le système ;
- règles de récupération ou d'indexation du référentiel ;
- nombre maximum de tours, de tentatives et de budget de jetons ;
- autorisations sandbox et réseau ;
- commande de test et politique de réussite/échec ;
- si un humain pourrait intervenir.
C'est pourquoi une Comparaison des outils d'agent IA appartient à côté des scores du modèle : l'interface modifie le résultat.
Utiliser des familles de référence adaptées aux tâches
Ne faites pas la moyenne des scores non liés dans un composite inventé. Utilisez la famille de référence qui ressemble au travail prévu.
| Décision | Preuve primaire | Preuve secondaire |
|---|---|---|
| Réparer un référentiel de production | SWE-bench ou un ensemble de problèmes internes | Taux de réussite des tests, temps de révision, taux de restauration |
| Effectuez des modifications multilingues propres | Évaluation des modifications de style Aider | Taille des différences, boucles de correction, coût par modification acceptée |
| Résoudre de nouveaux problèmes algorithmiques | Tests de style LiveCodeBench | Taux de compilation, temps de résolution, contrôles de contamination |
| Opérer un agent de terminal | Tâches de type Terminal-Bench | Demandes d'autorisation, taux de récupération, taux de prise de contrôle humaine |
| Sélectionnez un modèle de raisonnement | Benchmark mathématiques/sciences adapté au domaine | Calibrage, qualité des citations, gravité des erreurs |
Le répertoire des modèles AI est le point d'entrée canonique de cette carte de décision. Il devrait conduire les lecteurs vers une comparaison spécifique à une tâche plutôt que vers une affirmation générique du « meilleur modèle ».
Publier un registre des preuves
Un registre de preuves rend les actualisations vérifiables. Un enregistrement minimal ressemble à ceci :
textscore: 58.6% benchmark: SWE-Bench Pro source_type: vendor-reported source_url: https://example.com/model-card model: Example Model 1.0 scaffold: vendor agent, test execution enabled checked_at: 2026-08-20 reproducible: no public harness decision_use: directional signal only
Le champ
decision_useActualiser la cadence et modifier le contrôle
Utilisez une vérification de 7 jours pour les dernières versions du modèle, une vérification de 14 jours pour l'intégrité des sources et des liens et une révision de 28 jours pour l'ensemble de la page de comparaison. Une actualisation doit mettre à jour ensemble la date source, le tableau de scores, les mises en garde et la conclusion.
Ne mettez pas à jour une partition sans mettre à jour la prose qui l'entoure. Une nouvelle ligne de classement peut modifier la recommandation même si le graphique semble encore familier. Conservez le guide d'utilisation de Claw Code à proximité lorsque la comparaison est utilisée pour choisir un flux de travail d'agent plutôt qu'un modèle d'API brut.
Conclusion
Une comparaison de référence utile est un petit instrument de recherche. Il nomme la tâche, préserve la classe source, enregistre l'échafaudage, affiche la date et explique ce que le score ne peut pas prouver. C'est plus lent que de copier un titre de classement, mais cela produit une décision qui peut survivre à la prochaine version du modèle.