Fuite de données
Un modèle a déjà rencontré les réponses pendant l’entraînement ou l’optimisation.
Benchmarks tenus à l’écart, reproductibilité, coûts et robustesse : des critères concrets pour juger chaque résultat.
LA DISCIPLINE DES INDICATEURS
Une amélioration est crédible si elle survit aux comparaisons, à la réplication et au changement de contexte.
Le résultat répond-il vraiment au problème posé ? Les tests sont-ils adaptés ?
Le succès tient-il quand les données, contraintes et formulations changent ?
Combien de temps, d’appels, de calcul et d’énergie pour cette réussite ?
Une équipe indépendante obtient-elle des résultats comparables ?
EXEMPLE DE GRILLE — NON RÉSULTAT RÉEL
Une publication issue de la future plateforme pourrait afficher la fiche ci-contre. Les éléments présentés sont des critères à renseigner, pas des scores actuellement obtenus.
Sans jeu de test inédit ni description des erreurs, un résultat flatteur ne permet pas de conclure.
LES BONNES QUESTIONS
Un modèle a déjà rencontré les réponses pendant l’entraînement ou l’optimisation.
Une méthode progresse sur un benchmark mais régresse sur des problèmes différents.
Seuls les essais réussis sont montrés ; les échecs et coûts restent invisibles.
Un agent travaille longtemps sans supervision, mais ne termine pas correctement la tâche.
Travaux de tiers, cités pour éclairer le domaine. Ils ne sont pas des réalisations d’AI4ASI.