Étude comparative · détection d'anomalies tabulaires
Détecter l'anomalie sans nouveau modèle — reproduire, spécialiser, mesurer
Peut-on battre les détecteurs tabulaires de référence par la sélection et la spécialisation plutôt que par un nouveau modèle ? On reproduit le benchmark académique de référence (ADBench), puis on l'étend à 502 jeux de données regroupés par domaine métier pour y tester un routeur non supervisé, évalué avec une rigueur statistique stricte.
La démarche
Benchmark 1 · référence académique
ADBench Han, Hu, Huang, Jiang & Zhao — NeurIPS 2022
Premier benchmark de détection d'anomalies tabulaires à cette échelle : 57 jeux de données (47 tabulaires établis + 10 étendus vision/texte) évalués sur 30 algorithmes, près de 100 000 expériences. Collaboration Shanghai University of Finance and Economics × Carnegie Mellon University, ouvert, référence standard de nombreux travaux depuis.
Points forts
- Échelle inédite lors de sa publication (57 ds × 30 modèles)
- Protocole systématique et reproductible, code ouvert
- Référence quasi universelle des papiers suivants sur le sujet
Limites connues
- Beaucoup de jeux dérivent de la classification (classe rare rebaptisée « anomalie », pas une anomalie native) — 394/502 de notre propre corpus étendu, à titre d'indication de la prévalence de ce biais dans l'écosystème
- Aucune notion de domaine métier — tous les jeux traités de façon homogène
- Un seul régime d'évaluation, pas de test hors-distribution
Notre reproduction (47 jeux)
| Modèle | AUROC | AUPR |
|---|---|---|
| ★ Champion (nous) | 0.789 | 0.408 |
| MCD | 0.776 | 0.398 |
| IForest | 0.762 | 0.388 |
| COPOD | 0.744 | 0.352 |
| ECOD | 0.742 | 0.358 |
| HBOS | 0.740 | 0.370 |
| OUTFORMER référence externe | 0.926 | — |
★ Notre système (méta-routeur label-free MRCD∪IForest∪KNN), seul à dépasser IForest de façon significative (+0.027, p=0.001, pré-enregistré). OUTFORMER (modèle fondation zero-shot, poids non publics) : score rapporté par ses auteurs sur ADBench, non reproduit ici.
Benchmark 2 · notre extension
Un benchmark par domaine, curé et vérifié
Corpus élargi filtré strictement : au moins 100 lignes et 3 variables, aucun jeu trivialement séparable (AUROC d'une forêt aléatoire supervisée ≤ 0.9995), dédoublonné, annoté natif vs proxy. Système évalué : un routeur non supervisé conditionné par domaine, en LODO groupé par source (jamais par jeu de données isolé).
Système routé vs les meilleures approches simples, par domaine
| Domaine | n | Routeur (nous) | Spécialisé/domaine | Ensemble fixe | Oracle |
|---|---|---|---|---|---|
| Médical | 45 | 69.5 | 69.4 | 69.4 | 74.8 |
| Pharma | 40 | 58.3 | 58.7 | 57.5 | 61.7 |
| Vision | 35 | 82.0 | 80.1 | 80.1 | 83.4 |
| Finance | 32 | 69.9 | 69.1 | 69.1 | 73.5 |
| Agriculture | 32 | 75.0 | 76.0 | 73.3 | 83.8 |
| Audio | 28 | 77.4 | 75.2 | 74.8 | 85.6 |
| Réseau | 26 | 66.7 | 67.8 | 65.9 | 73.1 |
| Environnement | 26 | 74.5 | 70.7 | 64.7 | 80.3 |
| Agroalimentaire | 24 | 63.8 | 65.8 | 65.8 | 73.0 |
| Industrie | 23 | 79.4 | 79.2 | 77.9 | 82.8 |
| Activité humaine | 23 | 71.4 | 70.7 | 68.9 | 79.8 |
| Énergie | 23 | 75.5 | 77.8 | 75.3 | 84.5 |
| Chimie | 22 | 76.7 | 75.6 | 74.7 | 81.7 |
| Transport | 22 | 74.9 | 74.1 | 74.1 | 79.9 |
| Matériaux | 21 | 82.0 | 83.0 | 80.7 | 87.9 |
| Éducation | 21 | 65.7 | 64.1 | 64.0 | 74.8 |
| Physique | 20 | 77.4 | 76.4 | 76.2 | 84.0 |
| Génomique | 20 | 80.8 | 78.5 | 79.7 | 86.9 |
| Texte | 19 | 73.6 | 74.7 | 73.9 | 79.7 |
| GLOBAL | 502 | 72.79 | 72.31 | 71.31 | 78.71 |
Oracle = sélection parfaite a posteriori (triche les labels de test, plafond théorique non déployable). Vert = meilleur de la ligne. Le routeur bat l'ensemble fixe de +1.48 et la spécialisation simple de +0.48 — protocole et chiffres pré-enregistrés avant réplication (29 jeux/sources scellés, jamais vus pendant le réglage).
Synthèse
Tous les constats tabulaire
Les expériences du volet tabulaire et leurs verdicts, y compris les négatifs.
Enseignements
Ce que le tabulaire nous apprend
Principes dégagés dans la quête du meilleur score tabulaire.
Les méthodes simples restent dures à battre
IForest, vieux de plus de quinze ans, reste une base très difficile à battre en moyenne — aucun détecteur profond ne s'impose.
Le levier est la sélection, pas l'architecture
Router ou spécialiser par domaine bat toute fusion plate, de façon reproductible et significative.
Grouper par SOURCE, pas par jeu isolé
Deux jeux d'un même dépôt partagent du signal — les statistiques, folds et séquestres groupés par source évitent une fuite optimiste.
Qualité curée > volume brut
Étendre le corpus de 502 à 531 jeux (+29 « faciles ») a dégradé le routeur — un corpus plus grand mais moins discipliné peut activement nuire.
Natif vs proxy : une distinction qui compte
Beaucoup de jeux « anomalie » dérivent en réalité d'une classe rare de classification — la validité réelle d'un gain en dépend.