Étude comparative · détection d'anomalies tabulaires

Détecter l'anomalie sans nouveau modèle — reproduire, spécialiser, mesurer

Peut-on battre les détecteurs tabulaires de référence par la sélection et la spécialisation plutôt que par un nouveau modèle ? On reproduit le benchmark académique de référence (ADBench), puis on l'étend à 502 jeux de données regroupés par domaine métier pour y tester un routeur non supervisé, évalué avec une rigueur statistique stricte.

502
jeux de données · 19 domaines métier
440
sources indépendantes (regroupement anti-fuite)
72.8
AUROC×100 · headline pré-enregistré

La démarche

① ADBench (référence académique). 57 jeux de données, 30 algorithmes, NeurIPS 2022 — la référence quasi universelle du domaine. Notre reproduction confirme le constat du papier : aucun détecteur profond ne s'impose, IForest reste une base très difficile à battre.
② Notre extension. ADBench ne distingue pas les domaines métier — or la composition des variables change ce qui fonctionne. Sur 502 jeux curés, 19 domaines, un routeur non supervisé conditionné par domaine bat systématiquement la fusion plate, sous protocole LODO groupé par source (pré-enregistré).
③ Ouverture. Le gap restant vers l'oracle, la découverte que le scale-up naïf dégrade le système, un résultat différenciant sur le seuillage non supervisé, et la comparaison en cours à une baseline publiée concurrente.

Benchmark 1 · référence académique

ADBench Han, Hu, Huang, Jiang & Zhao — NeurIPS 2022

Premier benchmark de détection d'anomalies tabulaires à cette échelle : 57 jeux de données (47 tabulaires établis + 10 étendus vision/texte) évalués sur 30 algorithmes, près de 100 000 expériences. Collaboration Shanghai University of Finance and Economics × Carnegie Mellon University, ouvert, référence standard de nombreux travaux depuis.

Points forts

  • Échelle inédite lors de sa publication (57 ds × 30 modèles)
  • Protocole systématique et reproductible, code ouvert
  • Référence quasi universelle des papiers suivants sur le sujet

Limites connues

  • Beaucoup de jeux dérivent de la classification (classe rare rebaptisée « anomalie », pas une anomalie native) — 394/502 de notre propre corpus étendu, à titre d'indication de la prévalence de ce biais dans l'écosystème
  • Aucune notion de domaine métier — tous les jeux traités de façon homogène
  • Un seul régime d'évaluation, pas de test hors-distribution

Notre reproduction (47 jeux)

MétriqueAUROC / AUPR — moyennes sur 47 datasets
ModèleAUROCAUPR
★ Champion (nous)0.7890.408
MCD0.7760.398
IForest0.7620.388
COPOD0.7440.352
ECOD0.7420.358
HBOS0.7400.370
OUTFORMER référence externe0.926—

★ Notre système (méta-routeur label-free MRCD∪IForest∪KNN), seul à dépasser IForest de façon significative (+0.027, p=0.001, pré-enregistré). OUTFORMER (modèle fondation zero-shot, poids non publics) : score rapporté par ses auteurs sur ADBench, non reproduit ici.

Benchmark 2 · notre extension

Un benchmark par domaine, curé et vérifié

Corpus élargi filtré strictement : au moins 100 lignes et 3 variables, aucun jeu trivialement séparable (AUROC d'une forêt aléatoire supervisée ≤ 0.9995), dédoublonné, annoté natif vs proxy. Système évalué : un routeur non supervisé conditionné par domaine, en LODO groupé par source (jamais par jeu de données isolé).

502
jeux de données curés
19
domaines métier
108/502
anomalies natives (vs proxy)

Système routé vs les meilleures approches simples, par domaine

DomainenRouteur (nous)Spécialisé/domaineEnsemble fixeOracle
Médical4569.569.469.474.8
Pharma4058.358.757.561.7
Vision3582.080.180.183.4
Finance3269.969.169.173.5
Agriculture3275.076.073.383.8
Audio2877.475.274.885.6
Réseau2666.767.865.973.1
Environnement2674.570.764.780.3
Agroalimentaire2463.865.865.873.0
Industrie2379.479.277.982.8
Activité humaine2371.470.768.979.8
Énergie2375.577.875.384.5
Chimie2276.775.674.781.7
Transport2274.974.174.179.9
Matériaux2182.083.080.787.9
Éducation2165.764.164.074.8
Physique2077.476.476.284.0
Génomique2080.878.579.786.9
Texte1973.674.773.979.7
GLOBAL50272.7972.3171.3178.71

Oracle = sélection parfaite a posteriori (triche les labels de test, plafond théorique non déployable). Vert = meilleur de la ligne. Le routeur bat l'ensemble fixe de +1.48 et la spécialisation simple de +0.48 — protocole et chiffres pré-enregistrés avant réplication (29 jeux/sources scellés, jamais vus pendant le réglage).

Synthèse

Tous les constats tabulaire

Les expériences du volet tabulaire et leurs verdicts, y compris les négatifs.

✅
ADBench reproduit — MCD/IForest en tête, aucun ne domine
47 datasets
✅
Champion > IForest — méta-routeur MRCD∪IF∪KNN, seul à battre IF
+0.027 p=0.001
✅
Routeur source-strict > tuned-domaine — LODO groupé par source, jamais par dataset
72.8 vs 72.3
✅
Routeur > ensemble plat — spécialisation + routage fin battent la fusion
+1.48
❌
Extension +29 ds "faciles" — harvest ciblé regret : le scale-up naïf dégrade
−0.29, négatif documenté
✅
Séquestre scellé — 29 jeux/sources jamais vus, réservés à la réplication
#22
⏳
MetaOD (baseline concurrente) — reproduite sur notre corpus/protocole
verdict en cours
✅
Seuillage non supervisé — une constante calibrée bat 10 méthodes adaptatives testées
résultat différenciant

Enseignements

Ce que le tabulaire nous apprend

Principes dégagés dans la quête du meilleur score tabulaire.

Les méthodes simples restent dures à battre

IForest, vieux de plus de quinze ans, reste une base très difficile à battre en moyenne — aucun détecteur profond ne s'impose.

Le levier est la sélection, pas l'architecture

Router ou spécialiser par domaine bat toute fusion plate, de façon reproductible et significative.

Grouper par SOURCE, pas par jeu isolé

Deux jeux d'un même dépôt partagent du signal — les statistiques, folds et séquestres groupés par source évitent une fuite optimiste.

Qualité curée > volume brut

Étendre le corpus de 502 à 531 jeux (+29 « faciles ») a dégradé le routeur — un corpus plus grand mais moins discipliné peut activement nuire.

Natif vs proxy : une distinction qui compte

Beaucoup de jeux « anomalie » dérivent en réalité d'une classe rare de classification — la validité réelle d'un gain en dépend.

→ Voir le volet séries temporelles