Étude comparative · détection d'anomalies en séries temporelles
Le SOTA d'un benchmark généralise-t-il hors de son cadre ?
On reproduit le benchmark de référence le plus récent du domaine (TSB-AD), on y confirme deux modèles publiés au sommet du classement, puis on teste s'ils tiennent leur rang sur un corpus étendu, curé par mécanisme d'anomalie plutôt que par simple label.
La démarche
Benchmark 1 · référence académique
TSB-UAD Paparrizos et al., VLDB 2022 → TSB-AD Liu & Paparrizos, NeurIPS 2024
TSB-UAD (2022) : première tentative sérieuse de standardiser l'évaluation en TSAD — 12 686 séries, univariées uniquement. Jugé trop léger par la communauté : univarié seul, métriques contestées, pratiques de benchmarking incohérentes d'un papier à l'autre. TSB-AD (« The Elephant in the Room ») a repris le problème à la racine : 1070 séries méticuleusement curées sur 40 jeux (le double de la plus grande collection précédente), univarié (U) et multivarié (M), split Tuning/Éval strict, et établit VUS-PR comme métrique la plus fiable du domaine.
Points forts (TSB-AD)
- Curation méticuleuse, perception humaine + interprétation modèle
- Couverture univarié + multivarié, split Tuning/Éval strict
- Choix de métrique justifié empiriquement (VUS-PR)
Limites qui motivent notre extension
- Domaines d'origine mélangés sans conditionnement métier explicite
- Couverture par mécanisme d'anomalie inégale selon les domaines
Meilleurs modèles publiés du papier
| Multivarié (M) | VUS-PR publié |
|---|---|
| CNN | 0.313 |
| OmniAnomaly | 0.312 |
| PCA | 0.310 |
| LSTMAD | 0.307 |
| USAD | 0.304 |
| Univarié (U) | VUS-PR publié |
|---|---|
| Sub-PCA | 0.423 |
| KShapeAD | 0.401 |
| POLY | 0.390 |
| MOMENT-ZS | 0.379 |
| KMeansAD | 0.366 |
Validation bit-exacte de notre harnais : Sub-PCA 0.4234=publié, Sub-KNN 0.3501=publié, POLY 0.3899 vs 0.3898 publié (350/350 séries U) ; CNN 0.3171 vs 0.313 publié (M).
Reproduire, puis dépasser — deux modèles récents, papier + code vérifiés
PaAno
Patches temporels + CNN 1D + perte triplet/pretext, léger, natif multivarié. 1er sur les 6 métriques du papier en multivarié.
AxonAD
Architecture TCN-Transformer à dynamique de requête prédictible. Modèle externe, non issu de TSB-AD lui-même, ajouté à notre comparatif.
Score global sur TSB-AD-M (169 séries, protocole interne uniforme)
| Système | VUS-PR | VUS-ROC |
|---|---|---|
| AxonAD Özer et al., ECML-PKDD 2026 | 0.457 | 0.878 |
| PaAno Park & Kang, ICLR 2026 | 0.360 | 0.780 |
| Rail spectral nous, analytique | 0.382 | 0.781 |
Ancre papier PaAno (protocole officiel intégral, 179 séries Éval) : 0.412 vs 0.426 publié — reproduction quasi exacte. AxonAD dépasse ici les meilleurs modèles publiés de TSB-AD (CNN 0.313) : à interpréter comme un modèle externe plus récent, pas un score officiel du papier.
Benchmark 2 · notre extension
Ce qui change quand on sort du cadre du papier
Filtrage strict : non-trivialité (rejet si un détecteur naïf dépasse déjà VUS-PR 0.90), densité d'anomalie ≤ 30 %, longueur minimale 300 points, rejet des séries à anomalie unique collée en fin de série, priorité au natif. Taxonomie validée statistiquement (test de permutation, p<0.001), charte ≥ 3 sources indépendantes par catégorie.
8 mécanismes, 18 catégories métier
Résultats — AxonAD vs PaAno vs rail spectral, par catégorie
| Catégorie | n | AxonAD | PaAno | Spectral | Oracle |
|---|---|---|---|---|---|
| Aérospatial | 170 | 0.260 | 0.329 | 0.289 | 0.449 |
| Serveurs / IT Ops | 61 | 0.630 | 0.522 | 0.495 | 0.669 |
| Médical — neuro (EEG) | 40 | 0.412 | 0.209 | 0.499 | 0.556 |
| Industriel SCADA | 34 | 0.323 | 0.053 | 0.044 | 0.324 |
| Médical — cardiaque | 33 | 0.292 | 0.453 | 0.315 | 0.495 |
| Eau / environnement | 26 | 0.655 | 0.589 | 0.681 | 0.752 |
| Activité (wearables) | 26 | 0.222 | 0.376 | 0.170 | 0.410 |
| Robotique / drones | 22 | 0.801 | 0.994 | 0.558 | 0.995 |
| Énergie — bâtiment | 22 | 0.280 | 0.320 | 0.348 | 0.453 |
| Éolien / solaire | 17 | 0.167 | 0.280 | 0.071 | 0.316 |
| Vibration machines | 4 | 0.349 | 0.927 | 0.586 | 0.927 |
| GLOBAL | 455 | 0.375 | 0.385 | 0.344 | — |
Vert = meilleur de la ligne. Oracle = plafond théorique par sélection parfaite.
Routage vers le meilleur système — à froid vs calibré
| Catégorie | n | AxonAD | PaAno | Spectral | Notre système | Δ vs PaAno | Oracle |
|---|---|---|---|---|---|---|---|
| Aérospatial | 128 | 0.283 | 0.312 | 0.346 | 0.346 | +0.034 | 0.465 |
| Serveurs / IT Ops | 61 | 0.630 | 0.522 | 0.504 | 0.630 | +0.108 | 0.674 |
| Industriel SCADA | 34 | 0.323 | 0.053 | 0.052 | 0.323 | +0.270 | 0.324 |
| Médical — cardiaque | 33 | 0.292 | 0.453 | 0.316 | 0.453 | +0.000 | 0.496 |
| Activité (wearables) | 26 | 0.222 | 0.376 | 0.179 | 0.376 | +0.000 | 0.410 |
| Éolien / solaire | 13 | 0.130 | 0.151 | 0.052 | 0.097 | -0.054 | 0.193 |
| Médical — neuro (EEG) | 11 | 0.245 | 0.153 | 0.408 | 0.408 | +0.255 | 0.488 |
| Robotique / drones | 6 | 0.856 | 0.985 | 0.549 | 0.985 | +0.000 | 0.985 |
| Eau / environnement | 3 | 0.403 | 0.443 | 0.408 | 0.307 | -0.136 | 0.658 |
| GLOBAL | — | 0.355 | 0.348 | — | 0.418 | +0.070 | 0.492 |
COLD — source jamais vue. Le routage a priori par catégorie ne bat pas de façon fiable le défaut PaAno : le membre optimal est spécifique au dataset, pas prévisible depuis la seule catégorie. Défaut robuste recommandé = PaAno.
Synthèse
Tous les constats séries temporelles
L'ensemble des expériences TSAD et leur verdict, y compris les corrections méthodologiques.
Enseignements
Ce que ces études nous apprennent
Les principes dégagés dans la quête du meilleur score TSAD.
Aucun détecteur universel
La complémentarité entre systèmes est réelle et mesurée : chacun domine sur des catégories différentes, pas juste en théorie.
Le SOTA d'un benchmark n'est pas le SOTA du monde réel
L'écart de généralisation observé sur les catégories natives ajoutées est concret, pas une hypothèse.
Le conditionnement par domaine est le levier qui marche
Pas une architecture plus grosse, ni une fusion moyenne — la spécialisation par mécanisme d'anomalie.
Le warm-start est le vrai levier déployable
À froid, le routage par catégorie ne bat pas le défaut PaAno de façon fiable. Dès que quelques séries de la source cible sont étiquetées (scénario de flotte instrumentée), le routage calibré le bat nettement — réaliste en monitoring réel.
Le choix de métrique compte
VUS-PR change les classements par rapport à des métriques ponctuelles naïves — c'est aussi la conclusion du papier TSB-AD.
La rigueur du protocole change les conclusions
Deux biais silencieux (split, normalisation) corrigés cette session ont chacun déplacé des résultats déjà considérés acquis.
La donnée native, diverse par mécanisme, reste le vrai goulot
Plus que le modèle — plusieurs catégories métier restent sous la charte de 3 sources indépendantes.