🎯 Profil
Data Scientist avec double compétence modélisation + production, spécialisé en détection d’anomalies et MLOps.
Parcours atypique : reconversion armée → commerce → data science (2021-2024)
🏆 Faits Marquants
Compétitions Kaggle
- 35+ compétitions complétées
- 3 compétitions top 1% mondial
- Meilleur classement : #14 / 3 022 équipes (Top 0.5%)
Recherche compositionnelle — détection d’anomalies
- Ancres reproduites : ADBench (47 datasets) et TSB-AD (égalités exactes au publié)
- PaAno (ICLR 2026) intégré et certifié sur TSB-AD : #1 des volets U et M
- Routeur source-strict : 502 jeux / 19 domaines, +1,48 pt AUROC sur l’ensemble fixe de 18 détecteurs (pré-enregistré, LODO groupé par source)
MLOps
- Système temps réel : DAG 9 workers, Redis, Docker
- Dashboard : 40+ pages Streamlit avec rôles RASCI
- Observabilité : Prometheus, Grafana, SLA tracking
🎓 Formation
Master 2 - Data Scientist (2023-2024)
OpenClassrooms + Centrale Supélec
7 projets validés · Alternance MICHELIN (12 mois)
Master 1 - Data Analyst (2021-2022)
OpenClassrooms + ENSAE
10 projets validés
🛠️ Stack Technique
Langages
Python (avancé) · SQL · Rust
Machine Learning
- Classique : Scikit-learn, XGBoost, LightGBM, CatBoost
- Deep Learning : PyTorch, TensorFlow, HuggingFace, RealMLP
- Time Series : Statsmodels, Prophet, LSTM, AnomalyTransformer
- Modèles physiques : chimie-transport (CAMS, CHIMERE, GEOS-CF) — post-traitement de sorties
- LLMs : évaluation, orchestration, revue croisée de résultats
- Modèles pré-entraînés : transfer learning, fine-tuning
- Calcul GPU : CUDA
LLMs utilisés
Claude · ChatGPT · Grok · Kimi K3 · Gemini · Mistral
Agentic
Claude Code · Codex · OpenCode
MLOps & Infrastructure
- Containerisation : Docker, Docker Compose
- Orchestration : Redis, DAG event-driven
- Monitoring : Prometheus, Grafana
- Dashboard : Streamlit (40+ pages)
Data Engineering
- DataFrames : Pandas, Polars, NumPy
- Stockage : Parquet, PostgreSQL, S3/MinIO
- Versioning : Git, DVC, MLflow
💼 Expérience
Alternance Data Scientist - MICHELIN (2023-2024)
POC Parsing/Matching de Données Complexes
- Gestion de données pricing mondial (niveau continental)
- Augmentation considérable du taux de détection des correspondances
- Dashboards Power BI pour équipe pricing
- Tests automatisés (PyTest)
Feedback : “Force de proposition, assidu dans les missions. POC parsing/mapping mené avec succès.”
Data Scientist / ML Engineer - DELTAMU (2024-2025)
Recherche en détection d’anomalies — capteurs industriels (pharma)
- Tests de recherche en clustering et détection d’anomalies, plusieurs centaines de capteurs
- Nouvel algorithme de détection, validé par le responsable scientifique
- Analyses statistiques avancées sur ensemble de bon fonctionnement
- Cœur calculatoire haute vitesse optimisé en Rust
- Caractérisation des régimes de fonctionnement sur plusieurs centaines de capteurs
Feedback : “Réelle passion pour la data science et les algorithmes d’IA. Investissement dans les missions. Contribution active au produit logiciel.” — Nuno DOS REIS, Président, DELTAMU
📊 Projets Phares
🌬️ Correction Apprise des Prévisions de Qualité de l’Air
Apprendre l’erreur du modèle européen, et la retirer — 36 mois, 28 M de mesures horaires, 4 polluants
- Prévoir là où personne ne mesure : aucune observation du lieu corrigé n’entre dans le modèle, et il est testé sur des stations et des mois qu’il n’a jamais vus
- −39,6 % d’erreur sur le NO₂, −20,2 % sur les PM10, −17,9 % sur l’ozone, −11,8 % sur les PM2,5
- En 2030 l’Europe divise ses seuils par deux : à pollution inchangée, les stations en dépassement passent de 6 à 109, et 4 départements d’Occitanie n’ont aucune station pour le constater
- Utilisable au sens réglementaire ? Sans observation du point, la part des stations NO₂ satisfaisant le critère européen passe de 41,4 % à 87,9 % — sous le seuil de 90 %. Aux stations instrumentées, 96,2 %
- Les limites sont publiées comme les résultats : 3 épisodes réels détectés sur 33 — l’observation directe n’en attrape que 21, le produit officiel 1
🔧 Système de Détection d’Anomalies Temps Réel
Projet MLOps complet - 1 200+ heures
- Architecture event-driven : DAG 9 workers, 3 réplicas CPU + 1 GPU
- 3 canaux de détection décorrélés : IsolationForest + résidu Ridge temporel + reconstruction PCA séquentielle, fusion XGBoost
- Cycle de vie d’alarme en épisode unique (hystérésis, escalade, SLA)
- Dashboard Streamlit 40+ pages (rôles RASCI), observabilité Prometheus/Grafana
🕵️ Aegis-RCA — Agent de Diagnostic de Causes Racines
Prototype de recherche actif — extension de vigilance
- Agent LLM local qui investigue les incidents : contexte métriques, RAG sur procédures, diagnostic + recommandation validés par un humain
- Décisions d’architecture confrontées à des avis externes puis vérifiées par des bancs de mesure réels
- Sandbox d’auto-correction durci, 1 succès réel mesuré
🧪 Multi-Agent-Lab, laboratoire d’évaluation d’agents LLM locaux
En cours : 116 objectifs sur 200 clos (septembre 2026)
- Mesurer ce que chaque brique d’un agent (harnais, outils, contexte, consignes, skills) apporte réellement face à une baseline, en 100 % local sur RTX 5090
- Protocoles préenregistrés, analyse appariée, 40 tâches privées scellées, plus de 4 400 tests éprouvés par mutation
- Dernier résultat : pour choisir le bon skill, une décision typée du modèle bat un routeur classique (84 sur 107 contre 41, écart résolu) ; les résultats négatifs sont publiés comme tels
🧬 LLM_finetuning, affiner et distiller des LLM sur des textes cliniques français
En cours : premier cycle exploratoire mené, aucun verdict confirmatoire rendu (octobre 2026)
- Mesurer quelle technique d’adaptation (LoRA, distillation, pré-entraînement voisin) donne un gain réel face à une référence solide et réglée, sur une seule RTX 5090, avec des textes cliniques fictifs (PARHAF)
- Protocole gelé et haché avant la première mesure, verdict en trois valeurs (gain confirmé, absence de gain utile, non résolu), test scellé ouvert une seule fois
- Code privé, présentation détaillée sur demande à cyril.bgs.dev@gmail.com
🔬 Recherche Compositionnelle — Détection d’Anomalies (ADBench & TSB-AD)
Composer les SOTA et router par domaine de données
- Ancre reproduite à l’exact (Sub-PCA 0.4234, Sub-KNN 0.3501 en VUS-PR), point-adjust banni
- PaAno (ICLR 2026) monté sur TSB-AD et certifié : #1 des deux volets (0.58 U / 0.46 M)
- Corpus 502 jeux / 19 domaines : le routeur source-strict gagne +1,48 pt AUROC sur l’ensemble fixe (pré-enregistré) — un gain réel et modeste
- Le gain du routage croît avec la dimensionnalité : négatif sur l’ensemble du multivarié (−0,01), positif à partir de huit variables
🏆 Compétitions Kaggle - Top 1% Mondial
35+ compétitions
- Predict Podcast Listening Time : #20 / 3 310 (Top 0.6%)
- Prediction F1 Pit Stop : #14 / 3 022 (Top 0.5%)
- Feature engineering intensif, ensembling/stacking
- La stratégie gagnante se déplace vers l’agentique : des systèmes d’agents qui explorent et sélectionnent les pistes en autonomie
- Palmarès vérifiable : kaggle.com/cyrilbourgeois
🎓 Diplômes, et résultats publics
Diplômes
- Master 2 Data Scientist — OpenClassrooms + Centrale Supélec (2024)
- Master 1 Data Analyst — OpenClassrooms + ENSAE (2022)
Résultats publics (vérifiables, pas décernés)
- Kaggle — 3 compétitions dans le top 1 % mondial, meilleur rang #14 / 3 022
📫 Contact
Email : cyril.bgs.dev@gmail.com
GitHub : github.com/cyril-bgs-dev-tech
LinkedIn : linkedin.com/in/cyril-bourgeois-65a739150
Dernière mise à jour : Août 2026