Cyril BOURGEOIS

Data Scientist | MLOps Engineer

🎯 Profil

Data Scientist avec double compétence modélisation + production, spécialisé en détection d’anomalies et MLOps.

Parcours atypique : reconversion armée → commerce → data science (2021-2024)


🏆 Faits Marquants

Compétitions Kaggle

  • 35+ compétitions complétées
  • 3 compétitions top 1% mondial
  • Meilleur classement : #14 / 3 022 équipes (Top 0.5%)

Recherche compositionnelle — détection d’anomalies

  • Ancres reproduites : ADBench (47 datasets) et TSB-AD (égalités exactes au publié)
  • PaAno (ICLR 2026) intégré et certifié sur TSB-AD : #1 des volets U et M
  • Routeur source-strict : 502 jeux / 19 domaines, +1,48 pt AUROC sur l’ensemble fixe de 18 détecteurs (pré-enregistré, LODO groupé par source)

MLOps

  • Système temps réel : DAG 9 workers, Redis, Docker
  • Dashboard : 40+ pages Streamlit avec rôles RASCI
  • Observabilité : Prometheus, Grafana, SLA tracking

🎓 Formation

Master 2 - Data Scientist (2023-2024)

OpenClassrooms + Centrale Supélec
7 projets validés · Alternance MICHELIN (12 mois)

Master 1 - Data Analyst (2021-2022)

OpenClassrooms + ENSAE
10 projets validés


🛠️ Stack Technique

Langages

Python (avancé) · SQL · Rust

Machine Learning

  • Classique : Scikit-learn, XGBoost, LightGBM, CatBoost
  • Deep Learning : PyTorch, TensorFlow, HuggingFace, RealMLP
  • Time Series : Statsmodels, Prophet, LSTM, AnomalyTransformer
  • Modèles physiques : chimie-transport (CAMS, CHIMERE, GEOS-CF) — post-traitement de sorties
  • LLMs : évaluation, orchestration, revue croisée de résultats
  • Modèles pré-entraînés : transfer learning, fine-tuning
  • Calcul GPU : CUDA

LLMs utilisés

Claude · ChatGPT · Grok · Kimi K3 · Gemini · Mistral

Agentic

Claude Code · Codex · OpenCode

MLOps & Infrastructure

  • Containerisation : Docker, Docker Compose
  • Orchestration : Redis, DAG event-driven
  • Monitoring : Prometheus, Grafana
  • Dashboard : Streamlit (40+ pages)

Data Engineering

  • DataFrames : Pandas, Polars, NumPy
  • Stockage : Parquet, PostgreSQL, S3/MinIO
  • Versioning : Git, DVC, MLflow

💼 Expérience

Alternance Data Scientist - MICHELIN (2023-2024)

POC Parsing/Matching de Données Complexes

  • Gestion de données pricing mondial (niveau continental)
  • Augmentation considérable du taux de détection des correspondances
  • Dashboards Power BI pour équipe pricing
  • Tests automatisés (PyTest)

Feedback : “Force de proposition, assidu dans les missions. POC parsing/mapping mené avec succès.”

Data Scientist / ML Engineer - DELTAMU (2024-2025)

Recherche en détection d’anomalies — capteurs industriels (pharma)

  • Tests de recherche en clustering et détection d’anomalies, plusieurs centaines de capteurs
  • Nouvel algorithme de détection, validé par le responsable scientifique
  • Analyses statistiques avancées sur ensemble de bon fonctionnement
  • Cœur calculatoire haute vitesse optimisé en Rust
  • Caractérisation des régimes de fonctionnement sur plusieurs centaines de capteurs

Feedback : “Réelle passion pour la data science et les algorithmes d’IA. Investissement dans les missions. Contribution active au produit logiciel.” — Nuno DOS REIS, Président, DELTAMU


📊 Projets Phares

🌬️ Correction Apprise des Prévisions de Qualité de l’Air

Apprendre l’erreur du modèle européen, et la retirer — 36 mois, 28 M de mesures horaires, 4 polluants

  • Prévoir là où personne ne mesure : aucune observation du lieu corrigé n’entre dans le modèle, et il est testé sur des stations et des mois qu’il n’a jamais vus
  • −39,6 % d’erreur sur le NO₂, −20,2 % sur les PM10, −17,9 % sur l’ozone, −11,8 % sur les PM2,5
  • En 2030 l’Europe divise ses seuils par deux : à pollution inchangée, les stations en dépassement passent de 6 à 109, et 4 départements d’Occitanie n’ont aucune station pour le constater
  • Utilisable au sens réglementaire ? Sans observation du point, la part des stations NO₂ satisfaisant le critère européen passe de 41,4 % à 87,9 % — sous le seuil de 90 %. Aux stations instrumentées, 96,2 %
  • Les limites sont publiées comme les résultats : 3 épisodes réels détectés sur 33 — l’observation directe n’en attrape que 21, le produit officiel 1

→ Voir le projet

🔧 Système de Détection d’Anomalies Temps Réel

Projet MLOps complet - 1 200+ heures

  • Architecture event-driven : DAG 9 workers, 3 réplicas CPU + 1 GPU
  • 3 canaux de détection décorrélés : IsolationForest + résidu Ridge temporel + reconstruction PCA séquentielle, fusion XGBoost
  • Cycle de vie d’alarme en épisode unique (hystérésis, escalade, SLA)
  • Dashboard Streamlit 40+ pages (rôles RASCI), observabilité Prometheus/Grafana

→ Voir le projet

🕵️ Aegis-RCA — Agent de Diagnostic de Causes Racines

Prototype de recherche actif — extension de vigilance

  • Agent LLM local qui investigue les incidents : contexte métriques, RAG sur procédures, diagnostic + recommandation validés par un humain
  • Décisions d’architecture confrontées à des avis externes puis vérifiées par des bancs de mesure réels
  • Sandbox d’auto-correction durci, 1 succès réel mesuré

→ Voir le projet

🧪 Multi-Agent-Lab, laboratoire d’évaluation d’agents LLM locaux

En cours : 116 objectifs sur 200 clos (septembre 2026)

  • Mesurer ce que chaque brique d’un agent (harnais, outils, contexte, consignes, skills) apporte réellement face à une baseline, en 100 % local sur RTX 5090
  • Protocoles préenregistrés, analyse appariée, 40 tâches privées scellées, plus de 4 400 tests éprouvés par mutation
  • Dernier résultat : pour choisir le bon skill, une décision typée du modèle bat un routeur classique (84 sur 107 contre 41, écart résolu) ; les résultats négatifs sont publiés comme tels

→ Voir le projet

🧬 LLM_finetuning, affiner et distiller des LLM sur des textes cliniques français

En cours : premier cycle exploratoire mené, aucun verdict confirmatoire rendu (octobre 2026)

  • Mesurer quelle technique d’adaptation (LoRA, distillation, pré-entraînement voisin) donne un gain réel face à une référence solide et réglée, sur une seule RTX 5090, avec des textes cliniques fictifs (PARHAF)
  • Protocole gelé et haché avant la première mesure, verdict en trois valeurs (gain confirmé, absence de gain utile, non résolu), test scellé ouvert une seule fois
  • Code privé, présentation détaillée sur demande à cyril.bgs.dev@gmail.com

→ Voir le projet

🔬 Recherche Compositionnelle — Détection d’Anomalies (ADBench & TSB-AD)

Composer les SOTA et router par domaine de données

  • Ancre reproduite à l’exact (Sub-PCA 0.4234, Sub-KNN 0.3501 en VUS-PR), point-adjust banni
  • PaAno (ICLR 2026) monté sur TSB-AD et certifié : #1 des deux volets (0.58 U / 0.46 M)
  • Corpus 502 jeux / 19 domaines : le routeur source-strict gagne +1,48 pt AUROC sur l’ensemble fixe (pré-enregistré) — un gain réel et modeste
  • Le gain du routage croît avec la dimensionnalité : négatif sur l’ensemble du multivarié (−0,01), positif à partir de huit variables

→ Voir le projet

🏆 Compétitions Kaggle - Top 1% Mondial

35+ compétitions

  • Predict Podcast Listening Time : #20 / 3 310 (Top 0.6%)
  • Prediction F1 Pit Stop : #14 / 3 022 (Top 0.5%)
  • Feature engineering intensif, ensembling/stacking
  • La stratégie gagnante se déplace vers l’agentique : des systèmes d’agents qui explorent et sélectionnent les pistes en autonomie
  • Palmarès vérifiable : kaggle.com/cyrilbourgeois

→ Voir les compétitions


🎓 Diplômes, et résultats publics

Diplômes

  • Master 2 Data Scientist — OpenClassrooms + Centrale Supélec (2024)
  • Master 1 Data Analyst — OpenClassrooms + ENSAE (2022)

Résultats publics (vérifiables, pas décernés)

  • Kaggle — 3 compétitions dans le top 1 % mondial, meilleur rang #14 / 3 022

📫 Contact

Email : cyril.bgs.dev@gmail.com
GitHub : github.com/cyril-bgs-dev-tech
LinkedIn : linkedin.com/in/cyril-bourgeois-65a739150


Dernière mise à jour : Août 2026