Ouvert aux opportunités

Vianney Doraboy

Ingénieur Data & IA

Je conçois et développe des solutions Data et IA fiables : architecture et traitement des données, entraînement de modèles, développement d’APIs et déploiement en production.

Data EngineeringMLMLOpsAI EngineeringLLM/GenAICloud
DATA → AI
AI ENGINEERING
Flux d'ingénierieDATAMLAIProduction
Python/AWS/Spark/Kafka/AI
Expertise

Construire des systèmes intelligents de la data à l'IA.

Je combine data science, data engineering et AI engineering pour concevoir des systèmes qui passent fluidement de la donnée brute à une intelligence fiable.

01

Data Science

Transformer des jeux de données complexes en insights prédictifs, modèles intelligents et valeur business mesurable.

Machine LearningDeep LearningModélisation prédictiveAnalyse statistiqueIngénierie des features
Stack
PythonScikit-learnPyTorchPandas
02

Data Engineering

Concevoir des plateformes de données fiables et des pipelines scalables qui transforment la donnée brute en actifs prêts pour la production.

Pipelines de donnéesETL / ELTStreaming temps réelData WarehousingSystèmes distribués
Stack
Apache KafkaAirflowSparkAWS
03

AI Engineering

Construire des systèmes d'IA en production en connectant modèles, données, APIs et infrastructure cloud.

IA générativeApplications LLMSystèmes RAGDéploiement de modèlesMLOps
Stack
LLMsDockerFastAPIMLflow
04

Plateformes de données

Concevoir des architectures cloud-native pour l'analytique, l'observabilité, l'automatisation et des applications intelligentes.

Architecture cloudData LakesData WarehousesObservabilitéInfrastructure
Stack
AWSS3RedshiftGrafana
Mindset ingénieur

De l'expérimentation à la production.

01Data → Insight
02Modèle → Produit
03Pipeline → Scale

Data Science/Data Engineering/Intelligence Artificielle

Projets sélectionnés

Transformer des idées en systèmes Data & IA

Une sélection de projets en Data Engineering, Machine Learning et AI Engineering, allant des plateformes de données temps réel aux systèmes RAG, MLOps, architectures cloud et solutions intelligentes basées sur la simulation et l’optimisation.

01Data Engineering

Real-Time Streaming Data Platform

Conception et développement d’une plateforme Data Engineering distribuée pour l’ingestion et le traitement de données en temps réel avec Apache Airflow, Kafka et Spark Structured Streaming. Mise en œuvre de contrats de données Avro avec Schema Registry, validation et mise en quarantaine des données invalides, analytics streaming et stockage Parquet sur MinIO/S3. Architecture orientée production avec cluster Kafka multi-broker, cluster Spark distribué, observabilité Prometheus/Grafana, authentification et ACL Kafka, tests automatisés, Docker et pipelines CI/CD avec GitHub Actions.

Production
Technologies
PythonApache KafkaApache SparkApache AirflowAvroMinIOPrometheusGrafanaDocker
02MLOps

Breast Cancer MLOps Platform

Conception et développement d’une plateforme MLOps end-to-end pour l’entraînement, l’évaluation, le déploiement et le monitoring d’un modèle de classification du cancer du sein avec scikit-learn. Mise en œuvre d’un pipeline ML reproductible avec validation et prétraitement des données, évaluation du modèle, suivi des expériences et gestion des modèles avec MLflow. Développement d’une API d’inférence avec FastAPI exposant les prédictions et probabilités, complétée par une observabilité avec Prometheus et Grafana. Architecture orientée production avec Docker, tests unitaires et d’intégration automatisés et pipeline CI/CD avec GitHub Actions.

Production
Technologies
PythonScikit-learnMLflowFastAPIPrometheusGrafanaDockerGitHub Actions
03AI Engineering

AI-Powered Peacebuilding Knowledge Assistant

Conception et développement d’un système RAG multilingue (FR/EN) avec Python, FastAPI, Pydantic, PostgreSQL/pgvector, embeddings, recherche vectorielle et APIs LLM (Gemini/OpenAI), avec réponses en streaming et citations structurées des sources. Développement d’un pipeline RAG end-to-end et d’un framework d’évaluation couvrant la qualité du retrieval (Hit@K, Recall@K, MRR), la fidélité aux sources (groundedness), l’exactitude des citations, la complétude et la pertinence des réponses, la gestion de l’incertitude et la cohérence multilingue FR/EN. Mise en œuvre de pratiques d’AI/Software Engineering orientées production : architecture modulaire et provider-agnostic, PostgreSQL/pgvector, Docker, Alembic, pytest (575+ tests), Ruff et seuils de régression pour le suivi automatisé de la qualité du système.

Production
Technologies
PythonFastAPIPydanticPostgreSQLpgvectorGeminiOpenAIDocker
04Cloud & Data

Data Lakehouse Cloud

Conception d’une architecture Data Lakehouse cloud-native sur AWS pour centraliser, transformer, cataloguer et analyser des données provenant de sources multiples. Les données sont stockées dans Amazon S3, transformées via des pipelines ETL avec AWS Glue et organisées dans un catalogue de données pour faciliter leur découverte et leur gouvernance. Amazon Athena permet l’analyse serverless directement sur le Data Lake, tandis qu’Amazon Redshift fournit une couche analytique dédiée aux workloads Data Warehouse. L’infrastructure est définie et automatisée avec Terraform afin de garantir un déploiement reproductible et une architecture évolutive.

Production
Technologies
AWS S3AWS GlueAmazon AthenaAmazon RedshiftPythonTerraform
05Digital Twin

Plateforme de jumeau numérique énergétique

Conception d’une plateforme de jumeau numérique pour la supervision, la simulation et l’optimisation de systèmes énergétiques intelligents. L’architecture combine l’acquisition de données en temps réel, des modèles de Machine Learning et des mécanismes de simulation afin de reproduire le comportement d’équipements physiques, analyser leur état et anticiper leur évolution. Une API FastAPI assure l’accès aux données et aux modèles, MongoDB gère les données opérationnelles et Three.js permet de visualiser interactivement les équipements et leurs états. L’ensemble est conteneurisé avec Docker pour fournir une architecture modulaire et reproductible.

Recherche
Technologies
PythonFastAPIThree.jsMongoDBDockerMachine Learning
06AI & Optimization

Optimiseur d'énergies renouvelables

Conception d’un moteur intelligent pour prévoir, simuler et optimiser la production de systèmes d’énergies renouvelables. La solution combine des modèles de Machine Learning avec TensorFlow, l’analyse de données avec Pandas et des algorithmes d’optimisation afin d’exploiter les données historiques et opérationnelles, anticiper la production énergétique et identifier des stratégies d’exploitation plus efficaces. Une approche Digital Twin permet de simuler différents scénarios avant leur application, tandis que des services AWS fournissent l’infrastructure nécessaire au stockage et au traitement des données.

Recherche
Technologies
PythonTensorFlowOptimisationPandasAWSDigital Twin
Ouvert à la collaboration

Un problème de data ou d'IA à résoudre ?

Des pipelines de données et systèmes de machine learning aux applications d'IA et jumeaux numériques intelligents.

Expérience professionnelle

Concevoir des systèmes data, de la recherche à la production.

Un parcours à la croisée de la data science, du développement logiciel, du machine learning, du cloud et du MLOps, avec une approche orientée vers la conception de solutions robustes et industrialisables.

2019 — 2020CDD

Data Scientist

EES-CLEMESSYMulhouse, France
  • Développement de solutions Data Science et Machine Learning avec un focus sur l'analyse statistique, la modélisation prédictive et le traitement de séries temporelles industrielles.

  • Développement de modèles de Machine Learning pour Fabemi afin d'identifier les facteurs influençant les performances des presses vibrantes et de prédire les temps de recette.

  • Contribution au projet SmartForest à travers le choix des technologies, la conception de la plateforme data ainsi que le développement d'interfaces de suivi et de visualisation.

PythonMachine LearningTime SeriesData ScienceStatistics
Mar — Aug 2019Stage

Data Scientist

EES-CLEMESSYMulhouse, France
  • Développement d'un proof of concept SmartForest consacré à la détection d'anomalies et à l'analyse prédictive sur des systèmes industriels.

  • Application de méthodes de Machine Learning et d'approches statistiques pour identifier les comportements anormaux dans les données industrielles.

  • Exploration d'approches de maintenance prédictive pour contribuer à la détection précoce des défaillances potentielles des équipements.

PythonAnomaly DetectionPredictive MaintenanceMachine Learning
2018Projets académiques

Data Scientist Junior

Projets tutorésVannes, France
  • Développement de modèles statistiques et prédictifs appliqués à l'étude d'événements non liés à la communication et aux comportements d'achat.

  • Application de méthodes d'analyse de données et de modélisation statistique afin d'identifier des tendances et des relations dans les données historiques.

  • Mise en œuvre d'approches de prévision pour améliorer la prédiction des achats et contribuer à l'optimisation de la gestion des stocks.

StatisticsForecastingData AnalysisPredictive Modeling
2017Stage

Data Analyste

Institut turc de statistiqueIzmir, Türkiye
  • Réalisation d'analyses statistiques et de prévisions sur les naissances, les décès et les migrations nettes à partir de données démographiques.

  • Contribution à des études de projection démographique et à l'analyse des tendances d'évolution de la population.

  • Participation à des travaux d'analyse de la qualité de l'air urbain et à des études statistiques destinées à soutenir la prise de décision.

StatisticsForecastingDemographyData Analysis
De la data science aux systèmes intelligents en production
Data/AI/Cloud/MLOps
Formation

Un savoir construit à travers la data & la technologie.

Une base académique en statistiques et data science, complétée par un apprentissage continu en ingénierie logicielle, big data, intelligence artificielle et technologies cloud.

2017 — 2019
Formation académique
Vannes, France

Master en Data Science & Modélisation statistique

Université de Bretagne Sud2017 — 2019

Formation avancée en data science, modélisation statistique, machine learning, analyse de données et méthodes quantitatives.

2012 — 2017
Formation académique
Izmir, Turquie

Licence en Statistiques

Université Dokuz Eylul2012 — 2017

Formation en statistiques, probabilités, modélisation mathématique, analyse de données et calcul statistique.

Apprentissage continu

Formation complémentaire

01

Développement logiciel

The Web Developer Bootcamp

HTML5, CSS3, JavaScript, React, Node.js, Express, MongoDB, APIs REST et développement web full-stack.

Colt Steele

Voir le cours
02

Développement Python

The Complete Python Developer

Programmation Python, programmation orientée objet, automatisation, APIs, développement web et développement logiciel.

Andrei Neagoie

Voir le cours
03

Docker & Kubernetes

Docker & Kubernetes : The Practical Guide

Docker, Docker Compose, projets multi-conteneurs, déploiement et fondamentaux de Kubernetes.

Maximilian Schwarzmüller

Voir le cours
Expertise cloud

Badges de connaissances AWS Skill Builder

Badges de compétences couvrant les fondamentaux d’AWS, l’architecture, les réseaux, le serverless et la migration de données.

AWSRéseaux fondamentauxFondamentaux des réseaux AWS, de la connectivité et de la sécurité réseau.Voir le badge
AWSArchitecturePrincipes d'architecture AWS et concepts de conception Well-Architected.Voir le badge
AWSMigration des donnéesStratégies de migration AWS, services et principes d'adoption du cloud.Voir le badge
AWSServerlessConcepts du serverless, modèles d’architecture courants, services gérés et bonnes pratiques du serverless.Voir le badge
Statistiques / Data Science / Ingénierie / Cloud
Toujours apprendre · Toujours construire
EXPERTISE TECHNIQUE & PROFESSIONNELLE

Construire des systèmes intelligents, de la donnée à la production

Une expertise multidisciplinaire combinant data science, machine learning, ingénierie IA, data engineering, cloud et développement logiciel.

Je combine expertise technique et approche d'ingénierie de bout en bout : transformer les données brutes en modèles fiables, applications intelligentes, plateformes data évolutives et systèmes IA prêts pour la production.

01

Architecture Data & IA

Conception d'architectures évolutives pour les données, le machine learning et les applications IA, de l'expérimentation à la production.

02

Solutions Data

Conception de workflows data et de solutions analytiques permettant de transformer des données complexes en informations exploitables.

03

Prédiction & Machine Learning

Développement de modèles prédictifs, séries temporelles, détection d'anomalies et approches d'optimisation.

04

Systèmes IA intelligents

Développement de systèmes LLM, RAG et IA générative avec recherche documentaire, tool calling et APIs de production.

05

Plateformes & Pipelines Data

Conception de pipelines batch et streaming pour l'ingestion, la transformation, le traitement et la supervision des données.

06

MLOps & Production

Automatisation des workflows ML, déploiement, supervision et mise en place d'environnements machine learning reproductibles.

07

Cloud Engineering

Conception et déploiement de solutions cloud évolutives avec AWS, conteneurs, services serverless et infrastructure managée.

08

Software & API Engineering

Développement de services backend, APIs et applications full-stack maintenables autour de cas d'usage data et IA.

Data/ML/AI/Cloud/MLOps/Software

Des fondations data aux systèmes intelligents en production

Contact

Parlons de votre prochain projet Data & AI.

Vous avez un projet, une idée de recherche, un défi lié aux données ou un système d'IA en tête ? Échangeons sur la manière de transformer votre idée en une solution fiable.

Envoyer un message

Commençons une conversation

Formulaire de contact