Robin Nicole, PhD · Ingénieur ML/IA · Londres

Mettez l'IA en production.

Ingénieur ML senior. RAG, agents, prévision, MLOps. Des systèmes en production qui tournent pendant des années.

Voir l'étude de cas

Pas besoin de vous tenir la main. Un brief en entrée, un système fonctionnel en sortie. Je parle le même langage.

Concierge RAG avec ancrage par récupération, garde-fous de coût et harnais d'évaluation. Débit des opérations doublé.

Étude de cas

Concierge RAG qui a doublé le débit des opérations

Concierge RAG

Problème
Les opérations clients étaient le goulot d'étranglement. Chaque question entrante imposait une recherche manuelle dans des documents éparpillés, d'anciens tickets et des tableaux de bord. Latence élevée, débit stagnant, aucune marge pour passer à l'échelle par le recrutement.
Réalisation
Concierge RAG de bout en bout : pipeline d'ingestion de documents, récupération vectorielle sur la base de connaissances interne, réponses LLM ancrées dans les sources avec citations en ligne, garde-fous de coût et de sécurité, et un harnais d'évaluation suivant la fidélité des réponses, la couverture des citations et la dérive à mesure que le contenu changeait.
Résultat
Débit opérationnel doublé sans renfort d'effectifs. La latence des requêtes est passée de plusieurs minutes de recherche manuelle à une récupération en moins d'une seconde. Toujours en production, dans le budget, dans les SLO.

Prévision de la demande à l'échelle de la distribution

Problème
Des prévisions de demande manuelles et grossières sur les marchés de la distribution européenne entraînaient des surstocks ici et des ruptures là, coûteux dans les deux cas, sans aucun moyen de passer à l'échelle sur tous les marchés et références à la main.
Réalisation
Pipelines de prévision de la demande et de gestion des stocks sur les marchés européens, sur VertexAI et Kubeflow, avec BigQuery comme couche de données. Modèles de séries temporelles hiérarchiques, réentraînement automatisé et surveillance de la dérive pour des prévisions qui restent fiables quand la demande bouge.
Résultat
Des prévisions en production sur plusieurs marchés européens, réentraînées automatiquement et surveillées pour la dérive, remplaçant les estimations manuelles par un système digne de confiance, sans surveillance constante.

NLP en temps réel chez un éditeur de presse national

Problème
L'un des plus grands éditeurs de presse du Royaume-Uni devait classer et orienter ses contenus éditoriaux à grande échelle, en temps réel. L'étiquetage manuel était trop lent pour le volume et les rédactions n'avaient aucun moyen fiable de tester ce qui fonctionnait.
Réalisation
Système de classification de contenu NLP sur des pipelines de données en temps réel traitant plus de 100 millions de pages vues par mois, plus un cadre de tests A/B conçu pour être assez simple pour que les rédactions s'en servent vraiment au quotidien.
Résultat
Une classification en temps réel sur plus de 100 millions de pages vues mensuelles ; le cadre de tests A/B est devenu partie intégrante du flux de travail éditorial, et non un tableau de bord que personne n'ouvre.

FAQ

Questions fréquentes

Q&R
Quelle est votre stack ?
Python avant tout. TensorFlow, PyTorch, scikit-learn, pandas, PySpark. GCP (VertexAI, Kubeflow, BigQuery) et AWS (EMR, S3). Docker. Pour le LLM : SDK bruts ou LangChain/LlamaIndex selon les contraintes, bases vectorielles (pgvector, Qdrant, Pinecone) au besoin, harnais d'évaluation systématiquement. Je m'adapte au sein de cet éventail.
Q&R
Vous occupez-vous du MLOps ou seulement de la modélisation ?
Les deux, et dans cet ordre. J'accorde autant d'importance à la supervision, au CI/CD, aux feature stores, à l'infrastructure d'évaluation et aux retours d'incident qu'au modèle lui-même. La modélisation sans discipline opérationnelle, c'est ainsi que les entreprises se retrouvent avec des modèles qui ne sortent jamais.
Q&R
Comment évaluez-vous les sorties des LLM ?
Par couches. Jeux d'évaluation hors ligne (réponses de référence, LLM comme juge quand c'est pertinent), métriques en ligne avec vérifications humaines ponctuelles, détection de dérive lors des changements de contenu, SLO de coût et de latence. Pour le RAG en particulier : rappel de la récupération sur des requêtes annotées, fidélité des réponses, couverture des citations. Les évaluations sont livrées avec le système, pas après.
Q&R
Comment débute une mission, en général ?
Un court appel d'introduction pour cadrer le problème. Une proposition avec des livrables et un calendrier clairs. En intégration dans votre équipe ou en travail indépendant, selon ce qui convient. Points de suivi hebdomadaires, documents de passation rédigés pour l'ingénieur qui prend la suite, pas pour la forme.

Services

Ce que je livre

Service

Systèmes LLM et RAG, conçus pour être livrés

Chatbots à génération augmentée par récupération, agents et fonctionnalités LLM en production. Prompt engineering, harnais d'évaluation, maîtrise des coûts et le MLOps pour les garder en marche. Python avec SDK ou LangChain/LlamaIndex selon les contraintes, bases vectorielles au besoin (pgvector, Qdrant, Pinecone), dans le cloud ou auto-hébergé.

De 2 semaines à 3 mois

Service

Prévision et modélisation de la demande

Prévision de la demande et pipelines d'optimisation à l'échelle. Modèles de séries temporelles et prévision hiérarchique. Mis en production sur VertexAI/Kubeflow ou la plateforme de votre choix.

De 4 semaines à plusieurs mois en intégration

Service

Plateforme ML et MLOps

Pipelines de niveau production, supervision, CI/CD pour les modèles, feature stores, infrastructure d'évaluation, hygiène des incidents. Les systèmes arrivent en production et y restent.

Forfait mensuel ou construction d'une plateforme cadrée

Expérience

Expériences passées

Bilan

Sept ans dans la distribution, la publicité numérique, les médias et la finance quantitative. Du ML en production qui tourne pendant des années.

  1. Oct. 2024 – aujourd'hui

    Ingénieur ML senior · Grand distributeur européen

    Prévision de la demande sur les marchés de la distribution européenne. Pipelines VertexAI et Kubeflow, BigQuery, Python.

  2. Janv. 2022 – sept. 2024

    Chercheur appliqué senior · Sojern

    ML pour la publicité dans le voyage. Concierge propulsé par LLM (chatbot RAG). Automatisation des pipelines ML, harnais d'évaluation, maîtrise des coûts sur les charges LLM en production.

  3. Sept. 2019 – janv. 2022

    Data scientist senior · Reach plc

    Systèmes NLP pour l'un des plus grands éditeurs de presse du Royaume-Uni. Classification de contenu, pipelines de données en temps réel, cadre de tests A/B que les rédacteurs utilisaient réellement.

  4. Mai 2018 – sept. 2019

    Analyste quantitatif · Gambit Research

    Modèles de ML pour la prédiction des marchés. Recherche de signaux et backtesting dans un environnement de trading quantitatif.

À propos

À propos

Ingénieur ML senior. Doctorat en mathématiques appliquées, King's College de Londres. Sept ans de ML en production : prévision de la demande dans la distribution, enchères publicitaires, NLP pour la presse et prédiction quantitative.

Je livre surtout des systèmes qui tournent pendant des années, pas des démos. Prévision de la demande et gestion des stocks dans la distribution européenne. Concierge RAG doublant le débit des opérations chez un client. Classification NLP sur plus de 100 M de pages vues par mois chez un éditeur national. Signaux quantitatifs dans une société de tenue de marché.

Je tiens aux systèmes qui durent. Cela veut dire de la supervision, des harnais d'évaluation, des retours d'incident honnêtes et des choix de modélisation qui laissent dormir le prochain ingénieur d'astreinte. J'avance vite, mais je ne livre rien que je ne voudrais pas maintenir moi-même.

Publications

Stack

ML/IA
Deep Learning, NLP, LLM, IA agentique, Séries temporelles, RAG
Langages
Python, SQL, C++
Frameworks
TensorFlow, PyTorch, scikit-learn, pandas, PySpark
Cloud/MLOps
VertexAI, Kubeflow, Docker, AWS, GCP

Contact

Me contacter

Un brief en entrée, une réponse sous une semaine. Si je ne suis pas la bonne personne, je sais généralement qui l'est.

Précisez : le problème, la forme des données, votre stack actuelle et un calendrier approximatif. Pas besoin de préambule.