Data Scientist IA - Vision par Ordinateur et OCR / VLM F/H
CTS Corporate — Paris 1er Arrondissement (75)
Publiée le 21/08/2026 · Offre active, sourcée auprès d'un partenaire officiel
Au sein de notre société de conseil en informatique, nous accompagnons les grandes institutions publiques et privées dans la valorisation de leurs données et le déploiement d'intelligences artificielles souveraines. Dans le cadre d'un projet innovant, nous recherchons un(e) Data Scientist IA spécialisé(e) en Computer Vision et modèles Vision-Langage (VLM).
Vos Missions :
Dans le respect strict des exigences de la statistique publique (secret statistique, confidentialité, reproductibilité, non-exfiltration des données), vos travaux porteront sur le traitement automatique et l'extraction d'informations à partir de formulaires :
- Traitement d'Images et Vision par Ordinateur : Concevoir les pipelines de prétraitement d'images (redressement, binarisation, recalage de formulaires, segmentation et découpe de zones d'intérêt).
- Deep Learning, HTR et VLM : Développer et évaluer des modèles d'OCR/HTR (reconnaissance d'écriture manuscrite) ainsi que des modèles vision-langage open-weight (VLM / LLM via prompting et fine-tuning).
- Évaluation et Métriques Avancées : Définir des métriques de performance sur-mesure par variable, calculer des scores de confiance, gérer l'incertitude et analyser finement les erreurs en confrontant les sorties modèles aux fichiers de contrôle (FIQUAL, FICOD).
- Industrialisation MLOps : Développer des pipelines reproductibles et conteneurisés (Docker, MLflow) hébergés sur la plateforme de calcul SSP Cloud exploitable sur GPU.
- Documentation et Passation : Rédiger les notes méthodologiques, la documentation technique et assurer la restitution auprès des interlocuteurs techniques et métiers.
Livrables Attendus :
- Dépôt Git documenté contenant le code source complet, reproductible et versionné.
- Étude comparative des performances de plusieurs modèles par type de variable.
- Pipeline d'évaluation automatique générant les métriques de concordance et l'analyse d'erreurs par rapport aux fichiers de contrôle (FIQUAL / FICOD).
- Documentation technique et méthodologique permettant la transmission aux équipes.
Formation et Expérience :
- Diplôme : Bac+5 (Master 2, diplôme d'ingénieur) ou Doctorat en Data Science, Machine Learning, Computer Vision ou discipline similaire.
- Expérience : 2 à 5 ans d'expérience en projets ML/IA incluant de la mise en production et l'évaluation rigoureuse de modèles.
- Une expérience préalable sur le traitement de formulaires ou la reconnaissance d'écriture manuscrite est très fortement appréciée.
Compétences techniques requises :
- Langages et Frameworks (Impératif) : Python professionnel (PyTorch, OpenCV, écosystème Hugging Face, Pandas).
- MLOps et Infra (Impératif) : MLflow, conteneurisation (Docker), stockage objet S3, usage de clusters GPU et environnement SSP Cloud.
- IA et Vision : Maîtrise du traitement d'images, de l'OCR/HTR et de l'utilisation/évaluation des VLM/LLM (le fine-tuning est un plus).
- Dev et Git : Pratique stricte des bonnes pratiques de développement logiciel (tests, Git, reproductibilité).
Soft Skills :
- Autonomie technique forte et aptitude au travail collaboratif avec les équipes de recherche/ingénierie.
- Excellente capacité de communication écrite et orale en français.
- Rigueur scientifique, sensibilité aux normes éthiques et à la confidentialité des données publiques.
Voir l'offre et postuler — entrez votre email. Gratuit pour les diplômé(e)s et étudiant(e)s du Groupe ECL, première offre débloquée pour tout le monde.
Entreprise ? Confiez-nous un mandat →
🛡️ Cette annonce vous semble suspecte (rendez-vous hors cadre professionnel, demande d'argent, identité douteuse) ? Signaler cette offre · Nos conseils de sécurité