Growli
Carrières

Data Engineer — Dataset de visibilité

Ingénierie TélétravailTemps plein

Construisez le jeu de données longitudinal de ce que l'IA recommande — des millions d'observations immuables sur dix assistants, six langues et chaque marché suivi.

À propos du poste

Le fossé défensif de Growli n'est pas une fonctionnalité — c'est un jeu de données que personne d'autre ne collecte : comment chaque grand assistant IA répond à de vraies questions d'achat, semaine après semaine, à travers les langues et les villes. Aujourd'hui, ce dataset vit dans un pipeline pensé pour itérer vite ; votre travail est de lui donner les fondations de l'actif fondateur de catégorie qu'il doit devenir. Vous posséderez le stockage, la modélisation, la qualité et l'accès : magasins d'observations en append-only, couches d'agrégation qui servent les tableaux de bord en millisecondes, moniteurs de qualité qui détectent la dérive avant les clients, et l'analytique interne qui nous dit quels marchés mesurer ensuite. Chaque futur produit — benchmarks, indices sectoriels, répertoire national des entreprises — se construira sur ce que vous posez ici.

Ce que vous ferez

  • Posséder le magasin d'observations : données de runs immuables, réponses adressées par contenu, et la stratégie d'évolution du schéma.
  • Construire les couches d'agrégation pour que les vues par assistant, par ville et par concurrent restent rapides quand la donnée est multipliée par cent.
  • Concevoir la surveillance de qualité : couverture, fraîcheur, dérive de détection et coût par observation — sous alarme, pas à l'œil nu.
  • Rendre le dataset interrogeable pour les expérimentations produit sans risquer le chemin chaud de production.
  • Modéliser des benchmarks inter-entreprises qui respectent l'isolation des tenants et nos planchers d'anonymat.
  • Posséder la trajectoire de migration quand nous dépasserons le moteur de stockage actuel — mesurée, réversible, ennuyeuse.
  • Collaborer avec l'ingénieur IA sur les jeux d'évaluation annotés et avec le produit sur les nouveaux types de preuves.

À quoi ressemble la réussite

  • Les requêtes des tableaux de bord restent sous 100 ms pendant que les observations gagnent un ordre de grandeur.
  • Les incidents de qualité sont attrapés par les moniteurs, pas par les clients, avec un runbook par classe.
  • Un benchmark sectoriel construit uniquement à partir du dataset est livré comme fonctionnalité client.
  • Le coût de stockage par observation baisse pendant que les garanties de durabilité montent.

Ce que nous recherchons

  • 4 ans et plus à construire des systèmes de données en production — pipelines, entrepôts ou OLTP à fort volume.
  • SQL et Python solides ; vous modélisez la donnée pour les requêtes qu'elle doit servir, pas pour le schéma au mur.
  • Vous avez vécu une migration de stockage et savez dire ce que vous ne referez plus jamais.
  • Vous traitez la qualité des données comme un produit avec des SLO, pas comme une corvée de nettoyage.
  • Pragmatique sur l'infrastructure : l'outil éprouvé et ennuyeux bat l'outil excitant et nouveau.
  • Bonus : expérience en search, produits analytics ou datasets SaaS multi-tenants.

Comment postuler

Envoyez-nous votre CV et quelques lignes sur ce qui vous attire dans ce poste. Pas de lettre de motivation type : dites-nous ce que vous porteriez dans les trois premiers mois.

Postuler par e-mail

Les candidatures sont lues par le fondateur. Nous répondons dans tous les cas.

Publié le 1 septembre 2026

Newsletter hebdomadaire

Conseils hebdomadaires de croissance en recherche IA

Rejoignez les entrepreneurs qui reçoivent des conseils concrets pour être trouvés sur Google et recommandés par les IA.