Data Engineer — Dataset di visibilità
Costruisci il dataset longitudinale di ciò che l'AI raccomanda: milioni di osservazioni immutabili su dieci assistenti, sei lingue e ogni mercato tracciato.
Il ruolo
Il fossato di Growli non è una funzionalità: è un dataset che nessun altro sta raccogliendo — come ogni grande assistente AI risponde a vere domande d'acquisto, settimana dopo settimana, attraverso lingue e città. Oggi quel dataset vive in una pipeline costruita per iterare in fretta; il tuo compito è dargli le fondamenta dell'asset che definirà la categoria. Possiederai storage, modellazione, qualità e accesso: archivi di osservazioni append-only, livelli di aggregazione che servono le dashboard in millisecondi, monitor di qualità che colgono la deriva prima dei clienti, e l'analitica interna che ci dice quali mercati misurare dopo. Ogni prodotto futuro — benchmark, indici di settore, il repertorio nazionale delle imprese — si costruirà su ciò che poserai qui.
Cosa farai
- Possedere l'archivio delle osservazioni: dati immutabili dei run, risposte indirizzate per contenuto e la strategia di evoluzione dello schema.
- Costruire i livelli di aggregazione perché le viste per assistente, città e competitor restino veloci quando i dati crescono di cento volte.
- Progettare il monitoraggio della qualità: copertura, freschezza, deriva del rilevamento e costo per osservazione — con allarmi, non a occhio.
- Rendere il dataset interrogabile per gli esperimenti di prodotto senza rischiare il percorso caldo di produzione.
- Modellare benchmark tra aziende che rispettino l'isolamento dei tenant e le nostre soglie di anonimato.
- Possedere il percorso di migrazione quando supereremo l'attuale motore di storage — misurato, reversibile, noioso.
- Collaborare con l'AI engineer sui set di valutazione etichettati e con il prodotto sui nuovi tipi di evidenza.
Come si misura il successo
- Le query delle dashboard restano sotto i 100 ms mentre le osservazioni crescono di un ordine di grandezza.
- Gli incidenti di qualità li colgono i monitor, non i clienti, con un runbook per ogni classe.
- Un benchmark di settore costruito solo dal dataset esce come funzionalità per i clienti.
- Il costo di storage per osservazione scende mentre salgono le garanzie di durabilità.
Cosa cerchiamo
- 4+ anni a costruire sistemi dati in produzione — pipeline, warehouse o OLTP ad alto volume.
- SQL e Python solidi; modelli i dati per le query a cui devono rispondere, non per il diagramma.
- Hai vissuto una migrazione di storage e sai dire cosa non rifaresti mai più.
- Tratti la qualità dei dati come un prodotto con SLO, non come una pulizia da fare.
- Pragmatico sull'infrastruttura: lo strumento noioso e provato batte quello nuovo ed eccitante.
- Bonus: esperienza con search, prodotti di analytics o dataset SaaS multi-tenant.
Come candidarsi
Inviaci il tuo CV e due righe sul perché di questo ruolo. Niente lettera di presentazione standard: raccontaci di cosa ti faresti carico nei primi tre mesi.
Candidati via e-mailLe candidature le legge il fondatore. Rispondiamo in ogni caso.
Pubblicato il 1 settembre 2026
