Data Engineer — Dataset de visibilidad
Construye el dataset longitudinal de lo que la IA recomienda: millones de observaciones inmutables en diez asistentes, seis idiomas y cada mercado rastreado.
Sobre el puesto
El foso de Growli no es una funcionalidad: es un dataset que nadie más está recogiendo — cómo responde cada gran asistente de IA a preguntas de compra reales, semana tras semana, en varios idiomas y ciudades. Hoy ese dataset vive en un pipeline pensado para iterar rápido; tu trabajo es darle los cimientos del activo definitorio de categoría en que debe convertirse. Serás dueño/a del almacenamiento, el modelado, la calidad y el acceso: almacenes de observaciones append-only, capas de agregación que sirven paneles en milisegundos, monitores de calidad que detectan la deriva antes que los clientes, y la analítica interna que nos dice qué mercados medir después. Cada producto futuro — benchmarks, índices sectoriales, el repertorio nacional de negocios — se construirá sobre lo que dejes puesto aquí.
Qué harás
- Ser dueño/a del almacén de observaciones: datos inmutables de ejecuciones, respuestas direccionadas por contenido y la estrategia de evolución del esquema.
- Construir capas de agregación para que las vistas por asistente, ciudad y competidor sigan siendo rápidas cuando los datos se multipliquen por cien.
- Diseñar la monitorización de calidad: cobertura, frescura, deriva de detección y coste por observación — con alarmas, no a ojo.
- Hacer el dataset consultable para experimentos de producto sin arriesgar el camino caliente de producción.
- Modelar benchmarks entre negocios que respeten el aislamiento de tenants y nuestros suelos de anonimato.
- Ser dueño/a de la ruta de migración cuando superemos el motor de almacenamiento actual: medida, reversible, aburrida.
- Colaborar con el AI engineer en sets de evaluación etiquetados y con producto en nuevos tipos de evidencia.
Cómo se ve el éxito
- Las consultas de los paneles se mantienen por debajo de 100 ms mientras las observaciones crecen un orden de magnitud.
- Los incidentes de calidad los detectan los monitores, no los clientes, con un runbook por clase.
- Un benchmark sectorial construido solo con el dataset sale como funcionalidad para clientes.
- El coste de almacenamiento por observación baja mientras suben las garantías de durabilidad.
Qué buscamos
- 4+ años construyendo sistemas de datos en producción: pipelines, warehouses u OLTP de alto volumen.
- SQL y Python sólidos; modelas los datos para las consultas que deben responder, no para el diagrama.
- Has vivido una migración de almacenamiento y sabes decir qué no volverías a hacer jamás.
- Tratas la calidad de los datos como un producto con SLOs, no como una tarea de limpieza.
- Pragmático/a con la infraestructura: la herramienta aburrida y probada gana a la nueva y emocionante.
- Extra: experiencia con búsqueda, productos de analítica o datasets SaaS multi-tenant.
Cómo postular
Envíanos tu CV y unas líneas sobre por qué este puesto. Nada de carta de presentación estándar: cuéntanos de qué te harías responsable en los tres primeros meses.
Postular por correoLas candidaturas las lee el fundador. Respondemos en cualquier caso.
Publicado el 1 de septiembre de 2026
