Data Engineer — Visibility Dataset
Construa o conjunto de dados longitudinal do que a IA recomenda — milhões de observações imutáveis em dez assistentes, seis idiomas e todos os mercados acompanhados.
Sobre a vaga
A vantagem da Growli não é um recurso — é um conjunto de dados que ninguém mais está coletando: como cada grande assistente de IA responde a perguntas reais de compra, semana após semana, em vários idiomas e cidades. Hoje esse conjunto vive em um pipeline construído para iterar rápido; seu trabalho é dar a ele as fundações do ativo que define a categoria. Você vai assumir armazenamento, modelagem, qualidade e acesso: repositórios de observações somente-append, camadas de agregação que servem dashboards em milissegundos, monitores de qualidade que pegam desvios antes dos clientes e a analítica interna que nos diz quais mercados medir em seguida. Todo produto futuro — benchmarks, índices setoriais, o repertório nacional de negócios — será construído sobre o que você assentar aqui.
O que você vai fazer
- Assumir o repositório de observações: dados imutáveis de execução de prompts, respostas endereçadas por conteúdo e a estratégia de evolução de schema em volta deles.
- Construir camadas de agregação para que as visões por assistente, por cidade e por concorrente sigam rápidas com cem vezes mais dados.
- Projetar o monitoramento de qualidade de dados: cobertura, frescor, desvio de detecção e custo por observação — com alarme, não a olho nu.
- Tornar o conjunto de dados consultável para experimentos de produto sem colocar em risco o caminho crítico de produção.
- Modelar benchmarks entre negócios respeitando o isolamento entre inquilinos e nossos limites de anonimato.
- Assumir o caminho de migração quando superarmos o motor de armazenamento atual — medido, reversível, sem drama.
- Fazer parceria com o AI engineer nos conjuntos rotulados de avaliação e com produto em novos tipos de evidência.
Como é o sucesso
- As consultas do dashboard ficam abaixo de 100 ms enquanto as observações crescem em uma ordem de grandeza.
- Incidentes de qualidade de dados são pegos por monitores, não por clientes, com um runbook para cada classe.
- Um benchmark setorial construído puramente a partir do conjunto de dados vai ao ar como recurso para o cliente.
- O custo de armazenamento por observação cai enquanto as garantias de durabilidade sobem.
O que estamos buscando
- 4+ anos construindo sistemas de dados em produção — pipelines, data warehouses ou OLTP de alto volume.
- SQL e Python fortes; você modela dados para as consultas que eles precisam responder, não para o diagrama.
- Você já viveu uma migração de armazenamento e sabe dizer o que jamais repetiria.
- Você trata qualidade de dados como um produto com SLOs, não como faxina.
- Pragmatismo com infraestrutura: a ferramenta chata e comprovada vence a novidade empolgante.
- Diferencial: experiência com busca, produtos de analytics ou conjuntos de dados SaaS multi-inquilino.
Como se candidatar
Envie seu currículo por e-mail com uma nota curta sobre por que essa vaga. Sem modelo de carta de apresentação — conte o que você assumiria nos primeiros três meses.
Candidate-se por e-mailAs candidaturas são lidas pelo fundador. Você recebe uma resposta de qualquer forma.
Publicada em 1 de setembro de 2026
