Growli
加入我们

数据工程师 — 可见度数据集

工程 远程全职

构建「AI 推荐了谁」的纵向数据集——横跨十个助手、六种语言和每一个被跟踪市场的数百万条不可变观测。

关于这个职位

Growli 的护城河不是某个功能,而是一个别人都没在收集的数据集:每个主流 AI 助手如何回答真实的购买问题,一周又一周,跨语言、跨城市地积累。今天这个数据集运行在一条为快速迭代而建的管道上;你的任务是为它打下成为品类定义级资产所需的地基。你将负责存储、建模、质量与访问:只追加的观测存储、毫秒级支撑仪表盘的聚合层、在客户之前发现漂移的质量监控,以及告诉我们下一个该度量哪些市场的内部分析。未来的每个产品——基准报告、行业指数、全国企业名录——都将建立在你今天铺设的基础上。

你将做什么

  • 负责观测存储:不可变的运行数据、按内容寻址的回答,以及围绕它们的模式演进策略。
  • 构建聚合层,让按助手、按城市、按竞争对手的视图在数据增长百倍时依然飞快。
  • 设计数据质量监控:覆盖率、新鲜度、检测漂移和单条观测成本——靠告警,不靠肉眼。
  • 让数据集可用于产品实验查询,同时不危及生产热路径。
  • 为跨企业基准建模,同时严守租户隔离与匿名底线。
  • 在我们超出现有存储引擎时负责迁移路径——可度量、可回退、平淡无奇。
  • 与 AI 工程师协作标注评估集,与产品协作新的证据类型。

成功是什么样子

  • 观测量增长一个数量级时,仪表盘查询仍稳定在 100 毫秒以内。
  • 数据质量事故由监控发现,而不是由客户发现,且每一类都有处置手册。
  • 一份纯粹基于该数据集的行业基准以客户功能的形式上线。
  • 每条观测的存储成本下降,而持久性保证提升。

我们在找什么样的人

  • 4 年以上生产环境数据系统经验——管道、数仓或高吞吐 OLTP。
  • 扎实的 SQL 与 Python;你按查询需求建模数据,而不是按示意图。
  • 亲历过一次存储迁移,说得出哪些事你再也不会做第二遍。
  • 把数据质量当作有 SLO 的产品来经营,而不是打扫卫生。
  • 对基础设施务实:无聊但可靠的工具胜过新鲜但刺激的。
  • 加分项:搜索、分析类产品或多租户 SaaS 数据集经验。

如何申请

把你的简历和一段简短说明发邮件给我们,讲讲为什么是这个职位。不需要套模板的求职信——告诉我们头三个月你会负责什么。

通过邮件申请

申请由创始人亲自阅读。无论结果如何,我们都会回复。

发布于 2026年9月1日

每周通讯

每周 AI 搜索增长技巧

和众多企业主一起,获取被 Google 收录、被 AI 推荐的实用建议。