关于这个职位
Growli 的护城河不是某个功能,而是一个别人都没在收集的数据集:每个主流 AI 助手如何回答真实的购买问题,一周又一周,跨语言、跨城市地积累。今天这个数据集运行在一条为快速迭代而建的管道上;你的任务是为它打下成为品类定义级资产所需的地基。你将负责存储、建模、质量与访问:只追加的观测存储、毫秒级支撑仪表盘的聚合层、在客户之前发现漂移的质量监控,以及告诉我们下一个该度量哪些市场的内部分析。未来的每个产品——基准报告、行业指数、全国企业名录——都将建立在你今天铺设的基础上。
你将做什么
- 负责观测存储:不可变的运行数据、按内容寻址的回答,以及围绕它们的模式演进策略。
- 构建聚合层,让按助手、按城市、按竞争对手的视图在数据增长百倍时依然飞快。
- 设计数据质量监控:覆盖率、新鲜度、检测漂移和单条观测成本——靠告警,不靠肉眼。
- 让数据集可用于产品实验查询,同时不危及生产热路径。
- 为跨企业基准建模,同时严守租户隔离与匿名底线。
- 在我们超出现有存储引擎时负责迁移路径——可度量、可回退、平淡无奇。
- 与 AI 工程师协作标注评估集,与产品协作新的证据类型。
成功是什么样子
- 观测量增长一个数量级时,仪表盘查询仍稳定在 100 毫秒以内。
- 数据质量事故由监控发现,而不是由客户发现,且每一类都有处置手册。
- 一份纯粹基于该数据集的行业基准以客户功能的形式上线。
- 每条观测的存储成本下降,而持久性保证提升。
我们在找什么样的人
- 4 年以上生产环境数据系统经验——管道、数仓或高吞吐 OLTP。
- 扎实的 SQL 与 Python;你按查询需求建模数据,而不是按示意图。
- 亲历过一次存储迁移,说得出哪些事你再也不会做第二遍。
- 把数据质量当作有 SLO 的产品来经营,而不是打扫卫生。
- 对基础设施务实:无聊但可靠的工具胜过新鲜但刺激的。
- 加分项:搜索、分析类产品或多租户 SaaS 数据集经验。
发布于 2026年9月1日
