存储与调度
小红书没有像 ByteGraph / Abase 那样把自研库写成 VLDB 论文。能核对的是访问模式和多云事实:对象存储按云厂商拆,在线特征走 KV,样本走 Hive,分析走 OLAP,训练作业走 Firefly + Volcano。
这条数据长什么样?
微秒点查、可丢
Redis
很大、要多活
Abase
要事务或索引
ByteSQL
多跳关系、大 V
ByteGraph
大文件视频
对象存储 + CDN
关键词
倒排
相似向量
ANN
| 存储 | 公开用途 | 出处 |
|---|---|---|
| OSS / COS / OBS | 业务数据与 Flink checkpoint | Flink Forward Asia 2021 |
| Kafka / RocketMQ | 打点与特征流 | 推荐数据架构分享 |
| 在线 KV | 用户 / 笔记画像、特征点查 | 实时推荐实践(工程惯例 + 分享) |
| Hive | 离线样本、回填、回溯 | Flink + 推荐分享 |
| ClickHouse / Hologres | 实时指标与分析 | Hologres 实践;早期用过 ClickHouse |
| 倒排 / 向量索引 | 关键词检索与 I2I / 双塔 | NoteLLM、搜索分享 |
调度
Volcano 博文把训练和流计算画在同一套 K8s 上:百川管 Flink,Firefly 管 TensorFlow / LarC。模型要分钟到小时级更新时,调度失败和特征对不齐一样致命。