NoteLLM
NoteLLM: A Retrievable Large Language Model for Note Recommendation(Zhang 等,WWW'24 Companion,arXiv:2403.01744)是小红书把大模型嵌进 I2I 召回的公开方法。后续 NoteLLM-2(KDD'25,arXiv:2405.16789)补上视觉。
NoteLLM 三件套
| 模块 | 论文里做什么 |
|---|---|
| Note Compression Prompt | 把一篇笔记压到一个特殊 token,取出压缩表征。 |
| GCL(生成式对比学习) | 用协同共现当正样本,让相近笔记的表征靠近。 |
| CSFT(协同监督微调) | 让模型根据正文生成 hashtag / 类目,强化压缩质量。 |
论文对比的是当时线上 BERT I2I。作者写:生成标签和生成 embedding 都是「把关键信息压进有限内容」,所以两个任务可以互相帮忙。线上验证后作为召回组件推全。
NoteLLM-2 为什么还要看图
直接拿 LLM 和视觉编码器端到端微调时,模型容易偷懒只看字。NoteLLM-2 给了两招:
- mICL:提示里把图和文拆开压缩,逼模型两边都看。
- Late fusion:门控融合原始视觉向量,把图的信息补回最终表征。
离线和线上实验都报告了 I2I 检索指标(Recall / NDCG)提升。视觉编码器在训练中保持冻结,控制成本。