learntoall

NoteLLM

NoteLLM: A Retrievable Large Language Model for Note Recommendation(Zhang 等,WWW'24 Companion,arXiv:2403.01744)是小红书把大模型嵌进 I2I 召回的公开方法。后续 NoteLLM-2(KDD'25,arXiv:2405.16789)补上视觉。

NoteLLM 三件套

模块论文里做什么
Note Compression Prompt把一篇笔记压到一个特殊 token,取出压缩表征。
GCL(生成式对比学习)用协同共现当正样本,让相近笔记的表征靠近。
CSFT(协同监督微调)让模型根据正文生成 hashtag / 类目,强化压缩质量。

论文对比的是当时线上 BERT I2I。作者写:生成标签和生成 embedding 都是「把关键信息压进有限内容」,所以两个任务可以互相帮忙。线上验证后作为召回组件推全。

NoteLLM-2 为什么还要看图

直接拿 LLM 和视觉编码器端到端微调时,模型容易偷懒只看字。NoteLLM-2 给了两招:

  • mICL:提示里把图和文拆开压缩,逼模型两边都看。
  • Late fusion:门控融合原始视觉向量,把图的信息补回最终表征。

离线和线上实验都报告了 I2I 检索指标(Recall / NDCG)提升。视觉编码器在训练中保持冻结,控制成本。