推荐算法的发展历程
·
推荐算法的发展可清晰划分为五个关键阶段:从非个性化规则、协同过滤、机器学习、深度学习,演进至当前的大模型/生成式推荐时代。下面按阶段梳理核心算法、突破与痛点。
一、非个性化推荐(1990年前):规则与统计
- 核心思路:无个性化,依赖热门排行榜、人工编辑、简单统计。
- 代表方法:
- 全局热门:推荐全站点击率/销量最高物品。
- 分类热门:按品类统计热门。
- 人工精选:编辑/专家手动推荐。
- 特点:实现简单、无冷启动;完全忽略个体差异,体验单一。
二、个性化萌芽:协同过滤CF时代(1992–2005)
1992年Tapestry系统首次提出协同过滤,1994年GroupLens奠定自动化推荐基础。
1. 基于用户的协同过滤(UserCF, 1994)
- 逻辑:兴趣相似用户喜欢的,你也可能喜欢。
- 缺点:用户量大时计算相似度成本高;冷启动严重。
2. 基于物品的协同过滤(ItemCF, 1998,亚马逊)
- 逻辑:你喜欢A,常买A的人也喜欢B,推B给你。
- 突破:亚马逊落地,销售额提升约35%,成为工业界标杆。
- 优点:物品数远少于用户数,计算更快、稳定性强。
3. 矩阵分解MF(2005后,SVD/SVD++)
- 背景:CF受数据稀疏、冷启动、噪声影响大。
- 核心:把高维稀疏的用户-物品评分矩阵,分解为用户隐向量+物品隐向量,内积预测评分。
- 代表:SVD、SVD++、PMF、NMF。
- 优点:缓解稀疏、捕捉隐式关联、泛化更强。
三、机器学习时代(2006–2015):特征工程为王
2006年Netflix Prize竞赛(百万美元奖金)引爆研究,特征工程+机器学习成为主流。
1. 逻辑回归LR(2010前,工业界标配)
- 核心:人工构造海量特征(用户、物品、交叉、上下文),输入LR做CTR预估。
- 优点:简单、可解释、训练快、易并行。
- 缺点:依赖人工特征,高阶交叉难捕捉,易欠拟合。
2. 因子分解机FM(2010)
- 突破:自动做二阶特征交叉,无需人工枚举,缓解LR痛点。
- 改进:FFM(域感知FM)进一步提升交叉精度。
3. GBDT+LR(2014,Facebook)
- 架构:GBDT自动做高阶特征组合 → 输出特征 → LR预测CTR。
- 优点:特征能力强、效果好,成为广告/推荐主流。
阶段痛点
- 严重依赖人工特征工程,成本高、周期长;
- 难以建模用户长期兴趣、序列依赖、复杂上下文。
四、深度学习时代(2016–2022):端到端与表示学习
2016年谷歌Wide & Deep发表,深度学习全面接管推荐,核心是Embedding+注意力+序列建模。
1. 基础架构:Wide & Deep(2016,谷歌)
- Wide(记忆):LR部分,记住高频强关联(如“手机→充电器”)。
- Deep(泛化):MLP+Embedding,学习低维稠密向量,泛化到长尾/新物品。
- 影响:成为工业界召回/精排基础框架。
2. 因子分解机进化:DeepFM(2017)
- 融合FM与Deep:自动高低阶特征交叉,无需人工特征,端到端训练。
3. 序列与兴趣建模:DIN/DIEN(2017–2018,阿里)
- DIN(深度兴趣网络):引入注意力机制,根据候选物品动态激活用户历史兴趣(如推“运动鞋”时,重点关注用户历史运动相关行为)。
- DIEN:进一步建模兴趣演化过程(短期/长期兴趣变化)。
4. 全序列建模:Transformer/RecSys(2018后)
- 代表:BERT4Rec、SASRec、TiSASRec。
- 核心:用自注意力捕捉用户长序列依赖、多兴趣、上下文,效果显著提升。
5. 图神经网络GNN(2019后)
- 代表:GCN、GAT、GraphSAGE、LightGCN。
- 核心:把用户-物品交互视为二部图,用GNN学习用户/物品的结构感知Embedding,缓解稀疏与冷启动。
五、大模型/生成式推荐时代(2023–至今):LLM重塑范式
大语言模型(LLM)带来理解、生成、交互、推理的质变,推荐进入“认知智能”阶段。
1. LLM+推荐(检索增强/提示学习)
- 范式:LLM理解用户自然语言意图 → 生成查询 → 检索库召回 → LLM重排/解释。
- 代表:RLM、RecLLM、GPT4Rec、LLaMA-Rec。
- 突破:支持自然语言交互、冷启动极强、跨域推荐、可解释性强。
2. 生成式推荐(Generative Recommendation)
- 直接生成:LLM直接生成个性化物品/内容(如文章、商品描述、视频脚本),无需检索库。
- 代表:GenRec、LLM4Rec、生成式广告。
3. 多模态推荐(2023后)
- 融合文本、图像、视频、音频、行为,用多模态LLM(如Flux、LLaVA、Qwen-VL)统一表示,推荐更精准、自然。
六、各阶段核心对比(速览)
| 阶段 | 时间 | 核心技术 | 个性化 | 冷启动 | 稀疏性 |
|---|---|---|---|---|---|
| 规则统计 | 1990前 | 热门、人工 | ❌ 无 | ✅ 友好 | ✅ 不敏感 |
| 协同过滤 | 1992–2005 | UserCF/ItemCF/MF | ✅ 基础 | ❌ 严重 | ❌ 敏感 |
| 机器学习 | 2006–2015 | LR/FM/GBDT+LR | ✅ 中等 | ❌ 依赖特征 | ❌ 依赖特征 |
| 深度学习 | 2016–2022 | Wide&Deep/DIN/Transformer/GNN | ✅✅ 精细 | ✅ 缓解 | ✅ 缓解 |
| 大模型 | 2023–至今 | LLM/生成式/多模态 | ✅✅✅ 认知 | ✅✅ 极强 | ✅✅ 鲁棒 |
七、总结:演进逻辑与趋势
- 从记忆到泛化:热门→CF→MF→Deep→LLM,不断提升长尾/新物品推荐能力。
- 从人工到自动:人工特征→FM→Deep→端到端→LLM,减少人工依赖、提升效率。
- 从独立到融合:单模态→多模态;单模型→LLM+检索+排序+生成的全链路融合。
- 从行为到认知:从点击/购买行为,到理解意图、兴趣、情感、推理,推荐更懂用户。
要不要我把以上内容浓缩成一页可直接使用的推荐算法演进时间线+核心模型选型清单?
更多推荐




所有评论(0)