推荐系统:你为什么停不下来
短视频、购物、新闻流背后是同一类模型。它是机器学习最赚钱的应用,也是最值得每个人看懂的一种。

你打开一个短视频应用,只想看五分钟,抬头时过了一小时。你没有搜索任何东西,每一条都是它选给你的,而且大多数你确实想看。
这不是巧合,是机器学习最成功的一个应用:推荐系统。它不像大语言模型那样引人注目,但它管理着几十亿人每天几小时的注意力,是互联网经济最大的引擎之一。它用的全是第四、五章的原理,而它的副作用,是理解「AI 与社会」最好的入门案例。
它在预测什么
推荐系统的核心是一个预测任务:给定一个人和一个内容,预测这个人会不会点、看多久、会不会点赞、转发、买。这是第四章的监督学习,样本是过去的每一次展示,特征是这个人的历史和这条内容的属性,标签是他当时做了什么。
每次你打开应用,系统从几百万条候选里先粗筛出几千条,再对每一条算一个分数,把分数最高的排在前面。你划过的每一条、停留的每一秒、点开的每一个,都变成了下一轮训练的数据。系统每天用几十亿条这样的样本更新自己。
早期的推荐靠「协同过滤」:喜欢 A 的人也喜欢 B,你喜欢 A,所以推你 B。它不需要理解内容,只需要用户之间的相似。深度学习之后,用户和内容各自被表示成向量(第七章的嵌入),系统学的是「这个用户向量和这个内容向量的匹配度」,能处理的信号从几十种扩展到几千种。
推荐系统有一个天然的难题:新用户没有历史,新内容没有反馈。这叫冷启动。
对新用户,系统会先用人口统计、设备、注册时的选择做粗略的猜测,然后在头几十次展示里故意给各种类型的内容,看你的反应。这就是第三章讲的「探索与利用」:它必须先试,才能知道该利用什么。所以一个新账号在头几天看到的东西很杂,之后迅速收窄。
对新内容,系统会给一小部分随机用户看,用他们的反应决定要不要推给更多人。一条视频的前几百次展示决定它的命运。这个机制让「爆款」成为可能,也让内容创作者学会了在前三秒抓人。
探索是有代价的:每一次给你看你可能不喜欢的东西,都可能让你关掉应用。系统在「多了解你」和「现在留住你」之间做权衡,这个权衡本身也是被优化的。
它在优化什么
预测点击只是手段。系统真正被优化的是一个业务目标,通常叫「留存」或「时长」:让你明天还来,让你今天多待一会儿。
这里出现了第三章的强化学习:每一次推荐是一个动作,你的后续行为是反馈,系统学的是「怎样的一串推荐能让这个人长期留下来」。这比预测单次点击复杂得多,也危险得多:让人长期留下来的,未必是对他好的东西。
一个反复被观察到的现象是:预测「你会点什么」的系统,会逐渐偏向刺激性的、极端的、能引起强烈情绪的内容,因为这些内容的点击率高。系统没有偏好,它只是忠实地优化了被交给它的目标。第三章的奖励破解在这里以社会规模发生:目标是「时长」,学到的是「上瘾」。
反馈循环
推荐系统和其他机器学习系统有一个根本区别:它的预测会改变它的数据。
普通的分类器预测一张图是不是猫,图不会因此变化。推荐系统预测你会看什么,然后只给你看那些,于是你的行为数据全部来自它的选择。它以为你只喜欢某类内容,因为你只看过某类内容,因为它只给你推了某类内容。这是第五章讲的分布偏移的一种自我强化版本,术语叫「反馈循环」。
这个循环的社会版本叫「信息茧房」或「过滤气泡」。它是否真的让人变得极端,研究结论并不一致,有研究发现推荐确实把人推向更极端的内容,也有研究发现人自己的选择起了更大作用。但一件事没有争议:一个只优化短期指标的反馈循环,不会自动收敛到对个人或社会更好的地方。
过去几年,主要平台在推荐系统上加了一些约束,它们大致对应第十二章的「驾具」思路:在模型外面加规则。
限制同类内容的连续出现,强制插入多样性;把「你对这条内容满意吗」这类主动反馈加入目标;对青少年账号使用不同的目标函数和时长限制;对某些类别(健康、金融、政治)降低推荐权重或要求人工审核;提供「为什么推荐这条」的解释和「不感兴趣」的按钮。
这些约束的效果有限,因为它们和核心目标(时长、收入)冲突,而核心目标决定了公司的收入。几个国家的监管开始要求平台提供「非个性化」的选项、公开推荐逻辑、对未成年人施加限制。这是一个技术问题被交回给社会的例子:模型能优化任何给定的目标,但目标应该是什么,不是模型能回答的。
推荐系统与教育
「个性化学习」是教育科技里最常见的承诺,它的技术内核就是推荐系统:根据学生的历史表现,推荐下一道题、下一个视频、下一个知识点。
它有真实的价值。一个学生卡在分数除法上,系统能发现并推送针对性的练习,比统一进度的课堂更贴近他。这是第四章「学情分析」的直接应用。
但推荐系统的每一个问题都会跟过来。它优化的是什么?如果是「答题正确率」,系统会推简单的题;如果是「使用时长」,系统会推有趣但未必有用的内容;如果是「知识点通过率」,系统可能让学生反复刷同一类题而错过迁移。反馈循环也在:系统认为一个学生「弱」,给他简单的内容,他的数据显示他只能做简单的,系统更确信他弱。这是第五章「公平性」那段讲的问题在教育里最隐蔽的形态。
所以评价一个教育推荐产品,问的问题和评价短视频应用一样:它优化的目标是什么?谁定的?学生能不能看到并改变它?老师能不能覆盖它的决定?
使用者能做的几件事
推荐系统不会消失,它确实有用。但你可以不当它的被动数据。
知道它在优化什么。每个应用的推荐都在优化某个指标,而那个指标不是你的福祉。带着这个认识使用,已经是一半的防御。
主动给它信号。「不感兴趣」、取消关注、搜索而不是刷,都是在往它的数据里写你的意图,而不只是你的冲动。
定期打破循环。看看它不推给你的东西。换一个来源。这是在给自己做第三章的「探索」。
给孩子设边界。青少年的推荐目标和成年人不同,但机制相同。时间限制和内容设置不是不信任,是在替一个还没建立判断力的人挡住一个专业的优化器。
记住它只是相关。它推给你,不代表你需要;你看了,不代表你想看。第五章的相关与因果,在这里每天都在上演。
推荐系统与识别猫的分类器,最根本的区别是什么?
答案
推荐系统的预测会改变它的数据:它只给你看它选的内容,你的行为数据全部来自它的选择,形成反馈循环。分类器的预测不影响下一张图。
「系统学到了让人上瘾」,用第三章的概念解释这件事。
答案
奖励破解:目标是时长或留存,系统学到的是最能拿到这个奖励的策略,而刺激性、极端的内容正好点击率高。系统没有偏好,只是忠实优化了目标。
一个教育产品说「个性化推荐能让每个学生按自己的节奏学」,该追问什么?
答案
它优化的目标是什么,谁定的;学生和老师能否看到并改变它;系统认为某个学生「弱」之后会不会只推简单内容,形成自我实现的循环。
本章术语
用带标签的数据训练模型,学习从特征到标签的映射。最成熟、应用最广的范式,识别与预测两类能力主要来自它。瓶颈是标签昂贵。 详
让智能体在环境中反复尝试,按行动之后得到的奖励调整策略,学会「在这种情况下该做什么」。它没有标签,只有奖励;必须处理探索与利用的矛盾。是机器人、游戏 AI 的基础,也是大语言模型对齐阶段的核心方法。 详
部署后的数据与训练数据不再来自同一个「世界」:疫情改变了出行,新教材改变了学情。所有模型都默认「未来像过去」,而这没有保证。因此部署不是终点,监控才是。 详
模型学到的全部是相关(什么与什么倾向于同时出现)。相关足以预测,不足以干预:给每个孩子发平板不会自动提高成绩。区分两者需要实验设计与领域知识,不是更大的模型。辛普森悖论是相关方向可被隐藏变量反转的例子。 详