小红书 AI / 算法怎么准备
小红书算法面试常问内容理解和生态:什么该被看见,什么该被压。转化不是唯一目标。
五题覆盖理解、生态、低质、编码和安全。用你的内容或推荐项目答。
小红书怎么面算法
- 会问你如何定义「好内容」。
- 安全与分发必须分开讲。
- 多模态可能出现。
面试阶段与知识点
第一批不把每个阶段拆成独立 URL,避免程序化重复页。阶段对应下面的题,练完再用模拟面试串起来。
- 理解:笔记。
- 生态:低质。
- 特征:多模态。
- 安全:分发。
值得开口练的题
每题给考察点、思路、结构化参考答案和追问。参考答案用来组织语言,面试时必须换成你自己的项目事实。
如何判断一篇笔记「该被看见」,而不只看点赞?
考察点
- 质量
- 原创
- 负反馈
回答思路
点赞可刷,需结合完读、收藏、关注转化与负反馈,并分领域定义好内容标准。
结构化参考答案
- 指标上采用完读率、收藏、关注转化与举报率多信号融合,分垂类设权重,不单一优化点赞。
- 方法上识别原创与同质内容,负反馈快速降权,新号好内容给有限探索配额保护社区供给。
- 工程上实时信号与离线训练对齐,刷收藏检测与策略回滚机制就绪,避免生态指标被刷穿。
- 有效性以分领域创作者留存与用户会话深度对照,证明分发标准提升了社区理解而非短期互动。
面试官可能追问
- 如何防刷收藏?
- 专业领域如何借专家?
- 新号好内容如何被看见?
同质化笔记刷屏,如何保护生态?
考察点
- 去重
- 作者多样性
- 模板
回答思路
近重复检测加作者多样性约束,模板化内容降权,同时监控创作者供给健康度。
结构化参考答案
- 指标上看列表重复率、作者多样性指数与创作者新发意愿,不单看短期点击率。
- 方法上近重复 embedding 检测,单页限制同作者或同模板曝光,二次创作与系列内容区别对待。
- 工程上召回后过滤链路低延迟,误伤申诉通道与策略灰度回滚,运营专题与算法配额协同。
- 有效性以重复率下降而系列内容与原创曝光未系统性受损的对照,证明生态保护可量化可验证。
面试官可能追问
- 二次创作如何识别?
- 如何避免误伤系列内容?
- 运营专题和算法如何配合?
图文和视频特征如何融合,避免一模态主导?
考察点
- 对齐
- 缺失
- 权重
回答思路
各模态编码后融合,允许缺失模态,训练时随机 drop 防止单模态过拟合主导排序。
结构化参考答案
- 样本上统计各模态缺失率与 OCR 噪声比例,分场景看文本弱、视频无语音等边界分布。
- 方法上各模态独立编码再融合,缺失用默认向量或只走已有模态,训练随机 drop 做鲁棒性。
- 工程上监控各模态贡献度与推理延迟,OCR 错误设置信度门槛,融合策略可消融回滚。
- 有效性以模态消融实验的离线 AUC 与线上完读对照,证明融合增益而非某一模态虚假抬高分数。
面试官可能追问
- OCR 错误如何处理?
- 短视频无语音?
- 如何消融证明融合有用?
给一组用户负反馈,如何快速从候选里过滤?
考察点
- 倒排
- 实时
- 过期
回答思路
负反馈写入倒排索引到作者、话题与内容维度,召回后实时过滤并设过期衰减。
结构化参考答案
- 样本上明确负反馈类型与粒度,区分误点与真实不喜欢,设 TTL 避免永久过度过滤。
- 方法上实时写入倒排,召回阶段过滤命中作者/话题/相似内容,相似内容用 embedding 泛化。
- 工程上保证过滤在推荐延迟预算内完成,过滤过猛导致空列表时降级放宽,支持用户撤销误点。
- 有效性以负反馈后重复曝光率下降与会话长度未显著缩短的对照,证明过滤既快又不过度伤害体验。
面试官可能追问
- 相似内容如何泛化过滤?
- 误点负反馈如何撤销?
- 性能如何保证?
高互动但疑似违规的内容,分发侧怎么做?
考察点
- 先审后发
- 限流
- 协作
回答思路
互动高不是免审理由,安全信号触发限流后交审核,分发与安全职责分离。
结构化参考答案
- 指标上同时看互动量、举报率与安全模型分,限流内容单独统计漏放与误伤,不与正常内容混报。
- 方法上安全信号达阈值先限流不扩大曝光,限流不等于定论,流转人审或机审二次判定。
- 工程上限流策略秒级生效且可回滚,明确算法、工程与审核职责边界,复盘漏放路径。
- 有效性以限流后违规确认率与误限申诉率,证明分发侧在保护社区理解的同时未绕过内容安全。
面试官可能追问
- 限流是否告知作者?
- 如何防报复举报?
- 你如何拒绝「先放再看」?
和岗位、模拟面试一起用
资料管理里保存目标岗位 JD,模拟面试会按简历出题。点题目下的按钮会把本题带进模拟开场,仍需先绑定简历与岗位。