拼多多 AI / 算法怎么准备
拼多多算法面试常问增长和交易:价格敏感、实验、作弊。效率高但更要能证明不是刷出来的。
拼多多怎么面算法
- 会问实验设计。
- 作弊会问训练污染。
- 准备短周期迭代如何仍严谨。
面试阶段与知识点
第一批不把每个阶段拆成独立 URL,避免程序化重复页。阶段对应下面的题,练完再用模拟面试串起来。
- 增长:实验。
- 价格:敏感。
- 作弊:污染。
- 速度:严谨。
值得开口练的题
每题给考察点、思路、结构化参考答案和追问。参考答案用来组织语言,面试时必须换成你自己的项目事实。
新用户红包实验,如何避免被老用户污染?
考察点
- 分流
- 资格
- 网络
回答思路
新客资格在进组前判定并锁定,注意分享带来的网络效应与外溢,主指标与新客留存同看。
结构化参考答案
- 样本上用新用户身份哈希分流,资格变化进组前冻结,设备多账号与回流老用户单独剔除。
- 方法上评估分享链外溢与网络效应,主指标看首单转化与新客七日留存,节假日设分层对照。
- 工程上实验盐与分流逻辑版本化,peek 规范写清,异常可回滚且不影响并行实验。
- 有效性以新客纯净桶与全量桶差异、留存曲线同向,证明增长实验结论未被老用户污染。
面试官可能追问
- 设备多账号怎么办?
- 如何处理节假日?
- 提前看数据被骂 peeking 怎么办?
用户对价格极敏感,推荐只推最便宜是否正确?
考察点
- 体验
- 质量
- 复购
回答思路
最便宜不等于最优,要看复购、退货与物流体验,价格是强特征但不是唯一排序目标。
结构化参考答案
- 样本上按人群价格敏感度分层,追踪首单转化、复购率与退货率,识别低质低价伤害。
- 方法上价格与质量、物流评分联合建模,白牌好货设曝光保护,避免只优化首单 GMV。
- 工程上排序策略可 A/B 回滚,异常退货率触发降权,防止短期指标博弈伤害长期 LTV。
- 有效性以复购与退货对照实验,证明推荐在价格敏感场景仍兼顾零售转化与体验可持续。
面试官可能追问
- 如何发现低质低价伤害?
- 白牌好货如何露?
- 如何避免只优化首单?
作弊流量进了训练,模型会怎样,如何洗?
考察点
- 污染
- 过滤
- 回滚
回答思路
作弊会让模型学到刷手行为,需识别异常节奏与设备、训练排除并回滚到干净检查点。
结构化参考答案
- 样本上识别异常点击节奏、设备簇与低价套利模式,污染样本从训练集剔除或大幅降权。
- 方法上重训前做数据审计,在线再拦同类流量,对抗作弊规则迭代与模型版本同步更新。
- 工程上保留干净检查点可快速回滚,脏数据扩散窗口要量化评估影响范围。
- 有效性以回滚后线上转化质量与误伤真实低价买家的申诉率,证明洗数恢复可验证效果。
面试官可能追问
- 如何减少误伤真实低价买家?
- 对抗作弊如何迭代?
- 脏数据已上线多久还能洗?
实现一个简单的 A/B 分流(用户 id 哈希)并说明偏斜
考察点
- 稳定
- 盐
- 偏斜
回答思路
hash(uid+实验盐) 取模分组,同一用户稳定进组,盐变更则重新划分,禁止事后按转化再分组。
结构化参考答案
- 样本上检查各桶样本量与关键协变量分布,新用户无 id 时用设备 id 并声明局限。
- 方法上 uid 加实验盐哈希取模,盐隔离并行实验,支持分层抽样减少偏斜。
- 工程上分流逻辑入仓版本化,禁止人为指定进组,桶变更需新实验号并保留旧结果。
- 有效性以 SRM 检验与协变量平衡报告,证明分流无系统性偏斜且结论可复现。
面试官可能追问
- 新用户无 id?
- 如何做分层抽样?
- 如何防人为指定进组?
业务要三天出模型,你认为数据还不干净,怎么谈?
考察点
- 最小可用
- 风险
- 并行
回答思路
给最小可用方案加书面风险,并行洗数,而不是只说不行或带病全量。
结构化参考答案
- 指标上列出脏数据类型与预估偏差方向,最小可用方案定义清晰的成功与失败门槛。
- 方法上先上规则或旧模型保底,脏数据不进训练,并行洗数完成后小流量替换。
- 工程上三天交付物可以是可回滚的规则版,模型版需门禁通过,拒绝「先上再洗」无约束全量。
- 有效性以并行洗数后的对照实验与书面风险记录,证明在速度压力下仍保持了可验证严谨。
面试官可能追问
- 被要求「先上再洗」?
- 如何保持信任?
- 你怎样记录?
和岗位、模拟面试一起用
资料管理里保存目标岗位 JD,模拟面试会按简历出题。点题目下的按钮会把本题带进模拟开场,仍需先绑定简历与岗位。