华为 AI / 算法怎么准备
华为算法岗公开反馈里,工程约束和评测纪律很重。能落地、能复现,比报 SOTA 更重要。
五题覆盖约束、评测、数据、编码和协作。用你的落地项目答。
华为怎么面算法
- 可能问端侧或资源约束。
- 评测是否可复现。
- 编码基础仍常见。
面试阶段与知识点
第一批不把每个阶段拆成独立 URL,避免程序化重复页。阶段对应下面的题,练完再用模拟面试串起来。
- 约束:可落地。
- 评测:复现。
- 数据:标注。
- 论文:落地冲突。
值得开口练的题
每题给考察点、思路、结构化参考答案和追问。参考答案用来组织语言,面试时必须换成你自己的项目事实。
模型在服务器效果好,端侧算力不够,你怎么压?
考察点
- 蒸馏
- 量化
- 功能降级
回答思路
先定端侧延迟、内存与功耗预算,再按蒸馏、量化、剪枝顺序压模型,不够则降功能。
结构化参考答案
- 指标上写明端侧 P99 延迟、内存峰值与 TOP1 准确率下限,分机型档位分别验收。
- 方法上优先知识蒸馏与 INT8 量化,逐层验证掉点,超阈值则减特征或减模型深度而非硬上。
- 工程上真机多机型回归与 OTA 回滚路径就绪,规格变更需重新签离线评测基线。
- 有效性以端侧 benchmark 与场测对照服务器版增益,证明压缩方案在规格内可落地且效果可验证。
面试官可能追问
- 量化掉点如何找回?
- 如何保证多机型?
- 谁批准降功能?
如何让离线评测可复现,而不是「我这边挺好」?
考察点
- 数据版本
- 种子
- 脚本
回答思路
数据、代码、配置与随机种子全部版本化,他人按文档应能复现同一离线指标。
结构化参考答案
- 指标上固定评测集版本号与主指标定义,每次实验记录数据切片、超参与种子。
- 方法上训练脚本与评测脚本入仓,硬件差异在报告中声明,禁止私下改测试集。
- 工程上 CI 跑标准评测流水线,变更数据集需评审并保留旧版对照,支持一键回滚基线。
- 有效性以第三方或同事按文档复现的指标偏差在约定阈值内,证明评测纪律而非个人口径。
面试官可能追问
- 数据不能公开怎么办?
- 硬件差异如何声明?
- 如何防偷偷改测试集?
标注不一致,模型再强也抖,你怎么治理?
考察点
- 指南
- 一致性
- 抽检
回答思路
先修标注指南与双标一致率,难例仲裁后再训模型,一致率作数据门禁。
结构化参考答案
- 指标上统计双标一致率、难例占比与随时间概念漂移,分任务类型分别报。
- 方法上写指南与正反例,双标算 Cohen kappa,低一致批次返工或专家仲裁。
- 工程上标注平台版本化指南,一致率低于门槛阻断训练入仓,外包批次抽检可回滚。
- 有效性以一致率提升后模型跨版本指标方差缩小,证明数据质量治理带来可复现的效果增益。
面试官可能追问
- 专家少怎么办?
- 如何处理随时间概念漂移?
- 外包质量如何控?
实现混淆矩阵并说明精确率召回率适用场景
考察点
- TP/FP
- 不平衡
- 场景
回答思路
先实现四格计数,再解释不平衡下精确率与召回的取舍:安全偏召回,打扰用户偏精确。
结构化参考答案
- 样本上构造不平衡测试集,覆盖全负、全正与典型混淆边界,验证计数与 sklearn 对齐。
- 方法上由 TP/FP/FN/TN 推导精确率召回率,多分类可用宏平均,阈值沿 PR 曲线选取。
- 工程上说明指标选择需与业务损失对齐,端侧或实时场景要考虑计算开销与规格限制。
- 有效性以单元测试通过与业务 case 说明哪类场景主看召回哪类主看精确,证明实现与语义一致。
面试官可能追问
- 多分类如何宏平均?
- 阈值如何选?
- 如何和业务损失对齐?
研究同学要上复杂模型,工程认为不可维护,你怎么站?
考察点
- 增益
- 复杂度
- 阶段
回答思路
用同等数据下的增益与运维成本说话,分阶段:复杂模型离线验证,在线蒸馏交付。
结构化参考答案
- 指标上要求复杂模型相对基线的离线增益与线上一致性,运维人力与故障率纳入决策。
- 方法上先复杂模型离线探顶,再蒸馏或量化给工程可维护版本,达不成增益则书面结论。
- 工程上定义可维护标准如依赖、延迟与回滚时间,未达标不上线,失败路径可快速回退。
- 有效性以分阶段实验记录与线上小流量对照,证明在规格与可维护约束下拿到了可验证增益。
面试官可能追问
- 如何避免打压研究?
- 谁定义可维护?
- 失败如何回退?
和岗位、模拟面试一起用
资料管理里保存目标岗位 JD,模拟面试会按简历出题。点题目下的按钮会把本题带进模拟开场,仍需先绑定简历与岗位。