# 小米 AI 产品经理 面经 **来源**: 牛客 @_Sparkle_Starlet, 2025-10 | **岗位**: AI 产品经理 | **类型**: 校招/实习(帖中未区分,以智能体平台项目为主) **来源性质**:牛客社区公开面经(部分为社区整理),本文仅整理原文明确内容,未对经历进行独立核验;未披露信息统一标注“原文未披露”。 **背景**:校招/实习身份未区分,经历主要围绕智能体平台项目;其他背景原文未披露 **渠道**:原文未披露 **结果**:原文未披露 ## 流程概览 简历筛选 → 业务面试(全程围绕智能体平台项目,评测类题目占比高) ## 各轮详情 ### 业务面 **问题清单**: 1. 介绍一下你最近的一个项目吧 2. 这个平台目前使用的情况是什么样的(投稿者项目为智能体平台) 3. 在这个项目中你主要负责的模块是哪个? 4. 模型评估是怎么个评估方法?详细说说 5. 怎么评估所构建的 RAG 知识库的准确率? 6. 智能体平台上线后,用户满意度的评估是怎么个评估方法? 7. 对于模型的评估有没有了解过行业内通用的评估方法或者评估指标? 8. 司南大模型是怎么样的评测方法? 9. 对大模型新的能力有了解吗?比如说 DeepSeek 和 ChatGPT-4 这种模型最大的区别在哪? 10. 大家都说 DeepSeek 好,从你的角度来说为什么觉得 DeepSeek 好,或者不好? 11. 你有了解过 DeepSeek R1 模型的参数规模是多大吗? **参考回答思路**: - **项目介绍**: 平台定位 → 用户与使用数据(DAU、任务完成率等)→ 个人负责模块与边界 → 与算法/工程的协作方式。 - **模型评测体系**: 离线(基准集、人工打分、LLM-as-Judge)+ 在线(点击率、任务成功率、拒答率)+ 回归测试;说明指标如何对齐业务目标。 - **RAG 准确率**: 检索命中率、答案忠实度、引用正确率;可提 chunk 策略、Rerank、评测集构建与 bad case 归因。 - **用户满意度**: NPS/CSAT、会话结束评价、人工抽检、核心任务完成率;区分「模型好」与「用户觉得好用」。 - **行业 benchmark**: 了解 MMLU、HumanEval、司南等评测集的定位;DeepSeek 对比从推理能力、成本、开源生态、中文场景谈,参数规模需查准再答。 ## 总结与建议 - 小米该场面试几乎整轮都在「评测」,是 AI PM 面试中评测导向极强的样本,务必准备一套完整评测叙事。 - RAG 与智能体平台两类系统要分别准备指标,不要混为一谈。 - 对 DeepSeek 等热点模型,准备「能力差异 + 产品化差异 + 局限」三角回答,避免站队式吹捧或贬低。