--- type: 题库 status: 已发布 level: 进阶 topic: - 面试求职 - 模型训练 --- # 1000篇小红书AI算法岗面经:难度递增整合版 > 相似题目按考察意图保守整合;不同限制条件、子问、场景和实现要求均保留。各二级分类内按难度递增排列。 # 编程与数据结构算法 ## 数组与字符串 **L0 上下文不足(难度待定)** **上下文不足** 1. 最后一组到底反不反? 「字节跳动」 2. 算法题,找到好的子数组,Leetcode Hot100的难度。 「字节跳动」 3. 除了切分,还有哪些查? 「腾讯」 **L1 基础认知** 1. 【Python可变与不可变】列表、元组是否可变? 「阿里巴巴」 2. 【vector访问】怎么找某vector的倒数第二个元素? 「百度」 3. 【两数之和】手撕很简单,leetcode 001 two sum 「腾讯混元」 4. 【数组与链表区别】请解释数组和链表的主要区别,以及它们各自适合的应用场景。 「美团」 5. 【最长公共前缀】手撕 最长公共前缀 「京东」 **L2 原理理解** 1. 【NumPy优势】numpy和数组的区别、numpy的好处和原因,以及numpy对比python原生的列表或接口的优势 「美团」 2. 【pandas筛选】pandas筛选数据的题目。 「百度」 3. 【vector vs list】vector与list的区别与应用? 「百度」 4. 【三角矩阵】上三角矩阵,下三角矩阵 「百度」 5. 【两数之和】给定一个整数数组 nums 和一个整数目标值 target,请你在该数组中找出和为目标值的那两个整数,并返回它们的数组下标。 「京东、美团、腾讯、阿里巴巴」 6. 【两数之和 II】实现两数之和2(LeetCode 167)。 「百度」 7. 【两数和为K的组合数】代码题:一组正整数数组中有多少两数和为K的组合 「字节跳动」 8. 【买卖股票的最佳时机】买卖股票的最佳时机:LeetCode 121(一次交易)和122(多次交易)。 「字节跳动」 9. 【删除有序数组中的重复项】手撕代码,leetcode 26(删除有序数组中的重复项),CUDA矩阵乘。 「百度」 10. 【删除重复字符】算法题:删除重复字符串。 「京东」 11. 【前缀乘积】前缀乘积。 「百度文心」 12. 【去重】如果输入列表中可能包含重复元素,如何避免重复解? 「美团」 13. 【反转字符串中的单词】反转字符串的每个单词(后输出的单词先输出)。 「美团」 14. 【合并两个有序数组】手撕代码:两个升序序列的合并,询问思路和复杂度。 「字节跳动」 15. 【合并有序数组】合并两个有序数组(核心代码模式)。变体:合并后去重,如何保证时间复杂度? 「字节跳动、美团」 16. 【多数元素】手撕:找出数组中出现次数大于数组长度一半的多数元素(LeetCode 169)。 「字节跳动、百度、美团」 17. 【字符串拼接性能】大量字符串拼接(如上万字符串)应该用什么方式?能否直接用“+”?用 string 以及并发的时间复杂度分别是多少? 「百度、美团」 18. 【字符串相加】两数相加的字符串版本(LeetCode模式)。 「腾讯」 19. 【字符串移位】给一个字符串例如'abcde',依次将第i个字符移到末尾,'abcde'->'bcdea'->'bdeac'->'bdace'->'bdaec'->'bdaec'。 「百度」 20. 【字符串空格处理】code:删除字符串中多余的空格,只保留一个。 「京东」 21. 【山脉数组的峰顶索引】山峰数组的索引(山脉数组的峰顶索引)。 「美团」 22. 【数组交集】两个数组的公共部分(数组交集)。 「腾讯」 23. 【数组旋转】手撕代码:字符数组原地向右挪动K位(数组旋转)。 「拼多多」 24. 【无重复字符最长子串】手撕无重复字符的最长子串(LeetCode 3,Hot100)。给定一个字符串s,找出其中不含有重复字符的最长子串的长度。变体:最长不同子数组的长度。 「京东、字节Seed、字节跳动、美团、腾讯、腾讯混元、阿里巴巴」 25. 【最大和第二大】给定一个数组,找出数组中值最大和值第二大的两个数值,考虑时间复杂度尽可能低。 「百度」 26. 【最大子数组和】最大连续子数组和(最大连续数字序列)。 「百度、美团、蚂蚁集团」 27. 【有序数组的平方】算法题:有序数组的平方(LeetCode 977)。 「腾讯」 28. 【汇总区间】实现汇总区间。 「字节跳动」 29. 【洗牌算法】手撕题1:扑克牌打乱(洗牌算法) 「字节跳动」 30. 【矩阵转置】matrix transpose(矩阵转置) 「字节跳动」 31. 【连续相同数字最大次数】代码题:求数组连续出现相同数字的最大次数(一次遍历的easy题)。 「字节跳动」 **L3 实现与应用** 1. 【KMP算法】KMP算法是什么?解释其核心思想,包括next数组的构建和匹配过程。 「百度」 2. 【vector扩容与emplace_back】C++ vector相关问题:1. vector容器的用法和扩容机制;2. 为什么每次扩容是两倍增长,而不是3倍或其他数值?3. emplace_back和push_back的区别。 「字节跳动、百度」 3. 【三数之和】实现三数之和算法(LeetCode 15)及其变体:LeetCode 15 改成了3(具体变体未说明,保留原描述)。要求找出数组中所有和为0的三元组,不可重复。 「京东、百度、美团、腾讯、蚂蚁集团、阿里巴巴」 4. 【下一个排列】实现LeetCode 31题:下一个排列。给定一个整数数组(表示一个数字),找到该数字的下一个字典序更大的排列。如果不存在下一个更大的排列,则将数组重新排列为最小的升序排列。要求原地修改,仅使用常数额外空间。 「字节Seed、百度」 5. 【两数之和 II - 输入有序数组】实现排序数组中和为给定值的数组对数,要求时间复杂度O(n),空间复杂度O(1)。 「阿里通义」 6. 【乘积为正数的最长子数组】leetcode medium 1567. 乘积为正数的最长子数组长度。给定一个整数数组,找出乘积为正数的最长连续子数组的长度。 「字节跳动」 7. 【乘积最大子数组】手撕:乘积最大子数组(LeetCode 152)。给定一个整数数组,找出乘积最大的连续子数组(至少包含一个数),返回最大乘积。 「字节跳动、腾讯」 8. 【交替符号求和】给一个整数列表如[1,2,3,4],依次加上符号变成1+2-3+4,然后如下放进列表:[1+2,2-3,3+4]即[3,-1,7],一直到列表中只有最后一个数字,输出这个数字。 「百度」 9. 【全排列】实现不重复的全排列(LeetCode 46)。给定一个不含重复数字的数组,返回所有可能的全排列。 「MiniMax、字节跳动、百度、阿里巴巴」 10. 【全排列 II】实现全排列II(LeetCode 47)。 「百度」 11. 【删除字符串中的连续空格】实现删除字符串中的连续空格,要求O(n)时间复杂度、O(1)空间复杂度。 「阿里通义」 12. 【删除重复元素】手撕:删除字符串中的重复元素II aicoding(搭建一个推荐页面) 「美团」 13. 【前后缀分解】某道用前后缀分解做的问题。 「字节跳动」 14. 【合并区间】实现合并区间算法(LeetCode 56)。先讲思路,写代码,写输入输出并运行,分析时间复杂度。 「字节跳动、百度、腾讯、腾讯混元、阿里巴巴」 15. 【和为K的子数组】给定整数数组和目标值 K,求和为 K 的连续子数组(LeetCode 560):分别考虑统计数量或找到所有满足条件的子数组,以及返回子数组起始与终止位置;K 可取 0。区间返回变体的示例数组为 [2,1,4,-1,5,0],原记录未注明 K 的具体值。 「字节跳动、百度、蚂蚁集团、阿里巴巴」 16. 【和可被K整除的子数组】LeetCode 974. 和可被K整除的子数组。给定一个整数数组和一个整数K,返回和可被K整除的连续子数组的个数。 「腾讯」 17. 【在排序数组中查找元素的第一个和最后一个位置】实现LC34:在排序数组中查找元素的第一个和最后一个位置(LeetCode 34)。给定一个按非递减顺序排列的整数数组和一个目标值,找出目标值在数组中的开始位置和结束位置。如果不存在,返回[-1, -1]。要求时间复杂度O(log n)。 「字节跳动、百度、阿里巴巴」 18. 【复原IP地址】手撕:给定一个只包含数字的字符串,求有多少种划分正确IP地址的方式。变体:给定一个字符串,如"2552325523",进行正确的IP切分,返回["255.232.55.23", "255.23.255.23"]。 「美团、腾讯、阿里巴巴」 19. 【大数加法】算法题:leetcode大数加法。 「美团」 20. 【子序列和】手撕:给一个数组和一个目标值,返回所有和为目标值的子序列。 「京东」 21. 【字符串四则运算】code: 字符串四则运算(LeetCode 227)。实现一个基本计算器来计算一个简单的字符串表达式的值,表达式包含非负整数和加减乘除运算符,不含括号。 「阿里巴巴」 22. 【字符串相加】实现字符串相加。 「字节跳动」 23. 【字符串重排序】实现字符串重排序之后的重合。 「腾讯」 24. 【对角线遍历矩阵】手撕对角线遍历矩阵。 「美团」 25. 【寻找峰值】如何快速找出一个数组的一个峰值(峰值即比左右两个数都大)? 「京东、字节跳动」 26. 【寻找重复数】给定长度为n+1的数组nums,其中元素取值范围为[1,n],求唯一的重复数。 「字节Seed」 27. 【岛屿数量与无重复子串】手撕代码:1. 岛屿数量(LeetCode 200):给定一个由'1'(陆地)和'0'(水)组成的二维网格,计算岛屿的数量。2. 无重复字符的最长子串(LeetCode 3):给定一个字符串,找出其中不含有重复字符的最长子串的长度。要求用滑动窗口或哈希表高效解决。 「美团、腾讯、腾讯混元、阿里巴巴」 28. 【括号生成】手撕括号生成。 「字节跳动」 29. 【搜索二维矩阵】写题:搜索二维矩阵,矩阵每行递增,且每行最后一个元素小于下一行第一个元素(类似力扣240),查找target是否存在。 「百度、美团」 30. 【搜索旋转排序数组】实现搜索旋转排序数组(LeetCode 33):给定一个按升序排列的数组,在未知的某个点上进行了旋转,以及一个目标值,要求使用二分查找算法在数组中搜索目标值,返回其索引,若不存在则返回-1。 「字节跳动、百度、阿里巴巴、阿里通义」 31. 【搜索旋转排序数组 II】手撕:LeetCode81 搜索旋转排序数组。假设数组原本按升序排列,但在某个未知点进行了旋转。给定一个目标值,如果目标值存在于数组中则返回true,否则返回false。数组可能包含重复元素。 「拼多多」 32. 【数组条件标识】特别数标识输出给一个数组,针对数组中每一个数字,如果它大于左侧所有数字且小于右侧所有数字,则对应位置标识为1,不满足任何一个条件则标识为0。 「百度」 33. 【旋转数组最小值与岛屿数量】手撕:旋转数组最小值(leetcode easy),岛屿数量(leetcode middle)。 「腾讯」 34. 【最大子数组乘积】实现连续子数组的最大乘积和,并说明若改为求连续子数组的最大乘积,思路有何变化? 「京东、百度」 35. 【最大连续子串(元素小于T)】一个数组,找出一个最大连续子串,要求子串中每个元素都小于T。 「百度」 36. 【最小逆序对】一个最小逆序对。给定一个数组,求逆序对的数量(即满足ia[j]的对数)。 「京东」 37. 【最长公共子数组】手撕:最长公共子数组。 「美团」 38. 【最长回文子串】手撕最长回文子串(LeetCode 5),要求输出子串,ACM格式,注意输入格式正确。 「京东、字节跳动、拼多多、百度、美团、阿里巴巴」 39. 【最长无重复子序列】手撕代码:最长无重复子序列。 「字节跳动」 40. 【最长连续序列】实现最长连续数字串(LeetCode 128 最长连续序列)。 「百度、腾讯」 41. 【有效三角形个数】有效三角形的个数(LeetCode 611)。 「阿里巴巴」 42. 【比较版本号】实现比较版本号。 「字节跳动」 43. 【滑动窗口最值】一个裁判打分,用滑动窗口记录最大值,最小值。给定一个数组和一个窗口大小k,计算每个滑动窗口内的最大值和最小值。 「京东」 44. 【组合】组合(LeetCode 77)。 「阿里巴巴」 45. 【螺旋矩阵】代码实现螺旋矩阵(顺时针遍历二维矩阵),即LeetCode 54题。 「字节跳动、美团、蚂蚁集团、阿里通义」 46. 【观光景点得分】观光景点最高得分。 「百度」 47. 【路径转换】一个路径转换题。具体描述缺失,保留原题。 「百度」 48. 【跳跃游戏】手撕算法:跳跃数组。 「字节跳动」 49. 【递增序列变体】算法题:递增序列变体。 「美团」 50. 【递归字符切分】递归字符切分逻辑。 「美团」 51. 【长度最小子数组】手撕:长度最小子数组问题(LeetCode 209/Hot100),返回最小长度。 「拼多多、百度」 52. 【除自身以外数组的乘积】代码:除自身外数组乘积(LeetCode 238/Hot100)。 「腾讯」 **L4 优化与诊断** 1. 【两个有序数组的中位数】两个有序数组找中位数 「字节跳动」 2. 【和至少为K的最短子数组】和至少为K的最短子数组长度。 「字节跳动」 3. 【圆柱体过隧道】有两个数组M和N,N代表一系列直径为M[i]的连续隧道,M代表一系列直径为N[i]的圆柱体,按顺序将一系列圆柱体往隧道里送,如果圆柱体直径大于某段隧道直径就会卡住,后续圆柱体也过不去,求最后圆柱体所在的最小位置,如果都通过了就返回-1。 「字节跳动」 4. 【多维数组形状与求和】给列表套列表套列表,问这个array的shape,再分别写一下对每个axis求和的结果是什么,对axis求和的数学依据是什么,为什么是这几个element求和,从数学角度怎么解释? 「阿里通义」 5. 【小于n的最大值】小于n的最大值(leetcode无原题)。 「字节跳动」 6. 【山脉数组中不重复元素个数】手撕:一个数组先递增后递减,找出不重复的元素个数,要求常数空间复杂度,线性时间复杂度。 「百度」 7. 【打散连续重复元素】输入一个序列,输出调整后的序列,目标是将序列中相同的连续的元素打散隔开,尽量保证原有的序列变化不大。示例: 1322254 -> 1325242,132225 -> 132522。 「阿里巴巴」 8. 【接雨水】实现接雨水算法(LeetCode 42)。 「百度、美团、阿里巴巴」 9. 【搜索旋转数组变体】搜索旋转数组非常规。 「百度」 10. 【数组按轴求和】code:手写一下对给定axis求和(得分前面的维度和后面的维度,先flatten然后再求和的时候每次加stride)。 「阿里通义」 11. 【最小覆盖子串】手撕最小覆盖子串:给定两个字符串s和t,请在s中找出包含t所有字符(出现次数也要满足)的最短子串。变体1:Code字符串中包含query字符的最短子串。变体2:给一个长度为L的数组,可能是m种颜色,找到最小的n,使得连续n个元素包含全部m种颜色。 「京东、美团、蚂蚁集团、阿里通义」 12. 【最长重复子数组】Leetcode718最长重复子数组(要求小于O(n))。 「字节Seed」 13. 【有序矩阵第K小】二维有序数组的第k个数 「百度」 14. 【滑动窗口最长不重复子串】给定一个字符串流,实现一个滑动窗口,返回当前窗口内的最长不重复子串长度。 「字节跳动」 15. 【移动球的最小操作数变体】手撕leecode1769的变体,改成每移动一个站台需要一个能量 「小红书」 16. 【编辑距离】实现编辑距离。 「蚂蚁集团」 17. 【缺失的第一个正数】给定一个数组,找出缺失的最小正整数(LeetCode 41)。要求时间复杂度O(N),空间复杂度O(1)。请讲下你的双指针slow/fast思路,并分析时间复杂度。 「字节Seed、字节跳动、百度」 18. 【至多K个不同字符的最长子串】【LeetCode - 340】至多包含 K 个不同字符的最长子串。 「百度」 19. 【预处理优化查询】用户会反复调整K;不能每次调整都让用户等很久,要优化latency。预处理时就把每个标点的位置和间隔文本长度一起存下来;后面长度直接查、不用重新遍历。 「阿里巴巴」 **L5 综合与前沿** 1. 【车队II】LeetCode Hard 1776. 车队II。 「字节跳动」 ## 链表 **L2 原理理解** 1. 【K个一组翻转链表】K个一组翻转链表时,k=1或k大于链表长度应如何处理? 「字节跳动」 2. 【合并有序链表】Coding:归并排序两个有序链表 (LeetCode 21)。 「字节跳动、美团、腾讯混元」 3. 【环形链表检测】代码题/手撕:实现环形链表检测(LeetCode 141),判断链表是否有环。 「拼多多、百度、美团」 **L3 实现与应用** 1. 【K个一组反转链表】K个一组反转链表(LeetCode 25):先讲思路再写代码。变体:两两反转链表(即K=2)。变体:纸上写k组无序链表排序(即先对每组内排序再反转?需明确)。 「拼多多、美团、腾讯」 2. 【删除链表倒数第N个节点】删除链表的倒数第N个节点(LeetCode 19):解释思路(如快慢指针或暴力法)。变体:返回倒数第K个节点,口述思路。 「百度、腾讯、腾讯混元」 3. 【删除链表节点】如何删除单链表的某个node(只给指向该node的指针而不是head)?CUDA? 「字节跳动」 4. 【删除链表重复元素】删除链表中重复的元素II(LeetCode 82):手撕代码。 「京东、字节跳动」 5. 【反转链表】反转链表(LeetCode 206):要求递归和迭代两种方式;包括反转链表II(部分反转,LeetCode 92)。 「字节跳动、百度、阿里巴巴、阿里通义」 6. 【合并K个升序链表】合并K个升序链表(LeetCode 23):多个链表合并。 「腾讯」 7. 【环形链表】长度为n的链表,判断是否回环,并返回回环的节点(LeetCode 142 环形链表II),如果没有回环,返回None。 「百度」 8. 【相交链表】是否重合链表(LeetCode 160 相交链表)? 「腾讯」 9. 【重排链表】重排链表(LeetCode 143):手撕代码。 「百度、美团、阿里通义」 10. 【链表两数相加】链表两数相加(LeetCode 2):需自己定义链表数据结构,使用双指针法,并分析时间复杂度和空间复杂度。 「字节跳动、百度、美团、腾讯、腾讯混元」 11. 【链表优化】手撕链表相关的题,问时间复杂度,怎么优化。链表过长还有什么优化? 「美团、腾讯」 12. 【链表排序】按照node->val的绝对值排序链表。 「字节跳动」 **L4 优化与诊断** 1. 【K个一组翻转链表】实现K个一组反转链表(LeetCode 25),最后不足K个也要反转。要求手撕代码。 「字节跳动、百度、美团、阿里巴巴」 2. 【LRU缓存】手写LRUCache。 「腾讯」 3. 【合并K个升序链表】手写代码实现合并K个升序链表(LeetCode 23. Merge k Sorted Lists),要求使用堆(heapq)的方法,并给出完整实现。 「字节跳动、百度、阿里巴巴」 4. 【复制带随机指针链表】复制带随机指针的链表。 「蚂蚁集团」 5. 【排序链表】实现排序链表。 「字节跳动」 6. 【链表性能开销】在实际开发中,链表的插入和删除操作虽然复杂度较低,但它是否有其他潜在的性能开销?比如在内存管理或其他方面,你怎么看? 「美团」 7. 【链表相交判断】判断两个单链表是否相交(可能有环);判断链表是否相交? 「字节跳动、百度」 ## 树与二叉树 **L1 基础认知** 1. 【二叉搜索树查找复杂度】二叉搜索树查找的时间复杂度是多少? 「百度」 2. 【二叉树先序遍历】二叉树先序遍历 「百度」 3. 【二叉树最大深度】二叉树的最大深度 「字节跳动」 4. 【二叉树遍历】二叉树的遍历方式有哪些?并分别说明前序、中序、后序遍历是什么?中序遍历的结果有什么特点? 「百度」 5. 【搜索树节点数量】搜索树的节点数量一般有多少? 「美团」 **L2 原理理解** 1. 【二叉搜索树退化与平衡】为什么二叉搜索树会退化?最坏情况下会发生什么?如何避免二叉树退化? 「百度」 2. 【二叉树层序遍历】实现二叉树的层序遍历(LeetCode 102. 二叉树的层序遍历),手写代码,并分析时间复杂度和空间复杂度。 「字节Seed、字节跳动、美团、阿里巴巴」 3. 【多叉树查找】多叉树查找值,时间复杂度要求最优,BFS/DFS都行。 「腾讯」 **L3 实现与应用** 1. 【B+树范围查询】范围查询(如between)在B+树中是如何执行的? 「百度」 2. 【N叉树扩展】扩展到 N 叉树怎么改。 「拼多多」 3. 【二叉搜索树第k小元素】搜索二叉树第k个大小的数。 「腾讯」 4. 【二叉搜索树范围查询】如果用普通二叉搜索树,范围查询怎么做? 「百度」 5. 【二叉树下一个节点】二叉树的下一个节点(node有prev和next指针)。 「百度」 6. 【二叉树中序遍历非递归】实现二叉树的中序遍历非递归。 「字节跳动、百度、阿里巴巴」 7. 【二叉树转链表】手撕: 二叉树展开为链表(二叉树转为单链表)。变体:二分查找树转换为链表。 「百度、腾讯」 8. 【保证树平衡】(追问)如何保证生成的树是平衡的? 「快手」 9. 【先序构建二叉搜索树】手撕:先序遍历构建二叉搜索树(有复杂度要求)。 「美团」 10. 【反转二叉树】反转二叉树(非递归反转二叉树)。 「腾讯、阿里通义」 11. 【固定高度子树序列化】用你熟悉的语言(优先用C++)遍历一棵二叉树(不一定是满二叉),输出以每个结点为根、固定高度为K的子树。要求:每棵子树分别以深度优先顺序进行序列化。 「腾讯」 12. 【子树判断】Code:另一棵树的子树。判断一棵树是否是另一棵树的子树。 「阿里通义」 13. 【对称二叉树】算法题:对称二叉树。 「百度」 14. 【最近公共祖先】二叉搜索树的最近公共祖先(LeetCode 236),并找到离给定两个节点最近的节点。 「京东、字节跳动、百度」 15. 【有序数组转二叉搜索树】手撕:将有序数组转换为二叉搜索树。 「快手」 16. 【构建树】根据输入的数据(id,name,parentid)创建一棵树,越快越好,如果输入不对有报警机制。 「字节Seed」 17. 【树的层次遍历】算法题环节是一道树的层次遍历。 「美团」 18. 【根到叶数字之和】LeetCode 129. 求根节点到叶节点数字之和。 「字节跳动、蚂蚁集团」 19. 【每层最大值】二叉树每一层的最大值。 「百度」 20. 【红黑树与AVL树】讲一下红黑树,并说明红黑树和AVL树的时间复杂度是多少? 「百度、腾讯混元」 21. 【路径总和】给定一个二叉树和一个目标值,判断是否存在一条从根节点到叶子节点的路径,使得路径上所有节点值之和等于目标值。 「字节跳动、拼多多、百度」 22. 【退化阈值】退化回链表的阈值是多少? 「字节跳动」 23. 【重建二叉树】根据前序和中序遍历重建二叉树,并说出后序遍历。 「百度、腾讯混元、阿里通义」 24. 【锯齿形层序遍历】LeetCode medium 103. 二叉树的锯齿形层序遍历。 「字节跳动」 **L4 优化与诊断** 1. 【二叉树左右视图】二叉树的左右视图,要求实现列表转二叉树(建树),并分别输出左视图和右视图,采用ACM模式(自己处理输入输出)。 「字节Seed、字节跳动」 2. 【二叉树打家劫舍】leetcode medium 337. 打家劫舍III。 「字节跳动」 3. 【二叉树放水算法】实现二叉树放水算法。 「MiniMax」 4. 【二叉树最大路径和】Code: 二叉树中的最大路径和(LeetCode 124,Hard)。手撕代码,找到二叉树中任意两个结点之间的最大路径和。 「字节跳动、拼多多、百度、美团、阿里巴巴、阿里通义」 5. 【动态规划二叉搜索】场景题,动态规划二叉搜索。 「美团」 6. 【路径总和III】手撕:路径总和III 「字节跳动」 7. 【验证前序序列化】手撕:lc331 验证二叉树的前序序列化 问复杂度,优化方法 「字节Seed」 ## 图与搜索 **L1 基础认知** 1. 【BFS与DFS基础】coding 基础:DFS和BFS分别是什么? 「百度」 **L3 实现与应用** 1. 【A*算法】A*算法相关:1. A*中的close和open指的是什么?2. A*算法的原理是什么?3. BFS,A*和Dijkstra的关系。4. 介绍A*和hyper A*的区别?5. 如何在自动驾驶中优化A*?6. 它和Dijkstra的区别是什么?7. 怎么从路由图上找最短路径? 「百度、腾讯」 2. 【单词搜索】给定一个二维字符矩阵和一个字符串,判断该字符串是否在矩阵内,要求连续路径由上下左右相邻的单元格组成,且每个单元格只能使用一次。实现单词搜索函数。 「字节跳动、百度」 3. 【图搜索传染】手撕图搜索传染题 「蚂蚁集团」 4. 【图遍历】LeetCode 841. 钥匙和房间。 「字节跳动、阿里巴巴」 5. 【岛屿数量】岛屿问题:1. 实现岛屿数量(LeetCode 200),要求分别用DFS和BFS实现,并说明并查集思路(代码可不写出)。2. 手撕岛屿最大面积(最大连通域的面积),要求用DFS或BFS遍历网格,求每片岛屿的面积。3. 找最大连通子图的大小。4. 手撕算法:子集型回溯问题。 「京东、字节Seed、字节跳动、拼多多、百度、美团、腾讯、阿里巴巴、阿里通义」 6. 【拓扑排序】LeetCode 207. 课程表(中等):给定一个项目列表和一个依赖关系列表(依赖关系是项目对的列表,其中第二个项目依赖于第一个项目),判断是否可能完成所有课程(即是否存在拓扑排序)。 「字节跳动、美团」 7. 【最小生成树】coding 最小生成树算法 「蚂蚁集团」 8. 【禁忌搜索】介绍一下禁忌搜索。 「京东」 9. 【粒子群优化】介绍一下粒子群优化。 「京东」 10. 【走迷宫最短路径】算法题:走迷宫问题(DFS/BFS) 给定一个二维网格,0表示可以通过,1表示障碍物,求从起点到终点的最短路径。 「字节跳动」 11. 【骑士最短路径】手撕:马在m*n棋盘上从x0,y0走到x1,y1的最小步 「京东」 **L4 优化与诊断** 1. 【八数码问题】写题:给你一个3*3的数组,数字为1-8八个数字(这八个数字位置任意)以及一个空位,假定你每次只能交换空位和它上下左右四个方向的元素,问某个给定的数组能否转为如下代码所示的样子。 「阿里通义」 2. 【凸包算法】三维点凸包计算及凸包算法(Graham扫描法)。 「腾讯」 3. 【图扫描与独立性判断】你怎么扫描图、怎么判断独立性、怎么决定要不要下手? 「阿里巴巴」 4. 【岛屿数量变体】不同形状的岛屿数量。 「MiniMax」 5. 【网格判环】无向网格四连通判环。 「MiniMax」 6. 【路径平滑】怎么做路径平滑,目标函数设置、平滑度计算公式、约束条件? 「百度」 **L5 综合与前沿** 1. 【拓扑排序】拓扑排序实现任务调度器并用伪代码实现work-stealing的优化版本 「阿里巴巴」 ## 动态规划 **L1 基础认知** 1. 【爬楼梯】实现爬楼梯(LeetCode 70),要求给出两种解法(如动态规划与递归/迭代),并写出代码。 「京东、百度、美团」 **L2 原理理解** 1. 【动态规划原理】动态规划的原理和理解 (最优控制角度)。请从最优控制的角度解释动态规划的原理,包括最优子结构、重叠子问题、状态转移方程等核心概念。 「百度」 2. 【动态规划状态转移】状态转移方程求max为什么不加一个dp[i-1][j-1]?请解释在动态规划中,例如求解最长公共子序列或编辑距离等问题时,状态转移方程中为什么有时不包含 dp[i-1][j-1] 项,而只考虑 dp[i-1][j] 和 dp[i][j-1] 的 max。 「腾讯」 3. 【最大子数组和】实现最大子数组和(LeetCode 53),即求连续子数组的最大和。给定一个整数数组 nums,找到一个具有最大和的连续子数组(子数组最少包含一个元素),返回其最大和。 「京东、字节跳动、美团」 4. 【最小路径和】二维dp:最短路径。给定一个包含非负整数的 m x n 网格,请找出一条从左上角到右下角的路径,使得路径上的数字总和最小。每次只能向下或者向右移动一步。 「腾讯」 5. 【网格路径计数】手撕代码矩阵走法:M行N列二维矩阵,左上角起点,右下角终点,每次只能向右或向下走一格,一共有多少种走法? 「美团」 **L3 实现与应用** 1. 【0-1背包】手撕:类似于子集划分,0-1背包问题。 「腾讯」 2. 【乘积最大子数组】手撕代码:乘积最大子数组(LeetCode 152)。给定一个整数数组(包含正数和负数),求乘积最大的连续子数组的乘积。要求使用动态规划实现。 「腾讯、腾讯混元、阿里巴巴、阿里通义」 3. 【优美的排列】写题: leetcode 526,优美的排列 「蚂蚁集团」 4. 【分割等和子集】代码:416.分割等和子集(0-1背包划分等和数组) 「字节跳动、腾讯」 5. 【划分型DP】某划分型DP问题(题目和minmax有关,我忘记了6) 「字节跳动」 6. 【动态规划综合】手撕一道动态规划题,难度介于中等和困难之间,非LeetCode原题。 「字节跳动、腾讯混元、蚂蚁集团」 7. 【单词拆分】单词拆分(LeetCode 139) 「阿里巴巴」 8. 【完全平方数】给定一个正整数,求它最少能由几个完全平方数相加得到。例如,12 = 4 + 4 + 4,答案为3。手撕代码。 「百度、蚂蚁集团」 9. 【打家劫舍】手撕/实现打家劫舍算法。 「字节Seed、字节跳动、百度、阿里通义」 10. 【整除3的最大和】手撕:给一个正整数数组,找出里面能被3整除的和的最大值。 「腾讯」 11. 【最大正方形】手撕 LeetCode 221:最大正方形。给定一个由 '0' 和 '1' 组成的二维矩阵,找出只包含 '1' 的最大正方形,并返回其面积。要求使用动态规划实现。 「字节Seed、百度、百度文心、美团」 12. 【最小路径和】手撕最小路径和:在二维矩阵中,从右上角到左下角的最短加权路径和,中间还有-1的障碍物不能走。要求使用动态规划实现。 「京东、美团」 13. 【最长公共子串】手撕:求最长公共子串。 「字节Seed、腾讯」 14. 【最长公共子序列】手撕:最长公共子序列(LCS),要求使用二维动态规划实现;最长公共子串。 「字节跳动、拼多多、百度、腾讯、腾讯混元、阿里通义」 15. 【最长回文子序列】最长回文子序列 「百度」 16. 【最长连续相同字符】一个数组只有a和b,有m次机会能把a换成b或b换成a,变化之后的最长连续相同字符的长度是多少? 「腾讯」 17. 【最长递增子序列】手撕最长递增子序列(LeetCode 300):找出数组的最长递增子序列。nums=[1,3,5,4,7],返回[[1,3,4,7],[1,3,5,7]]。要求输出具体的一个最长递增子序列,并考虑优化(如O(n log n)解法)。 「字节跳动、拼多多、百度、百度文心、腾讯、阿里巴巴、阿里通义」 18. 【环形打家劫舍】Coding:从环中取不相邻的数字,数字和最大。 「字节Seed」 19. 【环形路径计数】手撕:一个环有10个点0-9,0开始出发,每步顺时针或逆时针走一个点,求经过n步回到0点有多少种不同走法 「字节跳动」 20. 【编辑距离】实现编辑距离算法:给定两个字符串str1和str2,每次可选择插入、删除或替换一个字符,求最少操作次数使得两个字符串相同(LeetCode 72)。 「字节跳动、百度、美团、腾讯、蚂蚁集团、阿里巴巴」 21. 【解码方法】一条包含字母A-Z的消息通过'A' -> 1,'B' -> 2,...,'Z' -> 26方式进行了编码,给定一个只包含数字的非空字符串,求解码方法的总数。 「阿里巴巴」 22. 【跳箱子】算法题跳箱子。原记录未说明具体规则。 「拼多多」 23. 【零钱兑换】零钱兑换(LeetCode 322):给定不同面额的硬币和一个总金额,计算凑成总金额所需的最少硬币个数。假设每种硬币的数量是无限的。变式:可能要求输出具体组合或处理其他约束。 「字节跳动、百度、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 24. 【零钱兑换II】代码:解决零钱兑换II(LeetCode 518),计算凑成目标金额的硬币组合数,要求区分顺序(组合问题)。 「腾讯、腾讯混元」 25. 【非连续最大和子序列】求数组的非连续最大和子序列,返回最大和以及子序列本身。 「阿里巴巴」 **L4 优化与诊断** 1. 【买卖股票系列】手撕买卖股票全系列,包括经典股票四连问(LeetCode 121、122、123、188),要求实现代码并分析复杂度。变体:LeetCode 121(一次交易)、122(无限次交易)、123(两次交易)、188(k次交易)。 「字节跳动、百度、百度文心、美团、阿里巴巴」 2. 【划分型DP】序列切分为前k个和n-k个,使得两部分方差和最大?给定一个序列,将其切分为前k个元素和后n-k个元素两部分,使得两部分方差之和最大。求最大方差和。 「字节跳动」 3. 【最大点积子序列】两个数组的子序列求最大点积:给定两个数组,分别选取长度相同的子序列,计算对应位置乘积之和的最大值。 「字节跳动」 4. 【最接近目标值的子序列和】最接近目标值的子序列和:给定一个整数数组和一个目标值,找出子序列的和,使其最接近目标值。返回该和。 「阿里通义」 5. 【最长递增子序列】最大递增子序列(动规,返回长度 -> 优化为返回整个序列 -> 优化相同长度的序列怎么选择更小的那一个)。给定一个整数数组,求最长严格递增子序列的长度,并输出该序列。若有多个相同长度的序列,选择字典序最小的一个。 「腾讯」 6. 【矩阵最长递增路径】二维矩阵中的最长递增路径,并输出该路径(序列)。给定一个整数矩阵,找出最长递增路径的长度,并输出路径。路径可以从任意单元格开始,每一步只能上下左右移动,且路径上的数字严格递增。 「京东、腾讯」 7. 【组合得分DP】给一个n和k,代表从1-n选k个数字,计算得分,若选择i,而未选择i+1,则得一分。求最大得分。 「百度」 ## 排序与查找 **L0 上下文不足(难度待定)** 1. 【上下文不足】除了哈希的方法,还有什么方法做怎么实现O(nlogn)的复杂度? 「百度」 **L1 基础认知** 1. 【排序算法稳定性】排序有哪些算法,哪些是稳定的呢? 「百度」 **L2 原理理解** 1. 【二分查找】算法题:搜索插入位置,二分查找。 「百度」 **L3 实现与应用** 1. 【堆排序与第K大元素】堆排序与第K大元素(LeetCode 215):实现堆排序算法;求数组中的第K个最大元素,要求比快排更快,使用堆排序或优先队列。 「京东、字节跳动、百度、百度文心、阿里巴巴」 **L4 优化与诊断** **快速排序** 1. 快速排序的原理是什么?如果不用递归的话怎么实现?手撕排序代码(快速排序)。 「百度、腾讯」 2. 手写快速排序代码(原地排序),并分析时间复杂度。 「字节Seed、字节跳动、百度、美团、腾讯、阿里巴巴」 1. 【Top-K】Top-K问题:从1亿个数中找出前10大的数;手写Top-K检索算法,实现向量库快速筛选,适配RAG召回场景;分片聚合,再做二阶段Top-K。 「字节跳动、腾讯、阿里通义」 2. 【Top-K问题】手撕:找出数组中最小的K个数,并按顺序返回。 变体1:使用最小堆实现。 变体2:给定候选商品列表,根据用户偏好做TopK筛选,要求时间复杂度低于O(N log N)。 「字节跳动、美团」 3. 【三路排序】手撕三路排序。 「百度」 4. 【两个有序数组中位数】手撕题:两个有序数组中位数,要求时间复杂度O(log(m+n))。 「字节跳动」 5. 【中位数】手撕:无序数组中位数。 「腾讯」 6. 【中间K个值】手撕:给定一个随机数组,要求输出排序在中间的K个值。例如给定随机数组arr=[9,3,7,1,4],当K=3时返回结果[3,7,4]或[3,4,7];当K=1时返回结果[4]。给定的数组arr长度与K均为奇数。 「阿里巴巴」 7. 【二分查找】手撕二分查找代码,注意边界问题;二分查找变体:类似于插入位置问题,输入是json格式;二分查找的时间复杂度是多少? 「字节跳动、百度、美团、腾讯」 8. 【众数】找出有序数组中所有出现次数严格大于n/3的数字,要求时间复杂度低于O(n)。 「字节跳动」 9. 【合并区间】手撕代码:合并区间(LeetCode 56及其变种)。 「腾讯、阿里巴巴」 10. 【堆排序】怎么样才能让堆排序稳定呢? 「百度」 11. 【多路归并Top-K】有n个长度为m的升序数组,找出所有数中的前K大(TopK)。 「字节跳动」 12. 【寻找峰值】手撕二分查找变种:给定一个数组,输出任意一个峰值,峰值定义为a[x] > a[x-1]且a[x] > a[x+1],要求时间复杂度O(log n)。 「阿里巴巴」 13. 【平方排序】给定数组 [-3, -2, -1, 0, 3, 6],将其平方后排序。 「腾讯」 14. 【归并排序】手写归并排序代码。 「阿里巴巴」 15. 【快速排序与两数之和】手撕代码:实现快速排序和两数之和。 「百度」 16. 【排序与查找综合】堆排序是稳定的吗? 「百度」 17. 【排序优化】如果数组本身有序,是否可以优化? 「美团」 18. 【排序链表】手撕:排序链表。 「字节跳动」 19. 【搜索旋转排序数组】实现力扣33题(搜索旋转排序数组)。 「百度」 20. 【有序矩阵第K小】手撕:二维有序矩阵中找第k小的值(LeetCode 378)。要求时间复杂度O(n log n)(原记录未说明具体复杂度要求)。 「字节跳动、腾讯、阿里巴巴」 21. 【第K大元素】手撕代码:找出无序数组中第K大的元素(LeetCode 215)。要求实现快速选择(QuickSelect)算法,并分析时间复杂度(平均O(n),最坏O(n^2))。可选的优化方法包括使用堆排序(堆排)或局部快排。 「京东、腾讯、阿里巴巴、阿里通义」 22. 【车队】LeetCode 853. 车队(中等)。 「字节跳动」 ## 贪心与双指针 **L2 原理理解** **贪心与双指针综合** 1. 交换正整数的两位数字,使其尽可能大。给定一个正整数,最多可以交换一次任意两位数字,返回能得到的最大整数。 「字节跳动」 2. 分割平衡字符串。在一个平衡字符串中,'L'和'R'字符的数量相同。给定一个平衡字符串,将其分割成尽可能多的平衡子串,返回最大分割数量。 「字节跳动」 **L3 实现与应用** 1. 【任务调度器】任务调度器(LeetCode 621):给定一个用字符数组表示的CPU需要执行的任务列表,以及一个冷却时间n,每个单位时间可以完成一个任务,相同任务之间必须间隔至少n个单位时间,求完成所有任务所需的最短时间。 「阿里巴巴」 2. 【加油站】加油站算法:在一条环路上有N个加油站,每个加油站有汽油gas[i],从第i个加油站到第i+1个需要消耗cost[i],求从哪个加油站出发可以走完一圈,否则返回-1。 「百度」 3. 【双指针】实现双指针算法:给定一个有序数组,使用双指针法解决两数之和、三数之和或移除元素等问题。具体题目未指定,需现场实现。 「美团」 4. 【跳跃游戏】跳跃游戏:给定一个非负整数数组,初始位置为第一个索引,每个元素代表在该位置可以跳跃的最大长度,判断是否能到达最后一个索引。变体:手撕一个贪心策略的问题(跳跃游戏)。 「百度、蚂蚁集团、阿里通义」 ## 栈队列与堆 **L3 实现与应用** **栈队列与堆** 1. PriorityQueue了解吗,有没有用过? 「美团」 2. 假设我们在一个高频插入和删除操作的场景中,比如实现一个队列或栈,你会选择数组还是链表? 「美团」 3. 实现LRU Cache:1. 要求get/put均为O(1)。2. 带过期时间的LRU。 「字节跳动」 4. 实现典型单调栈。 「拼多多」 5. 实现字符串解码(LeetCode 394),原记录未说明输入格式和输出要求。 「百度、阿里巴巴、阿里通义」 6. 实现最长有效括号(LeetCode 32)。 「字节跳动、百度」 7. 实现有效的括号(LeetCode 20)。 「字节跳动、百度、美团、阿里巴巴」 8. 实现每日温度算法。 「字节跳动」 9. 实现队列:1. 用栈实现队列(LeetCode 232)。2. 手撕实现queue(不限方式)。 「字节跳动」 10. 手撕一道简单的算法题(关于栈的使用)。 「字节Seed」 11. 手撕两道:最长有效括号和二叉树层序遍历。 「美团」 12. 手撕前K个高频元素。 「字节跳动」 13. 括号生成(LeetCode 22):生成n对有效括号的所有组合。 「腾讯混元」 14. 最小堆底层用什么数据结构实现? 「美团」 15. 柱状图中最大的矩形(LeetCode 84)。 「百度」 16. 滑动窗口最大值(一维),要求O(n)时间复杂度;部分场次要求取第k大的元素;ACM模式,从头写C++。设计如何利用堆最快的实现。实现队列的最大值。 「字节跳动、百度、腾讯、阿里巴巴」 17. 请介绍 List、Set、Sorted Set 及其典型应用场景。 「美团」 18. 逆波兰表达式求值。 「百度」 ## 哈希与集合 **L0 上下文不足(难度待定)** 1. 【上下文不足】找到的一系列lannet存在什么数据结构中? 「百度」 **L1 基础认知** 1. 【HashMap与Map接口】1. HashMap与Map的区别?2. Map和Set的区别? 「百度」 **L2 原理理解** 1. 【Map键值设计】map 的 key 和 value 应该如何设计? 「百度」 2. 【STL关联容器】map和multimap; set和multiset 「百度」 3. 【哈希表底层数据结构与树化条件】HashMap底层数据结构是什么?具体包括Java HashMap和STL中Map、HashTable的底层实现数据结构。HashMap什么时候从链表转红黑树?为什么要满足数组长度 > 64? 「字节跳动、美团、阿里巴巴」 4. 【统计最高频字符串】代码:找出重复最多的字符串,并返回字符串和重复次数。 「百度」 5. 【集合存储与存在判断】如果要存储一批商品并判断是否存在,应该用什么数据结构? 「百度」 **L3 实现与应用** 1. 【LRU缓存】手撕题:实现LRU(逻辑存储);容易写错哪些地方?不变量是什么? 「MiniMax、京东、字节跳动、阿里通义」 2. 【Trie前缀树】实现Trie前缀树。支持插入、搜索和前缀搜索操作。 「阿里巴巴」 3. 【串联所有单词的子串】串联所有单词的子串。给定一个字符串s和一个单词列表words,找出s中所有可以由words中所有单词串联形成的子串的起始位置。 「字节跳动」 4. 【和为K的子数组】LeetCode 560. 和为K的子数组。给定一个整数数组和一个整数K,统计并返回该数组中和为K的连续子数组的个数。 「字节跳动」 5. 【哈希统计正方形】手撕一道简单的哈希问题,给出点序列,求解总共能匹配到多少个正方形。 「拼多多」 6. 【实现Map】如何实现一个Map? 「腾讯」 7. 【长列表去重】如何快速对一个list去重,如果list的长度非常长(且不改变数据格式)? 「百度」 **L4 优化与诊断** 1. 【大数据词频统计与检索】大数据场景下,统计字符串表中出现的单词个数(裂开);在大规模(几百万)数据中做高效检索。 「拼多多、阿里巴巴」 ## 数学与位运算 **L0 上下文不足(难度待定)** **上下文不足** 1. 关于贝叶斯的一道代码题 「字节Seed」 2. 异或和(题目没记清楚,好像要利用了数的奇偶性) 「百度」 **L1 基础认知** 1. 【完美数定义】完美数是什么? 「阿里通义」 2. 【整数反转】输入123输出321(整数反转)。 「字节跳动」 3. 【递归求和】用递归法求1到n的和。 「京东」 **L2 原理理解** 1. 【乘法实现】手撕:写个函数实现乘法运算。 「京东」 2. 【二进制中1的个数】给出数字返回内存为1的个数。 「腾讯」 3. 【余弦相似度】手写实现余弦相似度计算,适配Embedding向量检索场景(一维向量输入)。 「阿里通义」 4. 【斐波那契数列】手撕斐波那契数列。 「百度」 5. 【汉明距离】LeetCode: 计算两个整型数的Hamming距离,原型: int hammingDistance(int x, int y); 「腾讯」 6. 【质因数分解】手撕:求k的分解质因数。 「百度」 7. 【距离度量】手写欧氏距离、曼哈顿距离,对比三种向量距离算法的适用场景。 「阿里通义」 8. 【阶乘末尾零的个数】1000!有多少个0? 「美团」 9. 【随机数生成】随机数的生成。 「百度」 10. 【随机数表示概率】用随机数函数randf()表示概率,如从一个数组中取出某个数的概率为0.5。 「字节跳动」 11. 【随机采样函数区别】现场看了python random.choices和random.sample的文档,问有什么区别,从概率角度上来说表达式有什么不同? 「百度」 **L3 实现与应用** 1. 【2的幂次方表示】NOIP1998复赛普及组第一题:2的幂次方表示。 「字节跳动」 2. 【位运算优化】对于一个很长的数,其中只有个别位是1,如何优化查找这些1的位置?问题转化为如何找到最低位的1? 「腾讯」 3. 【圆环回原点】圆环回原点问题。 「百度」 4. 【平方根计算】实现平方根计算。变体:1. 手写IoU和开根号小数点后三位(不调包);2. 实现sqrt(x),向下取整;3. 非负整数求根号(二分法);4. 多态的方式实现开根号;5. 实现开平方根;6. 求浮点数平方根(牛顿法/二分法),手写牛顿迭代法,收敛阈值怎么设置,该方法优势?7. 计算一个数的算术平方根,精度0.00001。 「字节跳动、百度、腾讯、阿里巴巴」 5. 【按概率采样】按概率采样。变体:1. 实现一个函数,给定一个nums数组和一个概率数组,根据概率返回nums中的数;2. 曝光概率区间均匀采样。 「字节跳动、百度」 6. 【整数拆分】整数拆分问题。变体:1. m个苹果放到n个盘子(可以为空),一共有多少种方法?2. 将n写成k个正整数之和的所有方案和方案数;3. 算法题:整数拆分。 「字节跳动、百度、腾讯混元」 7. 【有效正方形判断】代码:有效的正方形。 「百度」 8. 【有理数类实现】手写有理数类,实现加减法和约分->找最大公约数,定义分子和分母、函数书写的位置。 「美团」 9. 【浮点数幂运算】浮点数的n次方。 「拼多多」 10. 【点在多边形内判断】判断一个点是否在凸多边形内部和凹多边形内部。 「百度」 11. 【猜数字游戏】算法题:猜数字。 「百度」 12. 【真分数组合计数】给质数数组和一个k,从数组中选择两个数组成真分数,有多少组合方式大于k? 「字节跳动」 13. 【矩阵欧氏距离】手撕代码:计算m×d矩阵两两之间的欧式距离(复杂度不超过m^2)。 「腾讯」 14. 【立方根计算】写一个开三次根号函数,对一个数求立方根,误差在1e-5。 「字节跳动、拼多多」 15. 【约瑟夫环】破冰游戏(约瑟夫环)。 「字节跳动」 16. 【计算圆周率】如何利用计算机求π,不限时间复杂度,可以循环一亿次? 「阿里巴巴」 17. 【除法实现】求a/b的商和余数,不能用除法和取余,要求使用两种方法,其中一种方法用加减实现整除。 「阿里巴巴」 18. 【随机数生成】使用 Rand7() 实现 Rand10()(LeetCode 470)。 「字节跳动、百度、阿里巴巴、阿里通义」 **L4 优化与诊断** 1. 【字典序第K小数字】字典序的第K小数字。给定整数n和k,找到1到n中字典序第k小的数字。 「字节跳动」 2. 【带权随机采样】给定一个长度为n的数组weights,其中weights[i]是元素i的非负权重。现在需要进行大量、近似无限次的有放回采样,如何让单次采样的时间复杂度尽可能低?实现带权随机采样算法。 「腾讯」 3. 【斜框IOU】斜框IOU实现。计算两个旋转矩形(斜框)的交并比(IOU)。 「腾讯」 4. 【最大公约数不为1的最长子序列】有一个长度为n的序列a1, a2, ..., an,我们希望选择一个最大公约数不为1的子序列,求可以选择的最长子序列长度,以及这种最长的子序列总共有多少种。如果两个子序列所包含的元素值的多重集合相同,则认为它们是同一种方案,即不区分下标位置,仅按所含数字及出现次数判断是否相同。 「阿里巴巴」 5. 【流式随机采样】最长流式随机采样。实现一个流式随机采样算法,从数据流中均匀随机选取k个样本(蓄水池采样)。 「百度」 6. 【除法表达式最大化】给一个整数数组a,对a中的相邻整数进行浮点除法,如a=[2,3,4],即为2/3/4。在任意位置添加任意数目的括号,来改变算数的优先级,使得值最大,输出表达式。 「百度」 ## 算法复杂度 **L0 上下文不足(难度待定)** 1. 【上下文不足】时间复杂度是什么关系? 「腾讯」 **L1 基础认知** 1. 【有序数组操作复杂度】有序数组插入的时间复杂度是多少?有序数组查找的时间复杂度是多少? 「百度」 **L2 原理理解** 1. 【复杂度分析】分析给定代码的时间复杂度和空间复杂度,并描述解题思路。具体追问:到底是哪一步产生了 O(n^2)?这个复杂度是怎么算出来的?为什么是这个复杂度? 「京东、字节跳动、快手、百度、美团、阿里巴巴、阿里通义」 **L4 优化与诊断** 1. 【复杂度优化】如何考虑降低代码的复杂度?如果数据规模非常大,有没有优化思路? 「百度、阿里巴巴」 ## 综合编程题 **L0 上下文不足(难度待定)** **上下文不足** 1. 手撕 Notes。 「蚂蚁集团」 2. 算法题好像也没啥必要。 「字节跳动」 3. 算法题很有趣,自己打开编译器。手撕:发现是15题 「京东」 4. 算法题,或者cuda。 「腾讯」 5. 计算机基础和代码语言 「拼多多」 6. 讲下AI Coding笔试 「美团」 7. 题目没限空间;还能怎么换? 「阿里巴巴」 1. 【LeetCode难度分布】leetcode:大多为简单题,少数中等题。 「阿里通义」 2. 【代码添加位置】在你实现的代码中要加的话加在哪儿? 「字节跳动」 3. 【编程语言能力】代码能力,比如cpp、python、sql的情况。 「百度」 4. 【编程题频率】coding是什么频率? 「阿里巴巴」 **L1 基础认知** 1. 【if __name__ == '__main__'作用】if __name__ == '__main__'的作用是什么? 「阿里巴巴」 2. 【i++与++i区别】i++和++i的区别? 「百度」 3. 【Python Collection】Python Collection了解吗? 「美团」 4. 【Python help和dir用法】Python中help以及dir的用法 「美团」 5. 【Sigmoid函数手写】sigmoid的代码手写。 「阿里巴巴」 6. 【友元概念】了解友元概念吗? 「腾讯」 7. 【实习时长】算法题和一些别的 实习几个月。 「京东」 8. 【深度学习框架掌握】你熟练掌握哪些深度学习框架(PyTorch/TensorFlow)? 「京东」 9. 【编程基础】手撕,口述coding基础。 「百度文心」 10. 【编程工具与语言】平时用什么vibe coding软件?平时用什么语言? 「京东、腾讯」 11. 【编程环境设置】手撕让我开自动补全 「京东」 12. 【编程题卡住】算法题一直卡。 「字节跳动」 13. 【编程题时间限制】手撕10min、20min、45min。 「腾讯、蚂蚁集团」 14. 【编程题测试方式】手撕:力扣核心模式,自己写样例测试通过即可。 「腾讯」 15. 【编程题难度范围】手撕,力扣mid,hard,非力扣都有 「美团」 16. 【边界判断】为什么要加if(id Tensor,其中参数为策略模型和参考模型对选中/拒绝回复的对数概率(B,),beta为温度缩放因子,返回标量损失,约束为L = -log(sigmoid(beta * ((pi_c - ref_c) - (pi_r - ref_r)))).mean()。 「京东、字节Seed、字节跳动、百度、腾讯」 8. 【DPO数据构造】DPO的数据如何构造正负样本(偏好对)?如果数据量不够,有什么构造方法?请结合你的实际数据集构造过程进行介绍。 「字节跳动、百度、美团、蚂蚁集团」 9. 【DPO训练技巧】DPO训练技巧:DPO训练涉及的trick有哪些?DPO与SFT在训练上有什么不同?训练了几个模型?DPO训练过程中和结束后,通常看哪些指标来判断模型是否训练好?DPO训练过程涉及的模型及各自的作用。DPO训练通常有哪些注意事项? 「百度、美团、阿里巴巴」 10. 【DPO超参数β】DPO公式中beta参数控制与ReferenceModel的偏离程度:beta趋近0时模型接近ReferenceModel,趋近无穷时忽略ReferenceModel;调大beta增加偏离,需根据任务调整。 「字节跳动、阿里巴巴」 11. 【GDPO】GDPO解决的问题:如梯度对齐、偏好噪声等。 「腾讯」 12. 【GSPO算法】介绍GSPO算法。 「字节跳动、阿里通义」 **L4 优化与诊断** 1. 【ATPO算法】ATPO算法的核心特性、工作原理是什么?其与RLEP的差异有哪些? 「美团」 2. 【DAPO与GSPO】DAPO和GSPO的改进是什么? 「百度」 3. 【DPO与其他算法对比】请详细比较DPO、PPO、GRPO、DAPO、GSPO等算法的原理、损失函数、优势函数设计、区别、优势与劣势,并解释DPO的探索如何体现;为什么PPO效果可能比DPO强,多轮DPO为何有提升;同时使用DPO和GRPO的设计原因及实验验证合理性;理论推导DPO的目标函数;介绍tag level与DAPO的区别;项目为什么不用DPO而用GRPO? 「京东、字节跳动、百度、百度文心、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 4. 【DPO变种与KL散度】DPO变种了解嘛,DPO的KL散度是如何定义的?DPO是如何choose和reject的? 「腾讯」 5. 【DPO局限性】DPO离线更新、SFT以及DPO过程本身存在哪些局限性或卡点? 「百度、美团、腾讯」 6. 【DPO应用与设计】在DPO偏好对齐中,如何选择不同的reward或其他层面的偏好对齐依据?为什么选择DPO而非PPO,为什么选择Qwen而非其他模型?数据如何构建,实验如何对比? 「百度、阿里巴巴」 7. 【DPO损失函数推导】推导DPO的Loss:它如何从Bradley-Terry模型推导出来?DPO loss和GRPO loss有什么区别? 「字节跳动、阿里巴巴」 8. 【DPO改进方法】DPO如何改进? 「美团」 9. 【DPO数据构造】多分类做DPO,偏好对怎么构造? 「腾讯」 10. 【DPO训练技巧】DPO训练技巧:为什么DPO会出现正样本reward也降低的情况?有没有可能DPO训练后choosen和reject的概率都提升了?应该怎么办?你做DPO时为什么搭配0.2权重的SFT loss,防止什么问题? 「京东、字节跳动、阿里巴巴」 11. 【DSPO】DSPO算法:理解其创新点(如动态采样、偏好排序等)。 「美团、腾讯」 12. 【GSPO与GRPO区别】GSPO与GRPO有什么区别?为什么实际训练中GSPO效果更好? 「字节跳动、腾讯」 13. 【KL散度选择】为什么使用reversed KL而非forward KL:reverse KL mode-seeking,避免生成低概率样本;forward KL mass-covering,可能产生无效输出。 「蚂蚁集团」 14. 【SAPO】SAPO在GSPO基础上优化:引入自适应采样或奖励归一化等。 「字节跳动」 ## 奖励模型 **L0 上下文不足(难度待定)** 1. 【上下文不足】可以当奖励模型吗? 「蚂蚁集团」 **L1 基础认知** 1. 【奖励定义】你的Reward具体指什么? 「字节Seed」 **L2 原理理解** 1. 【奖励模型角色】Reward Model在训练中扮演了什么角色? 「百度文心」 **L3 实现与应用** **奖励模型** 1. 奖励函数设计、训练、评估与迭代:包括GRPO奖励设计;Reward Model与RLVR定义及数学reward计算;Reward Model是否需要持续迭代;Reward Model训练方法、损失函数(如RankLoss)及训练经验;训练数据构建;RLHF/RL奖励函数设计维度与逻辑;固定GT数据计算reward的问题;Reward Model训练集准确率评估;reward设计调整策略;SFT/RL中奖励函数设定与定期调整;Rule-based与Model-based奖励设计区别、规则细节及场景选择;多样性reward窗口设置;reward hacking判断与解决办法;奖励动态调整方法;强化学习奖励函数定义(含定价算法、促销策略结合);换道场景对抗性与合理性奖励定义及安全攸关场景比例;轨迹奖励细粒度打分;如何训练reward模型。 「京东、字节Seed、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 2. 奖励模型的设计与训练:包括裁判模型(reward model)的构建、打分偏好(如输入顺序偏好)的解决、通用reward model设计、最新范式(如基于大模型打分 vs 规则)、不同任务(数学、代码、字段提取、长对话、agent RL)的reward设计、训练流程、扩充优化、避免堆字数刷奖励、GSPO的reward计算、代码生成引入静态分析指标(如Pass@k)、字段提取业务维度、模型规模选择等。 「字节Seed、字节跳动、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 **L4 优化与诊断** 1. 【奖励不增长问题】Reward一直上不去该怎么办? 「腾讯」 2. 【奖励函数与模型设计】RL奖励函数的设计方法有哪些?规则奖励带来的问题?训练后模型是否对输出存在某种偏好?是否存在bad case?是否发生了reward hacking?实际怎么解决的?如果出现主观类问题该怎么判断好坏?奖励模型的设计还有哪些可以改进的部分?例如在奖励中加权重,数据方面如何考虑不删除难例?去做RL时,模型偏向通用,回答需针对不同维度设计不同reward函数,如何设计这个过程?多个Reward function的系数怎么调?多目标优化中,如果不同奖励函数之间发生冲突,例如在某一个reward上越来越高,但在其他reward上呈现波动,应如何解决?奖励模型的设计原理和方法是什么?为什么要用72b的模型?如果想引入一些规则信息,该如何在模型上改动?如何评估reward model的作用? 「京东、字节跳动、拼多多、美团、腾讯、蚂蚁集团」 3. 【奖励黑客】Reward hacking是什么现象?请举例说明其成因和解决办法。从reward设计或reward model的角度,如何缓解reward hacking?如何避免奖励坍缩(reward collapse)和熵崩溃/熵爆炸?如果RewardModel打分出现奖励作弊(如模型生成重复或无意义但高分的内容),应如何排查和解决?另外,reward冲突和稀疏奖励问题如何解决? 「字节跳动、阿里巴巴」 4. 【无奖励模型获取奖励】RL中我们不训练reward model,还有什么方法获取reward? 「腾讯」 5. 【过程奖励模型】Process reward的优势是什么?可以从哪些维度设计? 「字节跳动」 **L5 综合与前沿** 1. 【奖励系统设计】如何设计奖励系统(reward system)?与一般LLM的奖励系统有何区别?如何设计专业的奖励系统?同时考虑大模型Agent自动化评测的奖励体系设计。 「字节跳动、美团、腾讯」 ## 探索与策略优化 **L2 原理理解** 1. 【MCTS实现方式】你这个MCTS是自己实现的还是用的现成框架? 「美团」 **L3 实现与应用** 1. 【MCTS与Rejection Sampling对比】如果不用MCTS,直接用rejection sampling效果怎么样? 「美团」 2. 【UCB参数调优】UCB的C参数怎么调的? 「美团」 3. 【探索增强方法】如何让强化学习的模型更有探索性? 「腾讯混元」 **L4 优化与诊断** 1. 【探索增强与任务平衡】1. CLIP-Higher: 解耦上下剪切范围(e_low和e_high),提高e_high的值,允许低概率token有更大的增长空间,从而提升策略多样性,防止过早确定化。 2. 如何平衡难易任务,增强模型对难任务的探索? 「百度、美团」 ## 其他对齐 **L3 实现与应用** **其他对齐** 1. on-policy蒸馏、软蒸馏和我用的方法之间有什么区别和联系? 「百度」 2. 你强化学习除了Openrlhf还用过swift吗? 「蚂蚁集团」 3. 多智能体系统与单智能体系统相比,是否有提升项目效率的作用?举个例子说明。多智能体系统的协作是否依赖于共享环境?如果是,如何处理不同智能体之间的冲突? 「百度」 4. 对齐优化的判断标准 「字节跳动」 5. 有没有在离线不一致的问题? 「字节跳动」 6. 除了你项目里面用到的DAPO,还有什么Agentic RL的算法? 「蚂蚁集团」 # 多模态与计算机视觉 ## 图像分类检测分割 **L1 基础认知** 1. 【IoU计算】IoU是怎么算的? 「百度」 **L2 原理理解** 1. 【Segment Anything】介绍Segment Anything模型,包括其架构、训练数据、分割能力(如零样本分割、提示分割)及主要应用。 「蚂蚁集团」 2. 【U-Net优势】U-Net相比其他Encoder-Decoder模型的突出优势和亮点在哪儿? 「百度」 3. 【常见视觉模型特点】常用的计算机视觉模型(如YOLO系列、Faster R-CNN、U-Net、Vision Transformer)各有什么特点?请分别说明其架构、优势、适用场景及局限性。 「京东」 4. 【数据增强方法】训练中使用哪些数据增强的方法?请列举常见的图像数据增强技术,如翻转、旋转、缩放、裁剪、颜色抖动、Cutout、Mixup、CutMix、Mosaic等,并说明其作用。 「百度」 5. 【目标检测发展历程】介绍目标检测的发展历程,包括从传统方法到基于深度学习的方法(如R-CNN系列、YOLO系列、SSD等)的演进,以及关键里程碑。 「蚂蚁集团」 6. 【目标检测损失函数】目标检测一般有哪些损失优化?请列举并解释常用的损失函数,如分类损失(交叉熵、Focal Loss)、回归损失(Smooth L1、IoU Loss、GIoU Loss、DIoU Loss、CIoU Loss)等。 「百度」 **L3 实现与应用** 1. 【Artifact剔除模型选型】有没有试过用像ResNet这种传统的小模型来做Artifact剔除? 「京东」 2. 【IoU损失实现】手写IoU损失,要求跑通。 「百度」 3. 【NMS实现】手撕NMS(非极大值抑制)代码,要求一次写对,并描述过程。 「字节跳动、拼多多、阿里巴巴」 4. 【U-Net与随机森林对比】U-net模型是图像分割领域比较经典的模型,肯定效果更好,为什么还要用随机森林? 「百度」 5. 【YOLO选型与对比】为什么现在效果始终不如yolo等小模型;为什么要选YOLO而不是别的? 「京东、蚂蚁集团」 6. 【分割偏差优化】图片出现分割偏差,当时如何解决,有哪些优化思路? 「百度」 7. 【复杂场景优化】当视觉模型在复杂场景(如逆光、遮挡)中准确率下降时,你会如何优化? 「京东」 8. 【检测头优化】你说优化检测头提升了16个点,介绍一下吧。 「字节跳动」 9. 【模型泛化与人群差异】你有想做不同人种(比如黄种人白种人肯定不一样要区分开来的),不同地域的嘛? 「字节跳动」 10. 【目标检测模型结构】比较DETR、RT-DETR、YOLOv5的模型结构;回忆YOLOv1/v2/v3的细节。 「百度」 11. 【细粒度识别SOTA对比】模型在6个FGVR数据集SOTA,对比论文指标优势在哪? 「字节跳动」 **L4 优化与诊断** 1. 【Logo生成】如何生成一些商品/商家logo图? 「字节跳动」 2. 【光照变化抗干扰方案】某计算机视觉模型在实际部署中因“光照变化”导致效果波动,你会如何从“预处理→模型自适应→后处理”三个维度设计抗干扰方案? 「京东」 3. 【包装缺陷检测背景干扰】针对“零售商品包装缺陷检测”场景,如何解决“复杂背景干扰”问题? 「京东」 4. 【医学影像病灶分割优化】京东健康的“医学影像病灶分割”模型出现分割精度不足(尤其小病灶),你会如何从“数据质量→模型结构→损失函数”三级拆解原因并提出优化方案? 「京东」 5. 【图搜定位】用户给一张图片,怎么做图搜定位图片的真实坐标? 「百度」 6. 【视频审核速度与精度平衡】针对视频内容审核场景,如何平衡检测速度(FPS)与分类精度? 「腾讯」 7. 【长尾问题】如何应对视觉模型的“长尾问题”(如罕见目标识别准确率低)? 「京东」 **L5 综合与前沿** 1. 【商品货架智能巡检方案】请为京东零售设计“商品货架智能巡检”计算机视觉方案,说明核心任务、模型选型、数据处理、评估指标及落地步骤。 「京东」 ## 视觉基础与CNN **L0 上下文不足(难度待定)** **上下文不足** 1. 分辨率多大? 「字节Seed」 2. 压缩了会丢失细节怎么办? 「字节Seed」 **L1 基础认知** 1. 【CV资源与Caption方向】你平时关注哪些计算机视觉领域的资源(如CVPR/ICCV论文、开源项目、京东视觉技术案例)?组里caption主要做哪些方向,若进组可能会分配什么方向? 「京东、阿里通义」 **L2 原理理解** 1. 【CV与NLP/大模型差异】你认为“计算机视觉算法工程师”与其他算法工程师(如NLP、大模型)的核心差异是什么? 「京东」 2. 【CV工程师核心能力】你认为未来计算机视觉工程师的核心能力是什么? 「京东」 3. 【SegFormer】你简历中提到使用了segformer,这个是什么? 「美团」 4. 【U-Net】U-net网络设计思路。 「阿里巴巴」 5. 【图像去噪】如何处理图像数据中的噪声(如模糊、椒盐噪声)? 「京东」 6. 【图像特征工程】你觉得“图像特征工程”在视觉算法中的具体体现是什么? 「京东」 7. 【图像细节处理】有了解过哪些处理图像的细节操作? 「腾讯」 8. 【机器视觉发展史】给我讲讲机器视觉是怎么发展的? 「蚂蚁集团」 9. 【视觉模型工程化】有过视觉模型工程化落地的经历吗? 「京东」 10. 【视觉编码器】视觉编码器是否了解? 「阿里巴巴」 **L3 实现与应用** 1. 【CV技术趋势】你对计算机视觉领域的技术趋势有什么观察? 请列举当前主要趋势(如Transformer、自监督学习、多模态等)并简要说明。 「京东」 2. 【DINO】DINO是否了解?请介绍DINO的核心思想、训练方式及其在自监督视觉表示学习中的作用。 「蚂蚁集团」 3. 【Vision Encoder Loss】讲一下 vision encoder 的 loss。请说明常见的视觉编码器损失函数(如对比损失、重构损失等)及其设计动机。 「美团」 4. 【ViT vs CNN】选择ViT和选择CNN编码图像分别的优势和劣势是什么?请从全局感受野、计算效率、数据需求、迁移能力等方面对比。 「腾讯」 5. 【VQVAE Loss与VQ层】讲一下VQVAE的三个loss,以及VQ层如何将encoder得到的向量归到codebook中?commit loss中的beta参数有什么作用,初始化为多少? 「阿里巴巴」 6. 【不同视觉任务优化侧重点】面对不同视觉任务(如目标检测、图像分割、视频跟踪),算法优化的侧重点有何不同? 请分别说明各任务的关键优化目标(如检测的定位与分类、分割的像素精度、跟踪的时序一致性)。 「京东」 7. 【多分辨率输入】多分辨率输入是怎么实现的?它相比固定分辨率有什么优势?请说明实现方式(如图像金字塔、多尺度训练)及优势(如尺度鲁棒性、性能提升)。 「字节跳动」 8. 【插值算法】手撕插值算法。请实现一种插值算法(如最近邻、双线性、双三次插值),并说明其原理和适用场景。 「拼多多」 9. 【注意力区域与图像识别】注意力区域,是否用于优化图像识别能力?请解释注意力机制如何帮助模型聚焦于重要区域,并举例说明其在图像识别中的应用。 「百度」 10. 【端侧设备算法选择】为何在AI端侧设备一般不使用传统图像算法?请从计算资源、实时性、精度等角度分析。 「腾讯混元」 11. 【视觉检索 vs 轨迹距离】为什么要用视觉retrieve,不直接用轨迹之间的欧式距离作为retrieve方式? 请分析视觉检索相比轨迹距离的优势。 「百度」 **L4 优化与诊断** 1. 【BiasNet与PPNet】biasnet的增量在哪里,知道ppnet的gate带来了什么效果吗? 「腾讯」 2. 【Grounding DINO】介绍grounding dino,他的几种text和image的融合方式。比如text做query,image是做k和v吗? 「蚂蚁集团」 3. 【RQ-VAE】请介绍RQ-VAE的原理(包括与VQ-VAE的区别、与RQ-Kmeans的关系与取舍、输入获取方式、码本设计、损失函数、码本坍塌解决方案、超参数重要性、为何采用残差量化而非分布重建)。 「字节Seed、字节跳动、百度、美团、阿里巴巴」 4. 【ScalingUp】scalingup怎么做的?详细介绍。 「美团」 5. 【ViT vs VAE for 生成/重建】用vit和vae做视觉生成和重建各有什么好坏? 「腾讯混元」 6. 【可变形注意力】介绍一下可变形注意力机制(Deformable Attention)。为什么在BEV感知中它比原生Transformer更受欢迎? 「字节跳动」 7. 【图片处理到Attention代码】手撕从图片处理到attention的具体代码 「阿里巴巴」 8. 【表情与ID解耦】如何做表情和id的解耦? 「腾讯混元」 9. 【表情驱动数据表征】猜测米哈游表情驱动的数据表征形式? 「腾讯」 10. 【视觉基础模型】对视觉Foundation Model有什么看法,目前的视觉基础模型存在哪些问题? 「蚂蚁集团」 11. 【轻Lidar融合】轻lidar的方案怎么做融合好一些? 「腾讯」 12. 【边界能量损失】论文中对于边界的能量损失函数的如何设计的? 「京东」 13. 【边缘设备BackBone选择】如果要在边缘计算设备上运行一个多模态分类模型,你会选择哪种BackBone? 「腾讯」 14. 【领域自适应】计算机视觉中的“领域自适应”问题如何解决? 「京东」 **L5 综合与前沿** 1. 【Grid Sampler】给你一个BEV特征图,手写一个Grid Sampler(网格采样器),把周围视角的特征投影过来。 「字节跳动」 ## 视觉Transformer **L2 原理理解** 1. 【ViT与LLM损失函数】ViT和LLM的损失函数分别是什么?请分别说明ViT(如图像分类任务)和LLM(如语言建模)常用的损失函数。 「百度」 2. 【ViT与原始Transformer区别】Vision Transformer和原始Transformer的区别是什么?请从架构、输入处理、位置编码、注意力机制等方面详细说明。 「百度」 3. 【ViT图像分块与Token化】ViT是如何将图像切分为patch并转换为token序列的?请描述其图像处理机制。图像的token长度由什么参数来控制?具体说明patch大小、图像尺寸与token数量的关系。 「字节跳动、百度、阿里巴巴」 4. 【ViT相比CNN优势】在图像任务中,ViT相比CNN-based模型的优势在哪里?请从全局感受野、自注意力机制、长距离依赖建模、可扩展性等方面分析。 「百度」 **L3 实现与应用** 1. 【BEVFormer注意力机制】BEVFormer的两个attention:包括spatial cross-attention和temporal self-attention。请详细解释其原理、作用及实现细节。 「腾讯」 2. 【BEV时序融合】BEV特征时序融合:解释BEVFormer中如何通过temporal self-attention融合历史BEV特征,实现时序信息聚合。 「腾讯」 3. 【DiT Transformer实现】DiT的Transformer实现:请详细说明DiT(Diffusion Transformer)中Transformer的结构,包括如何将图像patch作为输入,以及如何与扩散过程结合。 「蚂蚁集团」 4. 【Patch Merging】Patch Merging:解释Swin Transformer中Patch Merging层的具体操作,包括如何将相邻patch合并,以及维度变化。 「蚂蚁集团」 5. 【Swin Transformer原理与对比】Swin Transformer的原理是什么?它与ViT的区别有哪些?请详细对比两者的架构、窗口注意力、移动窗口、层级设计等。 「字节跳动、百度、美团」 6. 【ViT [CLS] token与CNN损失计算区别】ViT中[CLS] token的输出与CNN计算Losses的最大区别是什么?请从全局特征提取、损失计算方式等角度分析。 「百度」 7. 【ViT与DiT原理】ViT、DiT原理:请分别讲解Vision Transformer (ViT) 和 Diffusion Transformer (DiT) 的原理,包括架构、输入处理、注意力机制等。 「阿里巴巴」 8. 【ViT与LoRA】ViT需要挂LoRA吗?请讨论在ViT上应用LoRA(Low-Rank Adaptation)的可行性、场景及优缺点。 「蚂蚁集团」 9. 【ViT位置编码类型】ViT位置编码类型:请详细讲解ViT中使用的各种位置编码,包括一维位置编码、二维位置编码、相对位置编码、多模态位置编码的原理和区别。 「字节跳动」 10. 【ViT损失函数实现】手撕ViT损失函数:实现ViTCrossEntropyLoss类,继承自nn.Module,使用import torch和import torch.nn。要求实现交叉熵损失,并考虑ViT中[CLS] token的输出。 「百度」 11. 【ViT架构与原理】请详细讲解ViT(Vision Transformer)的模型架构和原理,包括图像是如何被切块、展平并映射为序列输入到Transformer中的,以及Transformer的具体结构(如自注意力、多头注意力、MLP、LayerNorm等),并说明ViT相比传统CNN的优点。 「字节跳动、拼多多、美团、腾讯、阿里巴巴」 12. 【ViT结构与Patch嵌入】ViT具体结构说一下,图像转化为patch输入位置信息会丢失吗,所有patch使用的线性映射层是同一个还是不同?请详细解释ViT的patch嵌入过程,包括如何将图像切分为patch、展平、线性映射,以及位置编码的添加。 「腾讯」 13. 【ViT计算过程与对齐策略】讲解ViT图像计算过程,现在常用的对齐策略是什么?请详细描述ViT的前向计算流程,并说明常用的对齐策略(如patch对齐、特征对齐等)。 「百度」 14. 【ViT训练方式】现在ViT的训练方式有哪些?请列举并解释常见的ViT训练策略,如预训练+微调、知识蒸馏、自监督学习等。 「百度文心」 15. 【动态分辨率】什么是动态分辨率(Dynamic Resolution)处理?请解释在ViT或多模态模型中如何实现动态分辨率,以及其目的和挑战。 「字节跳动」 **L4 优化与诊断** 1. 【AR与DiT对比】AR+DiT的优势到底是什么? 「腾讯混元」 2. 【RoPE处理视频方式】原来的RoPE在升级成M-RoPE之前,它是怎么处理视频的?具体来说,对于每一个每一帧或者说每一个patch,是怎么处理的? 「京东」 3. 【RT-DETR与DETR对比】RT-DETR与DETR的优化。 「百度」 4. 【ViT与Qwen2注意力对比】ViT使用的注意力和Qwen2是一样的吗,为什么这么设计? 「阿里巴巴」 5. 【ViT细粒度特征提取】VisionTransformer能很好的提取细粒度特征吗?如果想让ViT既提取到语义特征又提取细粒度特征,要怎么改进网络结构? 「字节跳动」 6. 【多模态ViT原理与训练】多模态大模型的ViT,解释原理、如何训练的? 「阿里通义」 **L5 综合与前沿** 1. 【ViT与CNN在商品分类中的对比与混合模型】分析VisionTransformer(ViT)与传统CNN(如ResNet)在“京东零售商品分类”中的优劣,设计混合模型方案(如CNN提取局部特征+Transformer捕捉全局依赖),说明适用场景与效果预期。 「京东」 ## 图文对齐与CLIP **L1 基础认知** 1. 【图文对齐与CLIP】1. 你有过图像与文本融合的开发经历吗?请结合具体项目说明。2. 如何衡量图像embedding和文本embedding之间的相似度?常用方法包括余弦相似度、点积等。3. 对多模态数据有什么了解?请介绍多模态数据的特点、常见对齐方法(如CLIP)及应用场景。 「京东、百度、阿里巴巴」 **L2 原理理解** 1. 【CLIP模型】请全面讲解CLIP模型,包括:1)模型结构:双塔结构(图像编码器如ViT/ResNet,文本编码器如Transformer)如何分别提取特征;2)训练方式:对比学习(InfoNCE损失)如何将图文映射到同一向量空间,实现图文对齐;3)零样本能力:如何通过提示工程实现zero-shot分类、检索等;4)应用场景:图文检索、商品推荐等跨模态任务,相比单一模态模型的优势;5)其他对比学习方法(如ALIGN、SigLIP)。 「京东、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 **L3 实现与应用** 1. 【ALBEF与BLIP模型】简单介绍ALBEF和BLIP这两个模型的核心设计,并说一下ALBEF模型。 「字节跳动」 2. 【ALIGN与CLIP对比】ALIGN和CLIP的主要区别是什么?为什么CLIP在后来的开源生态中更具优势? 「腾讯」 3. 【BLIP与BLIP2文本生成】BLIP和BLIP2中的文本生成有什么区别? 「美团」 4. 【BLIP创新与CLIP对比】BLIP模型在图文理解中引入了哪些创新机制?它与CLIP在训练目标和架构上的核心区别是什么? 「腾讯」 5. 【BLIP损失函数与数据清洗】BLIP的三个损失函数分别是什么,数据是怎样清洗的? 「阿里通义」 6. 【BridgeTower模型】简述BridgeTower等模型如何通过跨模态连接层解决视觉与文本信息在深层的丢失。 「腾讯」 7. 【Caption与图文交错数据】从模型的角度,caption数据和图文交错数据主要的区别是什么? 「美团」 8. 【CLIP与QwenVL对比】CLIP与QwenVL区别:图像分类适用性? 「阿里通义」 9. 【CLIP与T5文本编码器】CLIP和T5两个文本编码器的作用,怎么注入到输入过程中的? 「阿里巴巴」 10. 【CLIP与ViT代码实现】手撕代码的部分力扣hot100 多模态大模型: CLIP + ViT。 「字节跳动」 11. 【CLIP参数设置】你的参数怎么设置,上clip和下是否起作用? 「腾讯」 12. 【CLIP后续发展】CLIP之后有哪些新进展? 「美团」 13. 【CLIP损失函数与InfoNCE Loss实现】CLIP的损失函数是什么?请分别详细解释image-to-text和text-to-image两个方向的损失计算过程。实现InfoNCE Loss(CLIP)。为什么需要KL散度/CLIP?Q-Former原理。 「百度、腾讯、阿里巴巴、阿里通义」 14. 【CLIP缺点】CLIP模型的缺点或不足在哪里? 「腾讯」 15. 【CLIP训练技巧】如何解决的(CLIP higher 限制、小学习率)? 「美团」 16. 【CLIP领域适应性】你如何看待CLIP在处理不同领域数据时的适应性和表现? 「腾讯」 17. 【Q-Former动机与模型】为什么用Q-Former?请介绍Q-Former模型,包括其对齐层的作用、Q-Former是什么,以及常见的视觉-语言Adapter有哪些及其具体作用?另外,Q-Former还有哪些其他变体? 「字节跳动、百度、蚂蚁集团」 18. 【Q-Former局限性】现在为什么不用q-former了? 「腾讯」 19. 【ViT与LM训练策略】训练vit和lm是一起做还是分开训? 「百度」 20. 【图文对比学习改进】除了CLIP,还有什么图文对比学习方法?以及CLIP有哪些改进模型? 「京东、美团」 21. 【图文对齐实现】项目细节:你们是怎么把text和image进行对齐的,介绍一下alignment的实现。 「美团」 22. 【图文对齐常见问题】多模态图文特征对齐会遇到哪些常见问题? 「腾讯」 23. 【图文对齐训练与评估】图像文本对齐通常如何训练和评估? 「字节跳动」 24. 【多模态对齐方法】常用的不同模态数据在embedding层面对齐的方法有哪些?常见的视觉-语言Adapter有哪些结构? 「字节跳动、百度、美团」 25. 【多模态特征融合方式】把多模态特征加到模型里,除了生成SID的方式,还有别的方式吗? 「美团」 26. 【微调视觉编码器】你为什么不直接微调整个大模型,而是只微调大模型的视觉编码器部分? 「字节跳动」 27. 【视觉token投影与对齐】为什么视觉token要经过projection之后再进入LLM?vision token输入到对齐层做了哪些操作?为什么不能直接用多模态的embedding(如QWEN-VL的embedding)去训练? 「字节跳动、美团、阿里巴巴」 28. 【视觉编码器损失】Vision Encoder的loss怎么设计的? 「美团」 29. 【视觉编码器桥接】有没有试过vision encoder的桥接? 「腾讯」 30. 【跨模态对齐可视化】如何通过可视化分析模型的跨模态对齐效果? 「京东」 31. 【跨模态注意力机制】比如如何理解“跨模态注意力机制”在融合中的作用? 「京东」 **L4 优化与诊断** 1. 【CLIP与ConvNext特征交互】CLIP的特征怎么和ConvNext的特征做交互? 「蚂蚁集团」 2. 【CLIP双塔召回与冷启动】多模态召回:CLIP 风格双塔 + cold start 怎么融合内容向量 「字节跳动」 3. 【CLIP对比学习采样与计算】详细说明CLIP架构中Contrastive Learning的正负采样策略,如何处理百万级Batch Size下的计算开销? 「腾讯」 4. 【CLIP对比损失与DPO】CLIP中的对比损失与DPO损失之间的联系。 「百度」 5. 【CoCa模型】如何评价CoCa模型在Generative与Contrastive任务上的权衡? 「腾讯」 6. 【Q-Former与MLP对比】Q-Former与两层MLP的区别是什么?为什么在某些场景下偏好使用两层MLP而非Q-Former?请分别说明Q-Former的原理、两层MLP的设计动机,以及在不同应用场景(如图文对齐、多模态理解)中的选择偏好。 「阿里巴巴、阿里通义」 7. 【单流双流实现】单流双流代码层次怎么实现的,有没有训练过相关的模型插件? 「腾讯混元」 8. 【商品图片描述生成】比如用模型实现“商品图片生成描述”,如何保证内容准确性? 「京东」 9. 【商品搜索匹配优化】比如为618优化商品搜索的多模态模型,如何在短时间内提升匹配精度? 「京东」 10. 【多模态嵌入噪声处理】假如用多模态模型来做Embedding,图片中会引入噪声应该怎么解决? 「阿里巴巴」 11. 【多模态排序】现在有一个query,排序时如何判断应该把图片排在首位,还是把文本排在首位? 「百度文心」 12. 【对比学习与掩码预测】在多模态预训练中,跨模态对比学习(Contrastive)与掩码预测(MIM/MLM)各自的优缺点是什么? 「腾讯」 13. 【对比学习弱语义问题】如果图像和文本的语义相关性极弱,对比学习的Loss会出现什么问题?如何优化? 「腾讯」 14. 【开放VQA】如果vqa是开放的问题怎么办? 「阿里通义」 15. 【弱对齐与领域适应】什么是弱对齐(仅有相同的class label)?模型结构、训练方法(开放题)。如果同样是图像数据,自然图像模态的表征效果好,卡通图像的效果不好该怎么处理? 「字节跳动」 16. 【码本序列与重构损失】既要保证两个模态信号映射为同一个码本序列,又要保证各自的重构损失? 「阿里巴巴」 17. 【视觉依赖度KL散度】视觉依赖度用KL散度计算的完整流程,原图mask局部特征框的操作逻辑? 「字节跳动」 18. 【视觉提示工程】如何在不改变LLM权重的前提下,仅通过视觉Prompt Engineering提升模型性能? 「腾讯」 19. 【视觉编码器与LLM连接】视觉编码器和LLM连接时,使用BLIP2中Q-Former那种复杂的Adaptor好还是LLaVA中简单的MLP好?说说各自的优缺点,并详细描述视觉编码器和LLM如何连接的过程。 「蚂蚁集团、阿里通义」 20. 【视频审核正负样本设计】对于视频审核业务,如果自己训一个clip模型来抽取特征,你会如何设计正负样本? 「字节跳动」 21. 【视频文本对齐】应用题:用clip做视频文本的对齐,你有什么方法吗? 「美团」 22. 【跨模态融合机制对比】(如CLIP、ALBEF、FLAVA)它们的跨模态融合机制(如对比学习、注意力对齐)有何差异? 「京东」 23. 【音频编码与多模态对齐】音频如何编码?如何对齐多个模态?比如ImageBind具体怎么实现对齐的? 「腾讯」 **L5 综合与前沿** 1. 【多模态搜索语义不一致定位与解决】如果给你一个多模态搜索场景,用户输入一张图片和一段文字描述,但返回结果中图文语义不一致,你会如何从模型和数据两个层面定位并解决这个问题? 「腾讯」 2. 【多模态素材质量评估与补全】在腾讯广告业务中,广告主经常提供图文完全不符或者分辨率极低的劣质素材。如果要设计一个多模态素材质量自动评估与补全优化的端到端系统,你的整体架构设计是什么? 「腾讯」 3. 【多模态防作弊与语义冲突检测】在微信看一看的图文资讯分发场景中,常常出现极其隐蔽的标题党现象(文本诱导,图片毫无关联)。请设计一个多模态防作弊鉴别系统,核心解决图文深层语义冲突的精准识别问题。 「腾讯」 4. 【跨模态生成与优化】在商品广告创意生成中如何应用RL优化跨模态生成? 「京东」 5. 【长尾图文检索对齐】微信朋友圈的图片与短视频内容极具长尾多样性。如果要实现一个基于自然语言的精准相册检索功能,你会选择怎样的图文表征对齐方案,来克服用户口语化查询与复杂图像视觉细节之间的巨大语义鸿沟? 「腾讯」 ## 多模态大模型 **L1 基础认知** 1. 【多模态定义】多模态指的是什么?(介绍多模态) 「百度、美团」 **L2 原理理解** 1. 【Qwen3-VL参数量】Qwen3-VL-4B图像和文本的参数量分别是多少? 「字节Seed」 2. 【多模态大模型介绍】请介绍除Qwen之外的主流多模态大模型,包括但不限于:LLaVA、DeepSeek-VL、苹果MM1、Video-LLaMA、GLM、InternVL、面壁智能的模型等。要求:简要说明每个模型的核心特点或架构。 「字节跳动、百度、美团、蚂蚁集团」 3. 【多模态大模型概述】了解哪些多模态大模型(VLM)?请简要介绍几个。 变体: - 了解多模态模型吗:blip、blip2、GME? - 介绍ALBEF和BLIP。 - 你关注过开源多模态模型吗? - 你对“多模态视觉技术”的理解是什么? - 你是如何使用这些多模态大模型的? - 你熟悉多模态模型的可视化工具吗? - 你认为多模态大模型的核心价值是什么? - 多模态大模型与纯大模型区别? - 多模态大模型为什么需要模态对齐? - 多模态大模型的基本架构是什么?通常由哪几个核心部分组成? - 多模态大模型的视觉编码器是什么?你用过哪些视觉编码器? - 多模态模型在其中的核心作用是什么? - 多模态输出是什么? - 大模型算法那段:为什么要从单模改成多模? - 它在多模态任务中的应用有哪些优势? - 怎么使用多模态模型?怎么和多模态做结合? - 是否了解qwen image,flux? - 是否熟悉主流的VLM模型架构? 「京东、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 **L3 实现与应用** 1. 【BEV、VLM、VLA概念】你对 BEV、VLM、VLA 的理解? 「百度」 2. 【BLIP系列架构与训练】BLIP-2的整体结构是什么?两阶段训练流程是怎样的?用到了哪些损失函数?BLIP2相对于BLIP有哪些改进,BLIP3又有哪些改进? 「字节跳动、阿里巴巴、阿里通义」 3. 【Deepseek-VL架构】Deepseek-VL的模型架构padding是如何做的? 「蚂蚁集团」 4. 【FLUX模型架构】FLUX中文本模态的condition如何注入的? 「百度」 5. 【LLaVA投影层】LLaVA模型如何将视觉编码器与大语言模型进行连接?请描述其视觉-语言投影层的设计思路及训练阶段。介绍一下LLaVA的projection layer有哪几种?并谈谈你对Projection Layer作用的理解,Linear与MLP效果有何差异? 「百度、腾讯」 6. 【LLaVA版本演进】简述LLaVA-1.5相比于1.0版在输入分辨率和模型架构上的具体提升。 「腾讯」 7. 【MLLM对齐与训练】MLLM 不做对齐会有什么结果?MLLM 的对齐分别有哪些任务,介绍下(grounding、OCR 这些)?MLLM 训练的时候 vision encoder 也是有一个单独的 loss 吗? 「百度、蚂蚁集团」 8. 【Q-Former机制】解释BLIP-2中Q-Former的核心逻辑,它是如何解决视觉特征与文本LLM维度不匹配问题的? 「腾讯」 9. 【Qwen2.5-VL架构与改进】Qwen2.5-VL的架构包含什么?其Transformer结构与普通Transformer有何不同?如何处理图像和视频等多模态输入?文本和图像的位置编码分别如何实现?Qwen2.5-VL的grounding机制是怎么变的?Qwen2.5-VL pretrain 阶段用了哪些数据?Qwen2.5 VL相对Qwen 2 VL做了哪些改进?Qwen的max pixels参数是什么?Qwen3 VL的image encoder是什么?Qwen的ViT是怎么处理绝对时间对齐的?介绍Qwen2.5-VL及其视觉编码器。 「京东、百度、美团、腾讯、蚂蚁集团、阿里巴巴」 10. 【Qwen3-VL创新点】简单讲下qwen3vl的核心创新点。 「腾讯」 11. 【Qwen-Omni模型】你怎么看新出的Qwen-Omni?请讲一下Qwen-Omni。 「蚂蚁集团」 12. 【Qwen-VL架构与训练】Qwen-VL了解吗,数据处理怎么做?Qwen-VL动态分辨率怎么做?qwen2vl如何实现动态分辨率?QwenVL的动态分辨率怎么实现?Qwen-VL是怎么处理高分辨率图片的?Qwen-VL的三个训练流程分别是什么,有什么作用?讲一下qwenvl的架构。Qwen-VL系列的多模态对齐怎么做? 「京东、百度、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 13. 【Qwen-VL版本对比】请对比Qwen-VL1、Qwen-VL2、Qwen-VL2.5和Qwen3-VL(Qwen-VL3)的模型结构、训练流程及主要改进点。 「京东、美团、腾讯、蚂蚁集团、阿里通义」 14. 【Transformer多模态应用】Transformer能否直接用于多模态任务?请解释Transformer在音视频多模态任务中的应用及其优势。 「字节跳动、腾讯」 15. 【Video-LLaMA结构】讲一下Video-LLaMA的整体结构:视频编码器(如ViT+Temporal Aggregator)→投影层(对齐文本空间)→LLaMA语言模型。 「字节跳动」 16. 【VLM视觉编码器】VLM中vision encoder如何训练?是否分阶段训练?计算效率如何?请结合具体模型说明。 「腾讯、阿里通义」 17. 【VLM训练阶段】介绍一下VLM的训练阶段有哪些?训练阶段的任务是什么? 「阿里通义」 18. 【图像生成与跨模态理解】它们在图像生成、跨模态理解上的技术突破是什么? 「京东」 19. 【多模态伦理风险】你了解多模态模型的伦理风险吗? 「京东」 20. 【多模态大模型综合】多模态大模型整体结构、发展历程、训练过程、融合方式、视觉输入处理、特征处理、映射层、文档解析、医疗应用、原生多模态与对齐、Qwen-VL图文融合与多图处理、视觉token压缩等综合问题。 「京东、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 21. 【多模态大模型趋势】你认为多模态大模型的未来趋势是什么? 「京东」 22. 【多模态大模型问题】了解哪些多模态大模型?目前多模态大模型最大的问题是什么? 「蚂蚁集团、阿里通义」 23. 【多模态数据与记忆】讲了自己对多模态数据的看法和多模态 memory 数据的利用 「拼多多」 24. 【多模态数据分析】你有过用多模态模型进行数据分析的经历吗? 「京东」 25. 【多模态数据增强】你如何设计多模态数据的增强策略? 「蚂蚁集团」 26. 【多模态数据特点】之前的工作的多模态数据有什么特点和创新点,觉得还可以有什么改进? 「百度」 27. 【多模态数据预处理】电商数据多模态内容如何在大模型处理端预处理? 「拼多多」 28. 【多模态模型对比】请横向对比多模态大模型LLaVA、BLIP-2、Qwen-VL、InternVL、CLIP、DeepSeek等,说明它们的原理、结构(包括视觉编码器、语言模型、连接方式)、训练方式、特点及差异,并特别指出LLaVA与InternVL除了语言模型、视觉编码器和训练方式不同外还有哪些区别,以及LLaVA与BLIP-2的对比细节。 「京东、字节跳动、美团、蚂蚁集团、阿里通义」 29. 【多模态模型微调】有没有微调过多模态大模型? 「百度」 30. 【多模态模型结构】讲一下主要的多模态模型的模型结构(图像编码器+连接层+LLM);介绍LLaVA或Qwen-VL的架构:视觉编码器(如ViT)与大语言模型如何连接?最容易踩坑的点通常在哪里? 「京东、字节跳动、拼多多、百度」 31. 【多模态模型训练策略】训练时候ViT、对齐层、LLM部分学习率一般如何设置? 「字节跳动」 32. 【多模态模型路线】有没有了解过Nano、Image 2.0、Seedream这些模型,底层大概是什么模型路线? 「百度」 33. 【多模态海报生成】端到端中英文海报怎么做的? 「腾讯混元」 34. 【多模态能耗】你了解多模态模型的能耗问题吗? 「京东」 35. 【多模态迁移学习】你了解多模态模型的迁移学习吗? 「京东」 36. 【实时多模态特征】直播怎么用的实时多模态特征,有哪些? 「字节跳动」 37. 【操控信号表征】对于那种“刹车、油门、转向”的操控信号(Action),在模型里一般是怎么表征的? 「字节跳动」 38. 【数字人开发】你有过数字人相关的开发经历吗? 「京东」 39. 【模型规模选择】为什么会用qwen0.5B做多模态表征,为什么不用更大的?请讨论模型规模选择。 「美团」 40. 【视频帧冗余处理】视频文本检索(Video-Text Retrieval)中,如何解决视频帧冗余导致的计算浪费? 「腾讯」 41. 【视频文本融合】视频与文本的融合面临哪些挑战(如时序对齐、信息冗余)? 「京东」 42. 【语音文本融合】你关注过语音与文本的融合技术吗? 「京东」 43. 【长多模态数据】长多模态数据如何获取? 「腾讯」 44. 【音视频对齐】视频与音频的对齐(Audio-Visual)在实际落地中常见的挑战有哪些? 「腾讯」 **L4 优化与诊断** 1. 【Flamingo模型结构】解释Flamingo模型中的Perceiver Resampler结构及GATED XATTN-DENSE机制。 「腾讯」 2. 【FLUX模型架构】FLUX-Fill的模型结构,输入维度,具体的shape,怎么拼接的,为什么要先双流后单流? 「阿里巴巴」 3. 【MLLM安全对齐】MLLM 做安全对齐你会如何做数据(筛选、过滤、去重、去除简单的数据)? 「蚂蚁集团」 4. 【MLLM定位能力】你觉得 MLLM 能做好 grounding 任务吗? 「蚂蚁集团」 5. 【MLLM强化学习】你觉得 MLLM 做强化学习有必要吗? 「蚂蚁集团」 6. 【MLLM预训练】听了你的 Paper 场景描述,既然 MLLM 在 edited image 上表现不好,为什么不考虑预训练做你的场景? 「腾讯」 7. 【Qwen3-VL性能优化】Qwen3VL的应用场景中,模型性能瓶颈表现在哪些方面?你是如何优化的? 「百度」 8. 【Qwen-VL架构】QwenVL系列架构详细解析,历代VL有什么改进,mRoPE详解,LoRA基本原理以及两个矩阵怎么初始化以及为何,CLIP架构详解讲解,以及训练方法。介绍Qwen Image以及Qwen Image Edit架构,VAE细节。 「百度、腾讯混元」 9. 【VLA模型实时性】现在的VLA(Vision-Language-Action)模型火得一塌糊涂,你觉得它在车上真的能实时跑起来吗? 「字节跳动」 10. 【VLM幻觉与信息完备】VLM的信息完备和幻觉,怎么trade-off? 「阿里通义」 11. 【VLM缩放定律】VLM是否存在scaling law? 「阿里通义」 12. 【Wan2.1模型架构】Wan2.1的模型架构细节是什么?包括图像特征和文本特征是如何注入进去的? 「百度」 13. 【原生多模态理解】讲一下你对原生多模态的理解? 「腾讯」 14. 【在线视频理解】介绍了一个项目,聊了一下online的视频理解怎么做,目前多模态模型的一些问题以及可能的改进方向。 「百度」 15. 【多模态DPO训练】多模态的DPO的训练是如何做的?如何构造数据? 「百度」 16. 【多模态token设计】视频、音频、文字混合的复杂多模态场景,如何设计token和位置编码? 「腾讯」 17. 【多模态召回】业务场景题。你觉得有哪些信息,除了画面和文本信息,还有哪些信息是可以被用来去召回这些内容商品不符的类别的。 「字节跳动」 18. 【多模态后训练】在多模态大模型成为趋势的背景下,后训练技术会面临哪些新的机遇和挑战? 「蚂蚁集团」 19. 【多模态图文一致性评估】多模态场景怎么评估:如何检查“图文一致性/不编造信息”?优先加哪些自动化检查? 「拼多多」 20. 【多模态图表理解】多模态场景下,怎么让模型理解图表(比如柱状图、表格)? 「美团」 21. 【多模态大模型工业落地】多模态大模型(如CLIP、BLIP、LLaVA)在工业界落地时,你认为最大的瓶颈是什么?腾讯CSIG在产业互联网场景下,多模态技术最可能突破的方向是哪个? 「腾讯」 22. 【多模态安全】我记得有一款显示器,物理外挂(好像是gui agent这种图像操作方式),这一部分有专门设防御吗? 「腾讯」 23. 【多模态对抗攻击】你了解多模态模型的对抗性攻击吗? 「京东」 24. 【多模态强化学习】MLLM做RL会有提升吗?MLLM做RL与SFT的区别是什么?你关注过多模态与强化学习的结合吗?具体到多模态+GRPO有没有结合的想法和思路? 「京东、蚂蚁集团、阿里巴巴」 25. 【多模态扩展】新增一个音频模态你会怎么考虑? 「腾讯」 26. 【多模态技术进展】多模态领域近两年最让你兴奋的技术进展是什么?你认为腾讯CSIG在其中的机会和挑战分别是什么? 「腾讯」 27. 【多模态指令微调数据】如何构建高质量的多模态指令微调数据集(Instruction Tuning Data)? 「腾讯」 28. 【多模态时间对齐】在多模态任务中,你如何处理不同模态数据的时间对齐问题? 「蚂蚁集团」 29. 【多模态模型对比】Llava、Chameleon模型的结构区别、训练差异,以及不同技术方案的认知问题。llava和llama的区别? 「字节Seed、阿里巴巴」 30. 【多模态模型瓶颈】这类多模态大模型目前核心瓶颈、缺陷是什么? 「百度」 31. 【多模态模型评估】如何评估多模态模型/对齐方法/预训练模型的优劣、适用性及实际应用效果? 「蚂蚁集团」 32. 【多模态特征融合】你如何设计多模态特征的融合策略?具体到Lidar和Camera的融合,在特征层面(Feature-level)融合现在还有什么没解决的痛点? 「字节跳动、蚂蚁集团」 33. 【多模态缩放定律】多模态大模型有什么scaling law吗? 「蚂蚁集团」 34. 【多模态表征与码本】为什么没用RQVAE?在你的项目中两个模态的信号通过什么约束映射到同一个码本序列中的? 「阿里巴巴」 35. 【多模态训练数据构建】你了解多模态模型的训练数据构建吗?多模态那边怎么做的SFT数据和RL数据? 「京东、百度」 36. 【多模态长序列数据】多模态长序列数据如何获取? 「百度」 37. 【多模态预训练噪声】在大规模多模态数据预训练中,如何缓解文本侧的“叙述噪声”问题? 「腾讯」 38. 【多语言多模态】在处理多语言多模态任务时,你有哪些技术挑战和解决方案? 「蚂蚁集团」 39. 【大模型自动驾驶】如何看待GPT-4o或者LLaMA这类大模型在autonomous driving中的作用? 「字节跳动」 40. 【少样本多模态适配】针对垂直行业(如医疗、工业),如何利用少量样本完成多模态大模型的适配? 「腾讯」 41. 【模态缺失处理】你如何处理多模态任务中的模态缺失问题? 「蚂蚁集团」 42. 【电商多模态语义】业务场景题,在电商治理过程中,如何设计多模态语义。 「字节跳动」 43. 【端到端架构】是否有了解一些比较前沿的端到端架构? 「字节跳动」 44. 【端到端语音助手】做端到端模型实际在语音助手场景会有什么问题? 「字节Seed」 45. 【视觉大模型多模态扩展】对于视觉大模型,加入多模态能做吗?原生这样处理token融合处理,视觉模块的处理,这个架构加入的话有纯文本的效果吗?vllm本身有做量化吗?迁移到n卡上有问题吗?第一段实习是描述性的还是做的分类任务,效果如何? 「百度」 46. 【视觉投影层设计】现在业界的大模型主要都使用两层mlp来做视觉投影,逐渐淘汰了q-former,你认为是为什么? 「阿里通义」 47. 【视觉编码器移植】如果将Qwen2.5-VL的VIT移植到Qwen3,构建Qwen3-VL,除了tokenlizer需要对齐,其他的还有什么要注意的 「百度」 48. 【视觉语言连接件】连接件为什么从CrossAttention或者QFormer变成了MLP,相对于两者MLP有什么缺点 「百度」 49. 【负样本构建】你如何设计多模态任务的负样本构建策略? 「蚂蚁集团」 50. 【跨模态参数共享】跨模态参数共享为什么比独立专家好? 「百度」 51. 【跨模态融合创新】解题思路中体现了哪些跨模态融合创新? 「京东」 52. 【音画对齐】紧接着提了一个音画caption跟随的问题,让想想怎么在caption中对齐多个人物是谁在说话,可以从数据角度答。 「阿里通义」 53. 【音频视觉多模态】在处理音频-视觉多模态任务时,你有哪些独特的技术考量? 「蚂蚁集团」 54. 【预训练图像Token影响】你觉得预训练引入 image token 会不会对整体训练造成损失? 「腾讯」 **L5 综合与前沿** 1. 【VLA模型】VLA 多模态项目 「百度」 2. 【世界模型】有人说“WorldModel(世界模型)是端到端的终极形态”,你怎么看? 「字节跳动」 3. 【原生多模态对齐瓶颈】GPT-4o实现了原生端到端的多模态音频与视觉交互,去除了传统级联系统(ASR加LLM加TTS)的严重中间延迟。你认为实现这种原生多模态严格对齐的最大技术瓶颈是在高质量数据集层面,还是在模型底层的模态融合架构层面?请详述推演逻辑。 「腾讯」 4. 【多图输入处理】如果现有的基座大模型采用主流的视觉扩展架构(如LLaVA路线),但在处理多图交错输入时极容易出现图像位置混淆和指代不明的问题,你会在网络架构的哪个具体部分进行针对性的改造? 「腾讯」 5. 【多模态内容审核】假设团队需要在一个月内上线一个多模态内容审核系统,但标注数据只有10万对图文对,且正负样本比例严重失衡,请设计一个从数据增强到模型选型的完整方案。 「腾讯」 6. 【多模态基座模型演变】从CLIP跨模态对比学习,到BLIP的引导式对齐,再到目前的生成式统一大模型。你认为下一代真正通用的多模态基座模型的核心技术范式会发生怎样的演变?其背后的驱动力是什么? 「腾讯」 7. 【多模态对话系统】请设计一个多模态对话系统,说明其核心算法和流程? 「字节跳动」 8. 【多模态工作流】5G项目:多模态工作流怎么设计? 「阿里巴巴」 9. 【多模态情感分析】请设计一个多模态情感分析/识别系统,说明其核心模块和数据流? 「字节跳动」 10. 【多模态数字人】假设你需要为腾讯会议开发一个多模态数字人助手,要求能够实时根据用户的语音情绪和输入的文本指令生成对应的面部表情和肢体动作。在端到端延迟必须控制在50毫秒以内的限制下,你会怎么权衡模型的各个模块结构? 「腾讯」 11. 【多模态流式注意力】假设视频号带货直播间需要一个自动解说生成模型,要求模型能同时理解画面中的商品物理细节和主播的实时口播音频,并同步生成弹幕互动文本。你如何设计这种多模态流式输入与严格对齐的注意力机制? 「腾讯」 12. 【多模态统一】CV和NLP的区别和联系,在Transformer的大背景下,CV、NLP,包括语音等,能否实现大一统?具体到LLM,图像/视频生成与理解如何统一? 「百度、百度文心、腾讯」 13. 【多模态趋势与业务】你如何看待多模态模型从图文对齐走向视频理解、3D感知的趋势?腾讯CSIG的智慧零售、智慧交通等业务中,哪些场景最需要这种能力升级? 「腾讯」 14. 【多模态输入安全】的轨迹。在端到端框架下,不引入规则,你怎么解决这种“多模态输入异常”导致的安全问题? 「字节跳动」 15. 【多模态预训练方案】如果让你从头预训练一个多模态大模型,你会怎么做,会有哪些问题,怎么解决? 「腾讯」 16. 【多模态高光剪辑】针对QQ音乐的MV与歌词匹配场景,如何利用音、视、文的三模态数据,设计一个能够自动生成音乐高潮片段卡点的短视频高光剪辑算法? 「腾讯」 17. 【跨文化视觉理解】许多头部开源多模态模型在英文标准的图文问答基准上表现优异,但在中文特色场景(如中国菜系识别、复杂中文谐音梗图图文理解)上表现极差。除了简单粗暴的数据翻译与扩充,还能通过什么机制从模型表征本质上提升其跨文化的视觉理解能力? 「腾讯」 ## OCR与文档理解 **L1 基础认知** 1. 【OCR基础与必要性】需要做ocr吗? 「蚂蚁集团」 **L2 原理理解** 1. 【OCR与文档理解】1. 图片中会有一些文字,打算怎么处理?(OCR基础与必要性) 2. chartQA的方向有了解吗?(图表与结构化文档理解) 「百度、蚂蚁集团」 **L3 实现与应用** 1. 【OCR与文档理解】1. OCR如何处理复杂表格?2. 图表类相关的caption又会关注哪些维度?3. 项目中的OCR怎么做的,为什么用大模型做? 「京东、美团」 **L4 优化与诊断** 1. 【OCR大模型应用】多模态大模型进行OCR需要做哪些改进,注意哪些问题?当图片里的文字与周边正文语义强相关时,如何把两者的上下文关联保留下来? 「字节跳动、蚂蚁集团」 2. 【OCR技术趋势】开放问题:怎么看待传统CV比如OCR和深度学习模型未来的关系? 「腾讯」 3. 【图表与结构化文档理解】对结构化的图像(例如图表)如何合成相应的数据,应该关注什么? 「蚂蚁集团」 ## 3D视觉与NeRF及3DGS **L0 上下文不足(难度待定)** 1. 【上下文不足】在技术侧重点(如图像特征提取、空间信息处理)上有何不同? 「京东」 **L1 基础认知** 1. 【职业动机】为什么以后想要专门做3D视觉?因为研究生期间的研究惯性,有其他原因? 「京东」 2. 【自动驾驶技能】你熟练掌握哪些与自动驾驶算法相关的专业知识与技能?请结合学习或科研/实习案例说明应用场景与成效。 「京东」 3. 【路径点间隔】路径点间隔几米一个? 「百度」 **L2 原理理解** 1. 【3D人体模型】是否了解FLAME、骨骼驱动、混元3D? 「腾讯」 2. 【3D语义分割】关于3D语义分割,你了解有哪些基础技术或研究? 「京东」 3. 【Frenet坐标系】为什么要用Frenet坐标系? 「腾讯」 4. 【重建基础模型】在重建领域,有哪些基础的、常用的模型或技术? 「京东」 5. 【高精地图规模】高精地图的文件大小和尺度范围大小大概是多少? 「百度」 **L3 实现与应用** 1. 【3DGS与NeRF对比】3D Gaussian Splatting (3DGS) 与传统方法(如 NeRF、Mesh)相比,具体的差异和优势在哪里?请阐述你对 NeRF 和 3DGS 差异的理解。 「京东」 2. 【3DGS损失函数】3DGS渲染中,如何衡量渲染图和真实值的差距?损失函数是怎么设计的? 「京东」 3. 【3DGS稀疏点云建模】3DGS是如何通过稀疏点云进行建模的? 「京东」 4. 【BEVFormer】介绍一下bevformer。 「腾讯」 5. 【PointNet系列】PointNet、PointNet2原理,mlp是什么,点云中的shared-mlp是怎么回事? 「百度」 6. 【S-T图】什么是S-T图?它如何用来解决动态障碍物避障问题? 「腾讯」 7. 【Zero123】Zero123 的原理是什么? 「字节Seed」 8. 【人头重建模型】关于人头重建,从模型发展历史上看,有哪些系列模型? 「京东」 9. 【包裹体积识别】如果我们要做包裹体积识别,用到3D应该要怎么做? 「京东」 10. 【坡面地面提取】对于一些坡面地面,应该如何提取? 「百度」 11. 【局部规划】局部规划怎么做? 「百度」 12. 【点云数据问题】测试中点云因为光照原因没有采集好数据怎么办? 「美团」 13. 【球面投影】如何通过球面投影(Spherical Projection)将点云转换为距离图像(Range Images)? 「腾讯」 14. 【距离变换】栅格地图的距离变换方法?可以怎么用于路径规划? 「百度」 15. 【高斯点体积表示】这一系列的高斯点,最后怎么用体积来表示呢? 「京东」 16. 【高精地图构建】高精地图的拓扑和几何结构是怎么构建的? 「百度」 **L4 优化与诊断** 1. 【3DGS数字人对比】3DGS数字人对比米哈游数字人,优缺点对比? 「腾讯」 2. 【Hybrid A*算法】Hybrid A*的原理和实际应用中的缺点;维诺图平滑的原理和用法,得到的轨迹能否直接给控制模块跟踪(不能,需说明gap所在)。 「百度」 3. 【ICP算法】icp方法原理,高斯牛顿解法,雅克比矩阵求导。 「百度」 4. 【iLQR算法】iLQR的原理和理解。 「百度」 5. 【前景重建精度】先裁剪前景再做重建,怎么能保证重建出来的这些高斯点是准的? 「京东」 6. 【车辆模型】车辆运动学模型和动力学模型,白板手推阿克曼几何,动力学假设,有哪些常用的动力学模型? 「百度」 7. 【风险预判】如果在感知尚未输出的情况下,通过轻图/导航信息预判到前方盲区可能存在行人,规划层应如何做风险预判? 「腾讯」 **L5 综合与前沿** 1. 【决策规划算法】你对自动驾驶决策规划算法有哪些理解?说明常用决策规划算法(如A*、RRT*、模型预测控制MPC等)的核心原理与适用场景,结合干线物流自动驾驶路径规划需求,谈谈你的算法设计思路? 「京东」 2. 【数字人表情驱动】围绕游戏内可实时交互的3D数字人表情驱动进行初步方案设计(可聚焦数据、训练或评测任一环节)。 「腾讯」 ## 视频理解与生成 **L1 基础认知** 1. 【视频理解与生成】你有过处理视频数据的经验吗?文生视频有了解过哪些,最近用过什么? 「京东、腾讯混元」 **L2 原理理解** 1. 【Wan系列视频生成模型】有关注Wan2.7-Video吗? 「阿里通义」 2. 【视频分析vs图像分析】你认为“视频分析”与“单张图像分析”的核心差异是什么? 「京东」 3. 【视频帧采样方法】视频帧采样方法:包括动态帧率采样(与3D采样编码方式的不同)、vt采样纵向上的模态数、是否固定采样帧数、帧采样数量等。 「字节Seed、字节跳动、百度」 4. 【视频生成vs图像生成】视频生成模型和图片生成模型的区别?个人怎么看待视频生成和图像生成,更倾向于哪种? 「百度、阿里巴巴」 5. 【视频生成评估基准】介绍VBench(视频生成评估基准)。 「阿里巴巴」 **L3 实现与应用** 1. 【ASR辅助关键帧提取】在短视频摘要任务中,如何利用ASR(语音转文字)信息来辅助视觉关键帧提取? 「腾讯」 2. 【多模态大模型视频处理】Qwen-VL系列如何处理视频?请说明其视频处理流程。 「阿里巴巴」 3. 【多模态视频分析应用】多模态视频分析应用:比如通过“物流视频+文本日志”分析分拣错误原因,效果如何?请讨论。 「京东」 4. 【多目标跟踪算法】多目标跟踪算法:包括DeepSORT代码解析、数据关联代码实践、卡尔曼滤波原理。 「腾讯」 5. 【视频Caption生成】怎么用模型做视频Caption生成?请介绍方法。 「阿里通义」 6. 【视频帧采样方法】视频帧采样方法:介绍稀疏帧采样和长视频采样的方法,包括对论文C中稀疏帧采样的了解。 「百度、百度文心」 7. 【视频时空特征提取】视频时空特征提取:介绍TimeSformer或VideoMAE的核心思路;说明SlowFast网络如何模拟人类视觉系统的双流机制。 「腾讯」 8. 【轨迹预测与规划】轨迹预测与规划:使用MotionLM这种形式?请介绍其原理。 「字节跳动」 9. 【音视频噪声处理】如何解决音视频数据中的噪声问题?请列举具体方法。 「字节跳动」 **L4 优化与诊断** 1. 【CogVideoX架构与训练】CogVideoX的模型结构(包括3DVAE的压缩率、MM-DiT的优势、4f+1中+1的含义)是怎样的?训练过哪些插件?用了多少数据量和多少卡? 「腾讯混元、阿里巴巴」 2. 【Wan系列视频生成模型】Wan系列视频生成模型:Wan2.1的详细架构和训练细节;Wan2.2 MoE模型的步数蒸馏如何设计?Wan2.2的模型架构细节,高噪专家和低噪专家根据信噪比划分,具体实现及转换选择。 「字节跳动、百度、阿里巴巴」 3. 【多模态大模型视频处理】介绍一下多模态长视频扩展方法,如何在现有模型上改,比如llava? 「腾讯」 4. 【多模态视频分析应用】如何利用多模态信息进行视频情感识别(Multimodal Emotion Recognition)? 「腾讯」 5. 【多目标跟踪算法】MOTR范式在训练的时候需要加哪些约束? 「腾讯」 6. 【文生视频人物ID保持】文生视频过程中当人物的移动速度过快情况下id很难保持,针对这个问题你有什么解决方案? 「腾讯混元」 7. 【视频大模型技术探讨】视频大模型技术探讨:动态分辨率策略/帧采样率设定/最大上下文窗口设计。 「字节Seed」 8. 【视频帧采样方法】多模态大模型在处理视频理解任务时,如何高效采样帧序列,以平衡计算成本与时序信息? 「字节跳动」 9. 【视频物体时间轴提取】一个带货博主的视频,怎么得到重要物体出现的时间轴以及对应的描述。 「字节Seed」 10. 【视频生成一致性】怎么保证长视频中的背景一致性? 「阿里巴巴」 11. 【视频音频预训练】讲一下视频/音频预训练,如何构建网络,如何训练? 「腾讯」 12. 【轨迹预测与规划】有没有了解过轨迹预测、博弈和预测规划一体化?如何理解? 「百度」 13. 【长视频关键帧提取与语义连贯】对于分钟级长视频,如何设计多模态模型以提取关键帧并保持语义连贯性? 「腾讯」 14. 【长视频理解关键问题】问long video understanding有什么关键的问题? 「百度」 **L5 综合与前沿** 1. 【视频生成模型资源受限优化】如果让你主导研发一款类似于Sora的视频生成模型,应用在腾讯互娱(IEG)的游戏NPC过场动画自动生成中,在可调用的计算资源只有业界头部企业三分之一的情况下,你会优先在哪些网络结构或采样模块上做工程妥协与剪枝? 「腾讯」 2. 【视频生成模型路线对比】目前Diffusion Transformer在视频生成领域证明了巨大的潜力,但自回归(Autoregressive)离散Token模型在图像和视频生成上也有强劲的追赶势头。你如何看待这两种底层路线在未来多模态生成终局上的博弈? 「腾讯」 3. 【超长视频时序建模优化】当多模态大模型需要支持超长视频序列(如两小时完整的腾讯长视频电影)理解时,基础Transformer的全局注意力机制会导致显存瞬间爆炸。请给出三种解决长视频时序建模的架构级优化方案,并详细对比其优劣。 「腾讯」 4. 【音频驱动数字人重建】如果现在要你做音频驱动的数字人重建,你觉得有哪些亟待解决的问题,有哪些可以发论文的点? 「百度」 ## Diffusion与图像生成 **L0 上下文不足(难度待定)** 1. 【上下文不足】Flow未在合适时机取消? 「阿里巴巴」 **L2 原理理解** 1. 【CFG】CFG设置的scale过高会发生什么? 「腾讯混元」 2. 【图像生成基础】了不了解图像生成,DiT和flow matching等 「阿里巴巴」 3. 【扩散模型分类】diffusion model有哪些? 「百度」 4. 【扩散模型概述】介绍你对扩散模型的理解 「阿里巴巴」 5. 【文生图架构】文生图模型的架构是否了解? 「阿里巴巴」 6. 【生成任务】对文生图、图生图、图生视频的了解 「阿里巴巴」 **L3 实现与应用** 1. 【AIGC应用】常见游戏立绘和皮肤生成 「腾讯混元」 2. 【DDPM训练】DDPM在训练的时候为什么不是先加噪1000步然后再去噪,而是随机选一个时间步加噪再学习去噪过程? 「百度」 3. 【DiT】为什么dit更主流? 「腾讯混元」 4. 【Flow Matching】flow matching的训练和推理流程? 「腾讯混元」 5. 【LoRA】LoRA为什么能实现单模型多风格的一个生成作用在SD哪里(交叉注意力层)? 「阿里巴巴」 6. 【Prompt处理】AIGC绘图项目中,模糊意图怎么处理? 「阿里巴巴」 7. 【Stable Diffusion】Stable diffusion与DDPM的区别,Stable diffusion为什么要将图像嵌入到隐空间,有何优势? 「字节Seed」 8. 【Stable Diffusion损失】Stable diffusion的损失函数是什么,具体由哪几部分构成? 「字节Seed」 9. 【Textual Inversion】解释一下Textual Inversion。 「字节跳动」 10. 【扩散模型基础】Diffusion模型的原理是什么,如何实现训练和推理? 「字节Seed」 11. 【扩散模型模块】DM模块的具体输入是基于什么的,里面做了什么操作? 「字节Seed」 12. 【数据准备】AIGC绘图项目用了哪些数据,怎么来的,是否有做预处理? 「腾讯」 13. 【时间步采样】训练diffusion model或flow matching model时,timestep采样使用什么分布? 「阿里巴巴」 14. 【模型路线】是否了解Nano、Image 2.0、Seedream这类图像生成模型,它们底层大概是什么模型路线? 「百度」 15. 【生成质量】1. AIGC的“美感”是怎么体现的? 2. 如何缓解DT生成中的过饱和现象? 「腾讯混元、阿里巴巴」 **L4 优化与诊断** 1. 【FLUX位置编码】FLUX-Kontext和FLUX-Fill在模型结构上的区别,FLUX-Kontext的位置编码和FLUX-Fill的区别,在时间维度上什么区别,空间维度上有没有区别?FLUX中的RoPE是怎么工作的? 「腾讯混元、阿里巴巴」 2. 【FLUX对比】介绍一下FLUX和SD1.5、SDXL的区别? 「腾讯混元」 3. 【SD3】SD3的架构,生成原理Flow matching。 「阿里巴巴」 4. 【加速方法】讲一下nunchaku/teacache的原理。文生图模型的feature cache。 「字节跳动、百度」 5. 【可控生成】AIGC怎么做可控图生成?ControlNet的原理是什么?如何输入控制信息,控制信息在哪个位置加入?ControlNet的结构原理是怎样的,有没有训练过,训练时用了多少数据多少卡,为什么有零卷积层? 「腾讯混元、蚂蚁集团」 6. 【噪声调度】你觉得FLUX的噪声调度和传统的DDPM有什么区别? 「腾讯混元」 7. 【扩散模型对比】DDPM和Flow Matching的区别是什么?Flow Matching相比DDPM有哪些优势?请解释DDPM、DDIM和flow-matching的原理,并重点说明DDPM与DDIM的区别。 「百度、腾讯混元、蚂蚁集团、阿里巴巴」 8. 【架构对比】mmdit和flux架构区别?介绍FLUX的整体架构、原理、结构(包括双流Block和单流Block),说明其作为生成模型的优势,并解释为什么要先双流再单流。请详细讲解DiT的原理和具体实现,包括其架构(如AdaLN-Zero等),并说明Flux扩散模型的架构。 「百度、腾讯混元、阿里巴巴」 9. 【模型对比】说一下FLUX实现和WANs的实现有什么区别? 「百度」 10. 【生成质量】AIGC生图不符合物理世界的客观规律怎么办? 「阿里巴巴」 ## 其他视觉与多模态 **L1 基础认知** 1. 【CV模型概述】请介绍CV领域的模型,包括但不限于:GUIAgent与游戏风控、端到端自动驾驶等方向。 「百度、腾讯、腾讯混元」 **L2 原理理解** 1. 【VLA与具身智能】对VLA、具身智能的了解 「阿里巴巴」 2. 【京东物流监控应用】在京东物流监控中的应用? 「京东」 3. 【人驾数据训练】是否加入了人驾数据进行训练? 「美团」 4. 【仿真测试】请解释一下自动驾驶中的仿真测试及其重要性。 「京东」 5. 【多模态技术发展趋势】请分享你对多模态技术未来发展趋势的看法。 「蚂蚁集团」 6. 【多模态数据pipeline】网络多模态数据pipeline 「腾讯」 7. 【多模态音频融合】有考虑音频融合吗? 「腾讯」 8. 【智能体轨迹预测与坐标参考】其他智能体的预测轨迹如何得到、坐标相对于? 「百度」 9. 【泊车突变行为数据】泊车过程中可能存在一些突变的行为(例如因为一些障碍物导致泊车中断),训练数据中是否包括这样的数据? 「字节跳动」 10. 【运动学模型与动力学模型选择】规划中常用的是运动学模型还是动力学模型?为什么? 「腾讯」 **L3 实现与应用** 1. 【RSS模型应用】如何将RSS模型应用于换道场景? 「百度」 2. 【SLAM技术及测试】请解释一下自动驾驶中的SLAM技术及其测试挑战。 「京东」 3. 【V2X通信测试】请解释一下自动驾驶中的V2X通信测试方法。 「京东」 4. 【冗余系统测试】请解释一下自动驾驶中的冗余系统测试方法。 「京东」 5. 【决策规划算法测试】请解释一下自动驾驶中的决策规划算法测试方法。 「京东」 6. 【功能安全测试】请解释一下自动驾驶中的功能安全测试标准。 「京东」 7. 【图搜技术及badcase处理】图搜方面的细节,以及这么做的想法和动机。针对badcase怎么处理? 「百度」 8. 【场景生成测试】请解释一下自动驾驶中的场景生成测试方法。 「京东」 9. 【场景覆盖测试】请解释一下自动驾驶中的场景覆盖测试方法。 「京东」 10. 【多传感器标定测试】请解释一下自动驾驶中的多传感器标定测试方法。 「京东」 11. 【多模态数据增强】请分享一个你在多模态数据增强中的实践经验? 「字节跳动」 12. 【多模态数据处理】请描述你使用过的最复杂的多模态数据处理流程。 「蚂蚁集团」 13. 【多模态数据对齐】请分享一个你在多模态数据对齐中的优化案例? 「字节跳动」 14. 【多模态预训练模型】请分享一个你在多模态预训练模型中的实践经验? 「字节跳动」 15. 【多目标跟踪测试】请解释一下自动驾驶中的多目标跟踪测试方法。 「京东」 16. 【多设备影像质量处理】不同设备产生的影像质量可能不一样,你是怎么处理的? 「字节跳动」 17. 【智能体历史信息与参考线mask】智能体的历史信息是否mask住参考线的输入信息:x、y、heading、边界、硬隔离?请解释。 「百度」 18. 【模态选择与规则兜底】如何选出最佳的模态?模型输出的轨迹无法保证一定安全,为什么基于规则的轨迹能够兜底? 「美团」 19. 【深度学习在自动驾驶中的应用】请简述深度学习在自动驾驶中的核心应用场景(如目标检测、语义分割、轨迹预测等),结合具体算法模型(如YOLO、Transformer、PointNet等),谈谈你对模型优化的核心思路。 「京东」 20. 【生成模型评估】怎么评估RQ-VAE生成SID效果的好坏? 「美团」 21. 【用户上传图片质量处理】我们现在业务场景中会遇到用户上传的数据图片质量相差非常大的情况,你有什么思路? 「字节跳动」 22. 【端到端架构对比】现在行业内说的“一段式”和“两段式”(如感知+规划分开训)到底有什么区别?请对比分析。 「字节跳动」 23. 【端到端模仿学习缺陷】现在的端到端大都是模仿学习,它最大的“遗传病”是什么?请详细说明。 「字节跳动」 24. 【背景车辆拟人性建模】如何考虑背景车辆的拟人性?背景车辆应该具有自己的目标,如到达终点? 「百度」 25. 【脑机接口与时序数据处理】脑机接口是如何做的,如何处理时序数据的?请解释。 「蚂蚁集团」 26. 【自动驾驶仿真场景与评价指标】自动驾驶仿真平台:考虑了哪些场景?评价指标包括哪些?请列举并说明。 「美团」 27. 【自动驾驶测试方法】请解释一下自动驾驶中的以下测试方法:定位算法测试、实时性测试、感知算法测试、控制算法测试、故障注入测试、模型在环测试、深度学习模型测试、硬件在环测试、端到端测试、系统级测试、行为预测算法测试、路径规划算法及其测试、软件在环测试、高精度地图测试、传感器融合技术及其在测试中的重要性。 「京东」 28. 【自动驾驶算法兼容性评估】请描述你如何评估一个自动驾驶算法的兼容性? 「京东」 29. 【自动驾驶算法工作流程】请简述你倾向的自动驾驶算法方向(如感知/决策规划等)的核心工作流程,并说明各环节的核心工作及关键注意事项。 「京东」 30. 【自动驾驶算法评估】请描述你如何评估一个自动驾驶算法的可扩展性、可维护性、安全性、实时性能和鲁棒性?分别说明评估方法和关键指标。 「京东」 31. 【规划算法对比】Lattice Planner和EM Planner的核心区别是什么? 「腾讯」 32. 【规控端到端与planning接入】如何理解规控端到端、如何接入planning? 「美团」 33. 【语音级联方案中DM不感知语音】语音级联方案中DM不感知语音会有什么问题? 「字节Seed」 34. 【音视频分割实践】请分享一个你在音视频分割技术中的实践经验? 「字节跳动」 35. 【音视频同步实践】请分享一个你在音视频同步技术中的实践经验? 「字节跳动」 36. 【音视频处理挑战与解决】请分享一个你在音视频处理项目中遇到的挑战,以及你是如何解决的? 「字节跳动」 37. 【音视频目标检测优化】请分享一个你在音视频目标检测中的优化案例? 「字节跳动」 38. 【音视频编解码优化】请分享一个你在音视频编解码中的优化案例? 「字节跳动」 39. 【音视频质量评估优化】请分享一个你在音视频质量评估中的优化案例? 「字节跳动」 **L4 优化与诊断** 1. 【Diffusion模型在轨迹预测中的应用】Diffusion模型最近很火,你觉得它在轨迹预测/规划里到底是有真本事,还是在“大力出奇迹”? 「字节跳动」 2. 【多传感器融合】请说明多传感器融合(摄像头、激光雷达、毫米波雷达)在自动驾驶中的核心作用,结合京东自动驾驶业务场景,谈谈多传感器融合的关键技术点与实现思路? 「京东」 3. 【多模态异常检测】请描述你处理过的最具挑战性的多模态异常检测案例。 「蚂蚁集团」 4. 【多模态数据融合】请分享一个你在多模态数据融合中的创新实践? 「字节跳动」 5. 【多模态预训练梯度稳定】在进行大规模分布式多模态预训练时,经常遇到不同模态(例如高维图像和离散文本)梯度规模差异巨大且收敛速度不一致的问题,导致训练极不稳定甚至完全崩塌。你会引入怎样的损失函数设计或梯度缩放机制来稳定训练过程? 「腾讯」 6. 【理论收敛界】理论收敛界有何不同? 「字节跳动」 7. 【端到端架构对比】对比一下UniAD和VAD(Visual Autonomous Driving)的架构差异。VAD去掉了很多繁琐的显式表示,真的不会导致性能下降吗? 「字节跳动」 8. 【自动驾驶感知算法设计】请说明自动驾驶感知算法的核心任务与常用方法,结合京东仓储物流自动驾驶场景(如动态障碍物识别、货架定位、狭窄通道避障),谈谈你如何设计高效的感知算法? 「京东」 9. 【自动驾驶模型失败案例】跑过那么多仿真/实车,你有没有遇到过那种“人类司机闭着眼都能过,但你的模型就是死也过不去”的Case? 「字节跳动」 10. 【语音翻译中人声与模型声overlap处理】语音翻译场景下,人声和模型声如果出现overlap怎么去调整模型架构解决? 「字节Seed」 **L5 综合与前沿** 1. 【音视频系统设计】请设计一个实时音视频特效系统(核心算法和流程);实时音视频降噪系统(核心算法和流程);实时音视频风格迁移系统(核心模块和数据流);音视频内容审核系统(核心算法和流程);音视频内容检索系统(核心模块和数据流);音视频内容生成与编辑系统(核心算法和流程);音视频内容生成系统(核心模块和数据流)。 「字节跳动」 # 推荐搜索与广告 ## 召回 **L0 上下文不足(难度待定)** 1. 【上下文不足】业务具体功能提问,业务样本量是否稀疏?独立模型是精排还是召回? 「腾讯」 **L1 基础认知** 1. 【候选集规模】召回后的候选物品数量 「百度」 2. 【协同过滤】请解释协同过滤的基本原理,并介绍其概念。 「腾讯」 3. 【召回方式与逻辑】召回方式是什么?召回逻辑是什么?如何召回? 「京东、阿里巴巴」 4. 【召回触发方式】用户输入进去就直接召回吗? 「腾讯」 **L2 原理理解** 1. 【ANN索引】使用了哪种ANN索引结构? 「美团」 2. 【FastText过滤】用fasttext过滤出的内容取得都只是头部的内容吧? 「字节跳动」 3. 【K估计】K1 K2 K3估计区别? 「蚂蚁集团」 4. 【PSM】介绍PSM。 「拼多多」 5. 【协同过滤】请说明协同过滤的基本原理、主要方法(如基于用户和基于物品的协同过滤),并阐述基于用户和基于物品的协同过滤的区别。 「字节Seed、百度、腾讯」 6. 【双塔模型】介绍双塔模型及其整体流程。双塔顶层算点击概率是怎么算的? 「字节Seed、百度、蚂蚁集团」 7. 【召回Embedding训练】召回了解吗,召回的embedding怎么训练的? 「美团」 8. 【召回与排序阶段】召回和粗排/排序的区别是什么?推荐系统的召回和排序两个阶段分别做什么?它在召回和排序阶段分别能带来什么收益? 「字节跳动、百度、美团、阿里巴巴」 9. 【召回方法】介绍业务背景、整个链路、召回方法(包括召回模型的架构及优化),以及视频如何透出? 「字节跳动、美团、阿里巴巴」 10. 【召回方法对比】内容推荐和协同过滤各有什么优缺点? 「腾讯」 11. 【召回模型架构】是 Encoder 还是双塔? 「美团」 12. 【召回流程与负样本】1. 负样本是随机采样还是HardNegative?请结合项目说明。2. 讲一下项目里召回的流程,包括负样本选择策略。 「字节跳动、美团」 13. 【召回结果选择】召回结果怎么选择? 「阿里巴巴」 14. 【向量检索】向量检索和召回怎么做的? 「京东」 15. 【常用召回模型】推荐系统中常用的召回模型有哪些?请简述其逻辑结构或实现方式。 「字节Seed、字节跳动、百度」 16. 【推荐系统链路】了解推荐算法吗?请介绍推荐系统的整体链路(包括召回、粗排、精排、混排、重排),常见的召回算法(如DIN、SIN),样本如何区分,以及在数据量很少的情况下是否可以不进行召回? 「百度、美团、腾讯」 17. 【标签召回】标签召回的标签数据有多大呢 「百度」 18. 【相似度度量】Dense检索中常见的相似度度量方式有哪些?ES向量召回中常用的相似度检索方式是什么?为什么很多系统选择Cosine或Inner Product? 「美团、阿里巴巴」 19. 【精排后召回】精排后召回的结果是什么? 「字节跳动」 20. 【负采样策略】有没有用HNM(Hard Negative Mining)? 「腾讯混元」 **L3 实现与应用** 1. 【ANN索引】IVF了解吗? 「阿里巴巴」 2. 【BPR损失】BPRloss的问题 「阿里巴巴」 3. 【Cross-Encoder召回】在大规模在线系统中为什么Cross-Encoder不适合作为第一阶段召回? 「美团」 4. 【FM模型】介绍FM的实现方式、目标函数和时间复杂度。 「字节跳动、百度」 5. 【i2i与u2i召回】i2i和u2i各自的缺点是什么?如何将两者进行融合?i2i是强个性化还是弱个性化?为什么还在做基础的i2i,现在明明有很多改进的模型,没有去尝试吗? 「腾讯、阿里巴巴」 6. 【i2i召回】ranki2i的做法,为什么要增加这一路? 「阿里巴巴」 7. 【Query处理与改写】query不规范,导致召回难度大,如何解决?query召回如何更加贴近answer?Query改写之后改写成什么形式去召回? 「百度、阿里巴巴」 8. 【SID作用】引入sid就有用嘛? 「腾讯」 9. 【Word2Vec召回】skipgram为什么适合于推荐系统?w2v训练的都是用户点击过的物品,那么如果用户点击一些新的文章,这个召回应该怎么处理?Word2Vec召回具体是怎么实现的?训练里的中心词具体指什么,原始输入数据是什么,如何评估Word2Vec训练出的向量好坏? 「字节Seed、字节跳动、百度」 10. 【个性化召回】实习中个性化召回的的想法,向量召回一定需要吗? 「百度」 11. 【分层召回】分层召回的结构是什么,低活/沉默用户会不会走双塔? 「腾讯」 12. 【协同过滤】ItemCF中物品共现的样本对是如何构造的?共现次数具体如何计算?这样构造有什么问题?除了统计共现次数,还有其他手段衡量ItemCF的物品相似度吗?物品间相似度怎么计算?除了共现次数加衰减系数的方式,有没有其他方法衡量物品相关性?ItemCF怎么做,相比简单的版本,做了哪些改进? 「字节跳动、百度」 13. 【双塔模型】双塔模型相关:1. 讲一下DAT双塔?2. YouTubeDNN和DSSM的区别是什么?3. 双塔召回优缺点,为什么 serving 不放交叉特征?4. 介绍一下双塔的特征工程连续型特征的处理方式,在你的项目里分桶在。 「拼多多、腾讯」 14. 【召回优化】你做过哪些改进来提升Recall?请具体说明优化召回链路和召回率的思路。 「美团、蚂蚁集团、阿里巴巴」 15. 【召回失败处理】召回不到数据怎么处理? 「美团」 16. 【召回方式】除了向量召回和关键词召回,还有哪些召回方式,了不了解全文召回,如何做的? 「百度」 17. 【召回方法对比】ItemCF和Word2Vec用的是相同的共现信息,为什么还要单独做Word2Vec这路召回? 「百度」 18. 【召回要素重要性】召回的模型、目标、样本哪个更重要?介绍粗精排。 「字节跳动」 19. 【召回评估】1. 怎么评估召回效果? 2. 为什么recall不能和新的一天的交互数据来算交集,会有什么不妥? 「腾讯、阿里巴巴」 20. 【召回链路设计】怎么设计的召回链路 「美团」 21. 【向量检索】你的FAISS是怎么实现的? 「字节跳动」 22. 【多兴趣召回】讲一下MIND的具体实现 「阿里巴巴」 23. 【多样性排序】你的项目里说进行了样本多样性排序,能不能介绍一下你使用的多样性算法? 「字节跳动」 24. 【多路召回】多路召回合并的问题:每路召回占比怎么确定?项目里的三路召回具体是怎么做的?新闻推荐项目介绍:滑动窗口扩充负样本是怎么做的,DIN如何处理用户历史行为序列,为什么考虑多路召回,不同召回方法比例? 「字节跳动、百度、腾讯」 25. 【大规模检索算法】你现在还知道哪些用于大规模检索的场景常见算法? 「字节跳动」 26. 【搜索数据选品】怎么样结合用户搜索数据进行选品? 「京东」 27. 【更新策略】全量更新和增量更新的策略设计。 「阿里巴巴」 28. 【样本使用方式】流式样本和离线样本分别如何使用? 「字节跳动」 29. 【样本训练策略】所有场景样本是一起训练还是分开训练? 「字节跳动」 30. 【检索优化】检索环节做了哪些优化? 「百度」 31. 【榜单构建】榜单构建最重要的是什么? 「腾讯」 32. 【热点召回】热点Post如何处理?热点召回怎么限定时间窗口,如何限定一个合适的时间范围,通过什么来判定? 「字节跳动」 33. 【语义召回】语义召回怎么做的呢? 「百度」 34. 【负样本优化】负样本相关:正负样本怎么产生的,负采样规则怎么设计?未曝光出去的样本作为负样本有做过实验吗,加进来你觉得如果有效的话有效在哪里?负样本优化的思路?负样本选取策略?采样不到正确样本怎么办? 「字节跳动、百度、腾讯、阿里巴巴」 35. 【负样本使用】不可以作为召回阶段负样本?排序可以使用吗? 「蚂蚁集团」 36. 【负样本采样】双塔的负样本采样策略,为什么没用batch内? 「腾讯」 37. 【负采样与纠偏】batch内怎么纠偏,说出多种方法,热度打压的公式,难负样本是怎么更新的?batch 内负样本增强怎么做?batch内负采样和全采样的区别?in-batch 内负采样作用? 「腾讯、阿里巴巴」 38. 【负采样策略】召回阶段采样的方法有哪些?每个目标是否都做了in-batch负采样?每条样本会采样成一个group,采样的策略是什么? 「京东、阿里巴巴」 **L4 优化与诊断** 1. 【i2i与u2i召回】怎么做好 u2i 和 i2i 的联合建模? 「阿里巴巴」 2. 【i2i召回】怎么在 i2i 加入个性化建模? 「阿里巴巴」 3. 【RAG在推荐中的应用】为什么在推荐系统中引入RAG(检索增强生成)?主要是为了解决哪些问题? 「腾讯、腾讯混元」 4. 【RQ-VAE】为什么要在推荐系统引入RQ-VAE? 「字节Seed」 5. 【SIM模型】SIM模型的实现逻辑是什么?如何改造?线上部署时耗时如何评估? 「蚂蚁集团、阿里巴巴」 6. 【专家死亡检测】如果某个视觉专家"死亡”(长期不被选中),怎么检测和恢复? 「百度」 7. 【双塔模型】双塔模型的主要问题是什么?在数据空间非常大的情况下如何优化?请列举双塔召回的改进方法。召回双塔与粗排双塔在数据、loss、模型维度上的区别是什么? 「字节Seed、百度、美团」 8. 【召回去偏】如何去偏:位置偏差(PAL)/ 曝光偏差(IPS)/ 流行度偏差(causal embedding) 「拼多多」 9. 【召回工程实现】召回的时候怎么进行kv查找,线上hive表如何维护的,有什么性能问题,数据多久更新调度一次? 「字节跳动」 10. 【召回评估】召回评估 HitRate / NDCG / Recall@K:为什么不能直接套排序 AUC,怎么和线上对齐 「字节跳动」 11. 【图召回】召回知道什么;知道图模型吗,图召回?后续优化往哪些方向,了解图模型吗? 「百度、腾讯」 12. 【垂类视频召回】垂类视频的消费全链路是怎么做的?介绍召回,场景细节提问。 「字节跳动」 13. 【多兴趣召回】多兴趣召回 MIND / ComiRec:胶囊网络 vs 多头自注意力,兴趣数 K 怎么定? 「字节跳动」 14. 【多路召回】向量召回、关键词召回、实体召回等不同召回链路(包括Sparse和Dense)的结果如何合并?各链路的优先级如何确定? 「百度、美团」 15. 【序列模型对比】生成式推荐 HSTU(Meta 那篇):和 SASRec 的核心差异 「字节跳动」 16. 【损失函数对比】说一下NCELoss和Samplesoftmaxloss的区别,Samplesoftmaxloss的消偏是怎么做的? 「阿里巴巴」 17. 【样本粒度】你认为曝光粒度、request粒度、ug分离粒度的优劣是什么,训练/推理角度? 「阿里巴巴」 18. 【模型架构选择】召回为什么选decoder-only,考虑过encoder-only吗? 「阿里巴巴」 19. 【注意力机制共现】注意力机制怎么能关注一些共现信息(比如纸尿裤与啤酒这样的组合)而不是只是相似信息? 「字节跳动」 20. 【生成式召回】生成式召回(如OneRec)相关:1. 介绍生成式推荐(OneRec等),包括OneRec v2;为什么用beam search?语义id码本大小如何确定?如何评价语义id的好坏?2. 生成式召回做序列建模与精排用户序列建模的区别;生成式召回与生成式精排的区别。3. 生成式召回如何评估?4. 生成式推荐中还有哪些生成语义id的做法?5. 生成式推荐线上成本高,除了模型蒸馏,还有哪些分层降级策略?6. 生成式检索和双塔召回建模目标有什么区别? 「字节跳动、美团、腾讯」 21. 【索引优化】召回索引表优化相关方案 「百度」 22. 【网点布局优化】网点布局/路径优化的方案,核心考虑了哪些维度的因素? 「京东」 23. 【负采样与纠偏】数学题,负采样校准,怎么在训练中就校准预估值(改loss)?以及负样本采样 & in-batch negative + logQ correction。 「拼多多、美团」 24. 【路由与负载均衡】Router的负载均衡loss怎么加?route怎么拿到的? 「百度」 25. 【长序列建模哈希检索】长序列建模 ETA / SDIM / TWIN: 哈希检索 + target attention 的工程实现 「字节跳动」 26. 【难负样本与动量蒸馏】hard negatives和动量蒸馏的细节是什么? 「字节跳动」 **L5 综合与前沿** 1. 【多模态特征融合冷启动】针对微信视频号的信息流推荐,如果希望引入多模态大模型来提取短视频的高阶语义特征以大幅提升冷启动效果,你会如何设计这个特征提取与特征融合的完整链路方案? 「腾讯」 2. 【生成式召回】生成式召回与精排的统一设计:1. 如何将召回和粗排结合做生成式探索?2. 生成式召回与精排的scaling谁空间更大?为什么?3. 生成式推荐的幻觉问题解决方案?4. 精排多为判别式,召回可为生成式,如何统一设计? 「美团、阿里巴巴」 3. 【电商召回设计】场景题:设计一个电商系统的商品召回功能 「字节Seed」 ## 排序与重排 **L1 基础认知** 1. 【排序与重排】1. 现有的精排主模型有多少特征? 2. 策略和规则还存在吗? 「京东、美团」 **L2 原理理解** 1. 【上下文不足】Ihuc具体是放在哪一层的? 「腾讯」 2. 【排序作用】排序在这里起什么作用? 「美团」 3. 【排序损失函数】讲一下,pointwise和pair-wise。 「百度」 4. 【排序模型数据】排序模型用的哪些数据? 「字节跳动」 5. 【模型预估结果应用】模型预估结果是怎么使用的? 「阿里巴巴」 6. 【精排v分定义】业务的精排v分是如何定义的? 「字节跳动」 7. 【精排业务特征】精排:引入文档新鲜度、权威性、用户偏好等业务特征 「百度」 8. 【融分公式】线上排序的融分公式? 「阿里巴巴」 9. 【输出粒度】调优之后输出每一行的粒度是什么? 「百度」 10. 【重排序作用】有做rerank吗? 「美团」 **L3 实现与应用** 1. 【LLM与精排关系】有了LLM判别,为什么还要精排?请分析LLM与精排的关系。 「美团」 2. 【上下文不足】OT转换怎么做?请解释其原理和实现步骤。 「腾讯」 3. 【多目标建模与融合】多目标建模怎么做?有哪些多目标模型(如ESSM)?损失函数如何融合(有哪些方式,各自的优缺点)?实习中精排融合公式具体有哪些目标?是否使用动态加权?需要注意什么地方? 「京东、字节Seed、字节跳动、美团、阿里巴巴」 4. 【多目标排序架构】多目标排序的具体实现:share-nothing、share-bottom、MMOE、PLE?请介绍每种架构的原理和适用场景。 「腾讯」 5. 【多路结果排序】召回的多个网页搜索结果,是如何进行排序和筛选的?在对多路样本进行排序时,用到了哪些指标? 「字节跳动」 6. 【工业精排LGBM】在排序模型中,LightGBM和DIN分别起到什么作用?工业场景精排为什么常用LGBM?相比XGBoost或深度模型,LGBM在效果和效率上有什么优势? 「京东、百度、蚂蚁集团」 7. 【排序与重排】1. 精排的Scaling,主要是在Scaling什么?2. 重排序(Rerank)的作用是什么?为什么向量召回后必须做重排?如果没有Reranker,线上效果会下降在哪些指标? 「美团、阿里巴巴、阿里通义」 8. 【排序损失函数】请介绍Learning to Rank中的pointwise、pairwise和listwise三种训练方式,并比较它们的优缺点。具体说明:为什么在某些推荐场景下pointwise效果比pairwise好?pairwise margin是否更好?以及listwise loss的特点。 「京东、百度、百度文心、腾讯」 9. 【校准】Calibration的作用与必要性;常用算法(如保序回归、Platt缩放、温度缩放等);数据选择策略;提高PCOC的方法。 「百度、阿里巴巴」 10. 【策略与规则】有什么兜底和后处理逻辑?请介绍常见的策略与规则。 「字节跳动」 11. 【粗排优化】粗排阶段使用Cross-Encoder对top-100重打分(比Bi-Encoder准但慢),除此之外粗排之后还有哪些优化点? 「字节跳动、百度」 12. 【精排模型优化方向】如果给你一个精排模型,一开始只是一个简单的MLP,你该从哪些方面去考虑提升模型的效果? 「百度」 13. 【精排模型结构】介绍目前精排模型的主要结构(如DIN、DIEN、DeepFM等)。为什么需要用lite模型作为精排结果的补充?是因为精排打的不准吗?和精排模型有什么区别?在理想情况下,如果不考虑资源问题以及精排的多样性学习,所有item进精排就是最好的结果吗?样本的存储格式是怎么样的?还了解业界的其他精排模型? 「字节Seed、美团、腾讯、蚂蚁集团」 14. 【重排序作用】MMR是什么?在重排序中如何用MMR做多样性过滤?请对比DPP和MMR算法的工作原理。 「京东、字节跳动、百度」 **L4 优化与诊断** 1. 【多任务梯度冲突】多任务建模中梯度冲突(如ESMM中的跷跷板问题)如何解决?除了PCGrad还有什么方法? 「美团、腾讯、阿里巴巴」 2. 【多目标建模与融合】协同控制:目标函数的设定;如何求解优化问题?公平性如何衡量?智能补贴为什么用 uplift 而不是 CTR?精排稀疏目标和稠密目标之间怎么做平衡? 「字节跳动、拼多多、美团」 3. 【多目标排序架构】如果点击率和转化率有相关性,PLE怎么优化? 「腾讯」 4. 【层次化多标签分类】场景题:京东电商场景下,如何设计层次化的多标签分类,需要考虑到标签和标签之间存在耦合性/层级包含关系等 「京东」 5. 【序列特征建模排查】加强对序列特征的建模,但是发现效果没有提升,该怎么排查? 「阿里巴巴」 6. 【无CTR信号排序】AI搜索没有点击/CTR信号,排序该怎么做? 「蚂蚁集团」 7. 【校准】多个媒体的偏差较大,如何进行快速修复,不限于模型、calibration等方式? 「阿里通义」 8. 【生成式精排监督信号】怎么让OneRec有排序能力,RL奏效吗,可以替代精排吗?精排虽然用的是生成式,但是他和NTP的训练不一样,监督信号只有target token,会导致监督不充分,怎么解决这个问题? 「阿里巴巴」 9. 【生成式重排】如何利用大模型来做生成式重排? 「腾讯」 10. 【知识蒸馏】了解Online Distillation(OPD,On-Policy蒸馏)吗?请说明其loss函数、框架设置、训练数据设置,以及为什么训练速度很快?知识蒸馏在精排中,teacher-student的离在线一致性,logits蒸馏与feature蒸馏的区别是什么? 「字节跳动、腾讯」 11. 【竞价融入链路】竞价如何融入到前面链路中,介绍PDM模型,还有别的方法吗? 「腾讯」 12. 【精排Scaling】给你一个Transformer based的精排架构,有哪些可能的堆叠参数思路让他实现scaling? 「百度」 13. 【精排模型结构】HSTU能不能替换精排模型? 介绍一下RankMixer的结构原理。 「字节跳动、阿里巴巴」 14. 【重排序作用】如果线上只有弱标签甚至没有人工标注,Reranker 如何进行微调或持续优化? 「美团」 15. 【长序列建模简化】长序列建模,怎么简化长序列建模的线上复杂度? 「美团」 16. 【预估与调度结合】怎么把预估模型和调度系统结合? 「美团」 ## CTR与CVR预估 **L3 实现与应用** **CTR与CVR预估** 1. CTR和CVR关联性很强,gate是否可以只有一个? 「美团」 2. CTR模型用的特征。 「字节跳动」 3. CTR预估属于机器学习里的什么任务? 「京东」 4. CVR和CTR有什么区别,label依赖怎么办,SSB怎么解决,稀疏怎么解决,ESMM怎么解决这个问题的? 「腾讯」 5. ESMM如何解决CVR的SSB? 「拼多多」 6. 为什么RQ-VAE优化CTR预估模型提升不那么显著? 「字节跳动」 7. 为什么不单独预测CVR,CTR的引入为CVR带来了什么信息? 「腾讯」 8. 为什么选择CTR和CVR建模呢? 「百度」 9. 了解延迟反馈吗? 「阿里巴巴」 10. 介绍项目中CTR&CVR相关的信息,包括当前CTR模型、CVR模型的结构。 「字节跳动、阿里通义」 11. 在离线效果不一致是为什么,为什么稀疏目标学的不好? 「字节跳动」 12. 多任务建模为什么选择CTR和CVR而不是CTR和CPM? 「阿里巴巴」 13. 如何通过模型提升商品点击率、物流处理效率? 「京东」 14. 如果让你优化一个推荐系统的CTR模型,你会从哪些方面入手? 「阿里巴巴」 15. 点击率预估问题中,如何使用频次过滤缓解特征稀疏问题? 「阿里巴巴」 16. 现在给你一个任务预测CTR,经常会出现正负样本不平衡的问题,如果是你做的话,你怎么选取正负样本?具体说曝光但是未点击的能不能算做负样本?为什么? 「蚂蚁集团」 17. 短视频CTR预测任务中,你觉得有哪些特征比较重要? 「字节跳动」 18. 随机采样负样本对AUC有什么影响? 「字节Seed」 ## 推荐模型 **L0 上下文不足(难度待定)** **上下文不足** 1. 对推荐系统感兴趣吗? 「腾讯」 2. 对百度的推荐系统有了解吗? 「百度」 **L1 基础认知** 1. 【推荐算法基础】你在机器学习课程中接触过哪些推荐算法?你用什么数据集实现过简单推荐系统?深度推荐模型你了解哪些?问对做推荐算法感不感兴趣。 「百度、腾讯」 **L2 原理理解** 1. 【AdaTT模型】什么是AdaTT? 「百度」 2. 【DCN模型】介绍DCN,为什么会用到DNN? 「百度」 3. 【DIN模型】介绍DIN,并说明能否按照时间截断序列?关于DIN的q/k/v分别是什么? 「字节Seed、美团、阿里巴巴」 4. 【FM复杂度】FM模型的计算复杂度是多少? 「美团」 5. 【Group Embedding】介绍group embedding 「腾讯」 6. 【MMoE模型】了解MMoE模型吗? 「京东」 7. 【哈希表应用】数据结构中的哈希表在推荐系统中有什么应用?请举例说明。 「腾讯」 8. 【商品推荐与内容推荐区别】商品推荐和内容推荐有什么不一样的? 「美团」 9. 【多任务学习】除了MMOE还用过其他的多任务学习方案吗? 「百度」 10. 【多场景与多任务区别】多场景和多任务的区别、常见的多任务建模方式;多场景建模具体指什么? 「字节跳动、阿里通义」 11. 【序列建模与多目标优化模型】了解哪些序列建模/多目标优化模型?序列建模了解哪些? 「拼多多、腾讯」 12. 【序列注意力类型】目前模型里的序列主要包括什么,self attention 还是 target attention? 「美团」 13. 【推荐模型】除了DIN和SIM还了解其他的推荐模型吗? 「拼多多」 14. 【推荐模型做法】介绍推荐模型相关的做法。 「腾讯」 15. 【推荐链路】是否了解推荐整体链路? 「百度」 16. 【注意力机制混淆】把"候选广告和历史行为的Attention"说成"Transformer的自注意力" (我也不知道自己怎么混淆的)? 「百度」 17. 【深度学习搜广推算法】了解深度学习中常用的搜广推算法吗? 「腾讯」 18. 【深转模型】了解深转模型么? 「阿里巴巴」 19. 【特征交叉】除了SENet、DCN和你使用的特征交叉方法,你还了解哪些特征选择/特征交叉的方法? 「京东、美团」 20. 【特征交叉方法】如何做的特征交叉?特征为什么能交叉? 「美团」 21. 【超长序列长度】超长序列建模的长度是多少? 「字节跳动」 **L3 实现与应用** 1. 【BIN网络】讲一讲推荐系统中BIN网络。 「百度」 2. 【DCN-v2】DCN-v2的原理是什么? 「京东」 3. 【DeepFM与AutoInt】DeepFM结构,FM优势,AutoInt结构进一步追问query具体是什么,有没有序列特征? 「腾讯」 4. 【DIN序列融合】把序列先concat过DIN,和先过DIN再进行融合,有啥区别/效果哪个更好? 「美团」 5. 【DIN模型】介绍DIN模型,包括其原理、如何做特征交叉、target attention机制、用户行为序列处理方式(是否行为间直接计算),并手写实现或简述思路。同时对比DIEN,并说明是否复现过DIN、PPNet、MMoE等推荐模型。 「京东、百度、美团、蚂蚁集团、阿里巴巴」 6. 【DIN注意力聚合】精排的din模块中,target item和query对行为序列得出的embedding,加权相加或者逐元素相乘有什么不一样? 「字节跳动」 7. 【DTRN模型】介绍一下DTRN的几个模块。 「京东」 8. 【ESMM与ESMM2】介绍一下多目标建模essm的问题essm2的改进能不能用除法。 「阿里巴巴」 9. 【FM与LR对比】为什么你的场景考虑FM不考虑LR? 「字节跳动」 10. 【FM模型】请介绍常见的特征交叉网络结构(如FM网络),并手撕实现FM。 「字节跳动、阿里通义」 11. 【HSTU工程实现】HSTU序列长度,GPU型号 「美团」 12. 【HSTU建模成本】关于hstu建模的成本 「美团」 13. 【Hyformer与MTGR】你提到Hyformer,了解MTGR这类模型吗? 「阿里巴巴」 14. 【MMoE与ESMM对比】说一下mmoe和esmm? 「美团」 15. 【MMoE实现】手撕代码:实现MMOE 「阿里巴巴」 16. 【MMoE模型】请解释MMoE模型的理解,并手撕MMoE代码(一开始说可能不会,不过基本写出来了)。 「百度」 17. 【PLE与跷跷板问题】知道PLE嘛,PLE是通过什么解决跷跷板问题的? 「腾讯」 18. 【RAG应用】项目:为什么在推荐系统中引入RAG? 「腾讯」 19. 【SDIM结构】你讲讲SDIM的结构呢 「美团」 20. 【Transformer2Rec】Transformer2rec的模型有了解过吗? 「腾讯」 21. 【Wide&Deep模型】介绍Wide&Deep模型的设计原理,包括其结构、为什么使用这种组合,以及它相对于线性回归/逻辑回归的改进。同时,对比Wide&Deep、DeepFM、DCN、DIN各自解决的核心问题。 「字节跳动、拼多多、百度、蚂蚁集团」 22. 【XGBoost场景与项目对比】讲讲xgboost现在的使用业务场景?你的实习和实验室项目在构建算法的时候有什么区别吗,在特征选取、调参、模型选型、loss函数方面分别说说?阿里国际搜推? 「阿里巴巴」 23. 【两阶段模型特征不匹配】你提到的两阶段模型,特征不匹配的问题是怎么处理的? 「京东」 24. 【主模型效果分析】主模型效果好,好在哪里,有分析过嘛? 「腾讯」 25. 【主模型问题分析】主模型建模有什么问题? 「腾讯」 26. 【京东零售推荐潜力】在京东零售商品推荐中的应用潜力? 「京东」 27. 【参数共享策略】独立使用还是全局共享? 「字节跳动」 28. 【场景区分】特征或网络层面有没有做场景区分? 「字节跳动」 29. 【场景建模策略】这些场景是分开建模还是统一建模? 「字节跳动」 30. 【多任务局部最优】多任务建模陷入局部最优的解决办法。 「阿里巴巴」 31. 【多任务建模动机】为什么要进行多目标联合建模(多任务建模),解决了什么问题? 「百度、腾讯」 32. 【多任务建模纠偏】介绍一下多任务建模的纠偏方法。 「阿里巴巴」 33. 【多任务模型对比】介绍CGC、PLE和MMoE的区别?CGC或者PLE有尝试过吗?介绍MMoE,跷跷板现象怎么解决,PLE为什么要划分共享专家和任务特定专家?介绍PLE,做多目标的动机。 「百度、美团」 34. 【多任务模型迁移】推荐里的多任务模型可以迁移到上面吗? 「阿里巴巴」 35. 【多任务负迁移与跷跷板问题】多任务学习中的负迁移/跷跷板问题怎么解决? 「腾讯」 36. 【多场景主场景优化】多场景里面,怎么让模型更关注主场景的优化? 「字节跳动」 37. 【多目标建模方法】多目标怎么建模的?了解的多目标结构;介绍一下多目标的项目。 「京东、字节跳动、阿里巴巴」 38. 【多目标特征融合问题】把所有的目标和特征放到主模型里,有什么问题嘛? 「字节跳动」 39. 【大模型推荐应用】大模型在推荐相关应用有没有了解? 「美团」 40. 【大模型结构及特征输入】你用的大模型结构?特征如何喂给大模型? 「字节跳动」 41. 【序列建模softmax】推荐里序列建模会去掉 softmax 是为什么? 「阿里巴巴」 42. 【序列融合】不同时间段的序列输出如何融合? 「字节跳动」 43. 【推荐效果影响因素】请以视频网站为例,分析你认为影响推荐效果的因素有哪些。 「腾讯」 44. 【推荐模型】DIN处理的是什么类型的数据? 「京东」 45. 【新闻推荐项目】介绍新闻推荐的项目 「美团」 46. 【模型结构对比】独立模型当前的结构是什么样子的?主模型的模型结构? 「字节跳动」 47. 【模型选型与参数量】这边在线、近线和离线的模型选型和参数量? 「腾讯」 48. 【特征一致性】如果特征落盘时刻上下文发生变化,是否会造成线上线下不一致? 「字节跳动」 49. 【特征拼接方式】特征是直接拼接embedding,还是有独立的场景block? 「字节跳动」 50. 【生成式推荐多样性优势】如果为了推荐的多样性,生成式有什么优势? 「腾讯」 51. 【生成式推荐论文】你了解哪些生成式推荐的论文? 「字节Seed」 52. 【自动特征交叉】模型里是怎么实现自动特征交叉的? 「腾讯」 53. 【长序列建模动机与方法】在长序列建模这一块为什么要把序列拉长?原来序列建模怎么做? 「美团」 **L4 优化与诊断** 1. 【BiasNet】BiasNet的结构是什么?在哪里停止梯度?最后是否过了激活函数?如果不过会不会引起专家塔输出的分布混乱? 「腾讯」 2. 【DIN与SIM对比】DIN和SIM之间的演进关系是什么?SIM对比DIN的改善是什么? 「百度、美团」 3. 【DIN与树模型对比】为什么DIN模型在这个项目里效果不如树模型? 「百度」 4. 【DIN改进】对DIN有啥可以改进的地方? 「拼多多」 5. 【DIN时间衰减】实现一个time_decay的DIN 「阿里巴巴」 6. 【GMV建模】GMV是如何建模的,怎么做的优化? 「美团」 7. 【GNN应用】GNN在公司的实现? 「阿里巴巴」 8. 【GNN用户分类】场景题:根据用户历史行为序列如何将GNN应用于推荐系统里的用户分类? 「百度」 9. 【HSTU CTR预估】HSTU里面做CTR预估的方案,输出是什么? 「美团」 10. 【HSTU与OneRec对比】HSTU和OneRec的区别? 「美团」 11. 【HSTU与Transformer对比】你们模型是hstu结构,想问一下他和Transformer的差异是哪些,然后哪种效果更好? 「阿里巴巴」 12. 【HSTU复杂度】HSTU把FFN砍成门控U(X)降低了多少的时间复杂度? 「阿里巴巴」 13. 【HSTU损失优化】HSTU的loss怎么优化美团(到店/推荐)? 「美团」 14. 【HSTU长序列】HSTU怎么构建长序列? 「美团」 15. 【LLM4Rec】LLM4Rec: 把item转成token的几种方法;LLM4Rec有哪些微调直接做推荐任务编码器数据增强? 「字节跳动、腾讯」 16. 【LLM在搜广推的应用】现在搜广推都在结合LLM,请谈谈你的看法。 「美团」 17. 【LoRA与全参数微调对比】LoRA 和全参数微调相比,在推荐场景下各自的优缺点是什么? 它们各自更适合什么样的场景? 「腾讯、腾讯混元」 18. 【LoRA微调】如果要用LoRA做电商推荐场景的微调,你会怎么设计数据和标签? 「京东」 19. 【MMCN模型】MMCN的scaling效果怎么样?MMCN网络和MLP的区别是什么,有什么优势?有对比其他交叉网络嘛? 「腾讯」 20. 【MMCN网络】介绍MMCN网络,包括其细挖部分,并解释为什么MMCN不重复对其他头做交叉?另外,介绍scaling的工作。 「字节跳动、腾讯」 21. 【MMoE模型】MMoE vs PLE,什么时候 negative transfer?MMoE专家网络什么独立什么共享?MMoE和ESMM底层是软共享还是硬共享?MMoE:基本逻辑,怎么处理多个目标不平衡的现象,怎么确定专家数量,极化现象怎么解决?MMoE怎么解决梯度冲突的问题?MMoE的改进? 「京东、拼多多、美团、阿里巴巴」 22. 【OneRec与HSTU对比】快手OneRec和HSTU区别在哪?样本组织形式和OneRec和HSTU有什么区别?讲一下OneRec?你们OneRec范式是不是只是讲故事? 「字节跳动、拼多多、美团」 23. 【OneTrans模型】OneTrans把序列和非序列特征放在一起组织,不同行为特征是怎么组织的?OneTrans的金字塔结构具体怎么做? 「腾讯」 24. 【POSO算法】POSO是如何做的?介绍一下POSO算法 「腾讯、阿里巴巴」 25. 【PO模型】PO的原理和演进过程,更要深入分析为什么在业务场景work。 「腾讯」 26. 【PPNet/POSO/STAR对比】说一下PPNet、POSO和STAR的区别与关系。 「阿里巴巴」 27. 【RQ-VAE】RQ-VAE和VQ-VAE之间的区别是什么?RQ-VAE在推荐系统中要解决什么问题?请从离散化的角度说明。 「字节跳动、美团」 28. 【STAR负迁移】star的负迁移有了解过么? 「阿里巴巴」 29. 【TokenMixer与MMCN对比】tokenmixer和MMCN的区别是什么,为什么没有推tokenmixer? 「腾讯」 30. 【Token机制特征交叉】为什么token机制能实现特征的自动深度交叉? 「字节跳动」 31. 【TRM与FiBiNet及特征交叉】你提到的TRM其实是一种软门控机制对吧,有没有看过FiBiNet,动态重要性怎么算,聊了一会两个不同的特征向量,如果我要捕捉细粒度的特征交叉信息,你觉得内积和外积,元素积谁更合适? 「京东」 32. 【Uplift模型】uplift模型如何进一步迭代的? 「字节跳动」 33. 【主模型特征】为什么主模型不能加入相关特征?在主模型上加目标、加特征会怎么样?业务视频的后验均值label有特殊的吗? 「字节跳动、腾讯」 34. 【多任务模型对比】对比MMOE、PLE和AdaTT的改进在哪,为什么要这么做? 「百度」 35. 【多任务跷跷板问题】联合训练的话怎么处理跷跷板问题呢? 「阿里巴巴」 36. 【序列条件概率推荐】代码:给定用户历史行为序列,根据历史行为序列算出元组对的条件概率,并根据条件概率进行用户推荐。 「腾讯」 37. 【强化学习推荐】请解释一下强化学习在音视频推荐系统中的应用? 「字节跳动」 38. 【推荐系统链路】为什么推荐系统要设计成这个链路? 「美团」 39. 【新闻推荐算法设计】关于新闻推荐,你提到了使用点击量最高的新闻作为推荐依据,能否具体说明你会如何设计推荐算法来动态调整推荐内容? 「美团」 40. 【特征增量训练】怎么在老汤模型里面加入一个新特征,快速追上老汤模型效果? 「字节跳动」 41. 【特征重要性学习】如果通过特征加gate的方式学习特征重要性,你会怎么设计? 「腾讯」 42. 【独立模型意义与效果分析】独立模型和主模型的目标重合,有什么意义嘛?独立模型实际打过主模型了嘛,为什么没有打过? 「字节跳动」 43. 【生成式推荐】tiger和hstu走什么路线实现生成式推荐?你觉得生成式推荐是讲故事还是有实践价值? 「美团」 44. 【生成式推荐与HSTU】是否了解生成式推荐,阅读过哪些论文,5分钟简单讲解Meta HSTU论文? 「百度」 45. 【电商推荐流程】介绍一个电商系统完整的推荐流程,例如来了一个用户请求,然后是什么? 「字节Seed」 46. 【跨场景特征迁移】短视频到直播内怎么做特征的一个迁移,怎么联系外流短视频和直播内流的目标及特征? 「字节跳动」 47. 【集成学习】为什么选择两个Lightgbm和Din一起做集成? 「京东」 48. 【项目框架迁移到生成式推荐】如何把你的这个项目框架迁移到生成式推荐的上游中? 「美团」 49. 【领域SOTA与推荐结合】在这个领域下,现有的SOTA是怎么做的?如何将你的领域的研究和推荐结合起来? 「京东」 **L5 综合与前沿** 1. 【Transformer+MMoE推荐系统】给定Transformer和MMoE,如何构建一个推荐系统?请说明核心模块、数据流及多任务学习策略。 「阿里巴巴」 2. 【多模态推荐系统设计】设计一个多模态推荐系统,说明其核心模块和数据流。 「字节跳动」 3. 【新闻推荐系统设计】设计一个新闻推荐系统,主要考虑哪些因素? 「阿里巴巴」 4. 【端到端推荐】探索推荐系统端到端建模方法,研究如何统一召回、排序,实现跨阶段统一建模、统一目标与统一优化。进一步,针对端到端生成式推荐,如何设计多目标损失? 「字节跳动、阿里巴巴」 ## 搜索与检索 **L3 实现与应用** **搜索与检索** 1. AI 搜索岗位最核心的技术有哪些? 「腾讯」 2. Sim怎么search的,具体讲讲?包括如何抽取子序列以及一二阶段如何结合到一起? 「美团」 3. Soft-search的embedding是怎么生成的? 「美团」 4. Sparse 检索和 Dense 检索的基本原理分别是什么?为什么在实际系统中要做混合检索?稀疏检索和稠密检索的结果如何做融合排序?你了解RRF吗? 「字节跳动、美团」 5. 你怎么理解AI搜索和传统搜索最本质的区别? 「蚂蚁集团」 6. 倒排索引与正排索引的区别 「美团」 7. 前沿的搜索,排序类算法? 「百度」 8. 在你的项目中,Query 改写的核心做法是什么?搜索场景的 query 改写 / 同义词扩展:BERT 双塔 query-doc 匹配怎么训,难负样本从哪来? 「字节跳动、美团」 9. 在搜索的时候,我们进行query,他是怎么与词库进行匹配的呢? 「百度」 10. 在检索优化过程中,你是如何进行数据预处理的?有没有使用特定的检索算法? 「百度」 11. 场景题:你的这个方案有哪些是能用到微信搜索场景的? 「腾讯」 12. 大模型时代搜推的范式会怎么变,你怎么看生成式搜索对传统搜推的冲击 「字节跳动」 13. 怎么从亿级url中检索出与查询最相似的url 「百度」 14. 搜索中RAG的向量检索会受到长尾商品影响,你会如何缓解? 「京东」 15. 搜索的pipeline是什么样的 「百度」 16. 百度广告在线检索架构 「阿里通义」 17. 讲一下BM25算法原理,包括其输出范围。 「百度、美团、蚂蚁集团」 1. 【ANN索引设计】腾讯云某多模态检索业务需要处理亿级向量,你会如何设计底层的ANN索引? 「腾讯」 2. 【语义歧义建模】语义歧义(如“苹果”既是品牌也是水果)在搜索链路中通常怎么建模?追问:两种方式在长尾Query上的表现差异如何? 「京东、美团」 ## 广告算法 **L2 原理理解** 1. 【广告业务指标与推荐广告对比】1. 广告业务指标:take rate(即广告平台从交易中抽取的佣金比例)的计算公式是什么?物流成本计算公式是什么?广告业务的收入细分有哪些?标的相对于竞品的优势是什么? 2. 推荐和广告的区别:请从目标、用户意图、评估指标、商业模式等方面对比推荐系统与广告系统的区别。 「字节跳动、阿里通义」 **L3 实现与应用** 1. 【外投广告特征】外投广告模型预测用到了哪些特征? 「阿里巴巴」 2. 【外投广告预算】如何影响外投广告预算? 「阿里巴巴」 3. 【广告定价】从你的认识谈一下广告如何定价。 「百度」 4. 【联盟广告问题】联盟广告的典型问题 「阿里通义」 5. 【预算分配】你提到的XX大促项目,预算和流量是怎么分配到各个品类的? 「京东」 **L4 优化与诊断** 1. 【LTV计算】如何计算抖音用户的365天LTV,来衡量广告的收益与成本?(存在注册时间不足365天的用户) 「字节Seed」 2. 【优惠券投放优化】假设美团数据完全开放,如何优化优惠券投放? 「京东」 3. 【曝光恢复问题】有一个商品,开始时正常的,突然有点时间因为竞对的品抬高出价拿不到曝光了。等到竞对不加价后发现依旧拿不到曝光,从模型的角度解释原因以及解决方案。 「阿里巴巴」 4. 【联盟广告技术】联盟广告的黑科技 「阿里通义」 5. 【预算平滑】Pacing 算法(PID / LP),预算 24h 平滑消耗。 「拼多多」 **L5 综合与前沿** 1. 【广告竞价与出价系统】设计广告竞价与出价系统,包括召回→粗排→精排→出价→pacing流程,并设计算法促进DSP出价更高以优化媒体平台收入。 「字节跳动、拼多多」 ## 用户与物品建模 **L2 原理理解** 1. 【ID特征处理】ID特征是怎么处理的? 「腾讯」 2. 【序列长度限制】序列最长长度是多少? 「美团」 3. 【用户人群区分】这个区分用户人群的是单独的路径,还是不同人群都有这几种? 「腾讯」 4. 【用户相似度计算】如何计算用户相似度? 「百度」 5. 【端内端外特征】端内有哪些特征,端外有哪些特征? 「阿里巴巴」 6. 【跨场景用户行为差异】不同场景下用户行为有什么差异? 「字节跳动」 7. 【重要特征识别】什么特征比较重要? 「字节跳动」 **L3 实现与应用** 1. 【C-model建模方法】C-model如何建模? 「字节Seed」 2. 【Embedding维度设置】重要特征的embedding维度有没有考虑怎么设置? 「字节跳动」 3. 【优惠券核销概率预测】优惠券核销概率预测的业务场景?优惠券核销概率与优惠力度、投放时间的关系? 「京东」 4. 【兴趣权重平衡】如何平衡每个时期兴趣的权重? 「字节跳动」 5. 【双塔模型Embedding】双塔模型中的embedding怎么做? 「字节Seed」 6. 【商品ID替代方案】讲一下,为什么不直接用商品ID? 「百度」 7. 【垂类视频得分构建】垂类的视频得分是如何构建的? 「字节跳动」 8. 【序列建模方法】序列建模是怎么做的?SID序列建模的方式主要有哪些?在HSTU建模中,如何利用曝光未点击的行为序列?还考虑哪些其他序列?使用的用户行为序列是去重还是不去重序列?如何理解这种选择? 「字节跳动、美团、腾讯、蚂蚁集团」 9. 【序列建模有效性分析】序列建模为什么考虑接入某序列,以及为什么序列建模会有效果? 「美团」 10. 【搜索与推荐序列建模区别】搜索和推荐两个不同方向,用户的行为序列建模有什么核心区别? 「美团」 11. 【搜索数据挖掘商品趋势】有没有通过用户搜索数据来了解商品趋势的经历? 「京东」 12. 【特征使用】match类特征怎么使用? 「字节跳动」 13. 【特征使用限制】我们为什么不能直接用cspuid去做特征? 「美团」 14. 【特征工程心得】你对推荐算法中特征工程的心得有哪些? 「字节跳动」 15. 【用户意图识别】你觉得用户意图识别需要识别哪些东西? 「腾讯」 16. 【用户行为序列特征提取】对于用户行为序列数据(如点击流、交易序列),你通常用什么方法进行特征提取和建模? 「蚂蚁集团」 17. 【行为模式识别】是否在行为上有相同的模式,该怎么做? 「蚂蚁集团」 18. 【高维特征处理】如果是用户一个月的数据特征太多了怎么办? 「蚂蚁集团」 **L4 优化与诊断** 1. 【动态兴趣适应】假如用户的兴趣是动态变化的(比如用户之前喜欢某一类新闻,但现在兴趣转向了另一类新闻),你会如何调整推荐策略来适应这种变化呢? 「美团」 2. 【发起侧与消费侧建模】想做发起侧和消费侧,两个方向的思路是什么? 「字节跳动」 3. 【图网络节点设置】图网络的构建和节点设置 (详细battle了一下具体在业务上节点设置)。 「百度」 4. 【外域信息偏差处理】引入外域信息,会不会导致本场景显著高估? 「阿里巴巴」 5. 【序列建模大脉冲缓解】序列建模中,大脉冲现象如何缓解(比如发生了福岛地震,可能只发生一次)? 「京东」 6. 【曝光点击偏差处理】如何考虑偏差,比如低曝光高点击/高曝光高点击? 「蚂蚁集团」 7. 【样本偏差处理】深入讨论实习,推荐用到的样本都是旧模型产出的,这样训练新模型会有偏差,怎么解决? 「腾讯」 8. 【特征融合】用到的直播和短视频特征怎么融合,及交互。 「字节跳动」 9. 【用户分类建模】在保险背景中,如果有用户的健康状况和用户一系列的历史订单,该怎么输入分类模型,判断用户是否健康? 「蚂蚁集团」 10. 【用户长期记忆设计】若将电商场景中用户的购买、点击、兴趣等信息设计为长期记忆,有什么想法? 「百度」 11. 【行为序列噪声处理】i2i 里用户行为序列不一定反映用户兴趣,怎么办;比如 i2i,是用每个行为 item 做 trigger 去召回,但是并不是每个 item 都能反映用户兴趣,怎么处理? 「阿里巴巴」 12. 【跨场景行为序列处理】历史行为如果有来自不同场景的行为,不同场景的行为是拆成不同序列还是把信息放sideinfo好?如果放在sideinfo里,对于不同场景的行为怎么处理? 「字节跳动」 13. 【跨域建模方法】跨域建模可以有哪些方式? 「阿里巴巴」 14. 【骑手订单分配优化】如果一个区域的骑手数量足够但订单分配不均(有的骑手闲着有的超时),你怎么优化? 「美团」 15. 【骑手速度衰减预估】怎么预估骑手在恶劣天气下的速度衰减? 「美团」 16. 【高活用户请求平衡】除了按样本量加权,还有什么方法可以平衡高活用户request过多的情况? 「字节跳动」 **L5 综合与前沿** 1. 【跨业务联合建模】在蚂蚁这类生态中,如何利用跨业务(如支付、信贷、理财)的数据进行联合风控建模? 「蚂蚁集团」 ## 冷启动与多样性 **L1 基础认知** 1. 【冷启动概念】冷启动问题定义与理解:1. 冷启动(cold start)如何定义?通常指新用户、新物品或新系统缺乏历史数据时,推荐系统无法有效进行个性化推荐的难题。2. 你如何理解冷启动问题?包括用户冷启动、物品冷启动和系统冷启动三类,常见解决方案有利用人口统计学信息、内容特征、混合推荐、探索与利用策略等。 「腾讯、阿里巴巴」 **L2 原理理解** 1. 【冷启动】冷启动问题:1. 为什么能缓解商品冷启动?2. 冷启动还是滑动?3. 如何利用用户注册信息进行初始推荐? 「字节跳动、腾讯、阿里巴巴」 **L3 实现与应用** 1. 【冷启动】冷启动问题:1. 你的项目有没有应对物品冷启动的方法?2. 分别介绍user和item侧冷启动如何做?3. 想要让新用户在初次使用App时快速被吸引,你会设计什么推荐策略?模型设计需要注意哪些点?4. 电商场景,如何快速做冷启动?5. 遇到新类别该怎么迭代?6. 那用户冷启动如何解决? 「字节Seed、字节跳动、拼多多、百度、腾讯」 2. 【高热样本打压】打压高热样本的做法? 「阿里巴巴」 **L4 优化与诊断** 1. 【冷启动数据来源与优化】系统还没上线、还没拿标之前,这些数据从哪来?没见过的corner case怎么优化? 「阿里巴巴」 2. 【多样性不足分析】如果推荐系统上线后用户反馈说"推的内容都差不多",你会怎么分析和改进? 「百度」 3. 【多模态冷启动】你认为多模态模型在电商搜索中的“冷启动”问题如何解决? 「京东」 4. 【探索与利用平衡】推荐系统中的探索和利用(exploration vs exploitation)怎么平衡? 「百度」 5. 【新用户冷启动】新用户冷启动:群体画像 + bandit 探索 + meta-learning 「拼多多」 ## 指标与实验 **L1 基础认知** 1. 【IPV指标】IPV是什么指标? 「蚂蚁集团」 **L2 原理理解** 1. 【bubble rate】bubble rate怎么算? 「字节Seed」 2. 【召回指标】hitrate和recall是怎么算的,就告诉分子分母分别是什么?为什么选择Recall@10? 「百度、腾讯」 3. 【排序模型指标】排序模型关注的指标是什么?精排模型线上线下用的什么指标? 「字节跳动、美团」 4. 【推荐优化目标】推荐业务目前的优化目标是什么? 「字节跳动」 5. 【推荐正确性】答的正确性(如推荐商品是否真符合用户需? 「腾讯」 6. 【搜推业务指标】搜推业务什么可以当业务指标? 「字节跳动」 7. 【模型AUC差异】这两个模型在测试的时候AUC有什么差异 (无,AUC是排序指标)? 「百度」 8. 【离线指标】离线看什么指标? 「美团」 9. 【线上指标与样本】线上一般看什么指标,样本是怎么寻找的? 「美团」 **L3 实现与应用** 1. 【AUC与GAUC】解释AUC、GAUC、UAUC、COPC指标的含义、定义、计算方法和粒度(AUC是样本级,GAUC是用户级)。AUC为什么可以判别排序任务?在推荐系统中,AUC描绘的是什么?GAUC效果那么好,为什么上线时也要用到AUC?分requestID计算AUC与全局AUC的区别是什么?为什么要关注GAUC指标?是否考虑过GAUC评估?正样本稀疏时GAUC会有什么问题?比较GAUC和AUC,什么时候GAUC不如AUC?说明为什么推荐场景更关注GAUC,以及AUC在推荐系统中的意义和与GAUC的区别。用户粒度下的AUC还能准确衡量推荐系统吗?如果不能,还有什么更好的指标去衡量?解释AUC和UAUC,是否存在AUC和UAUC跷跷板的情况?如何解决?线上是否看AUC这个指标?为什么?项目中的GAUC是如何设计的?有没有更合理的设计方法?预测值乘一个权重,AUC的值是否改变?GAUC呢? 「京东、字节跳动、拼多多、美团、蚂蚁集团、阿里巴巴」 2. 【CTR与IPV关系】CTR提升跟IPV下降有联系吗? 「蚂蚁集团」 3. 【GAUC计算】手撕代码:Request维度的GAUC计算 「字节跳动」 4. 【倍速与完播率】视频完播率任务中,用户是否倍速播放对完播率有没有影响? 「字节跳动」 5. 【召回指标】召回命中率怎么算的,怎么确认漏召的商品。 「腾讯」 6. 【带货直播指标】带货直播你会关注什么指标?除了评论区反馈还关注什么数据? 「京东」 7. 【换道场景指标】换道场景有哪些指标是特别的? 「百度」 8. 【排序指标实现】介绍一下,如何实现的排序结果的指标? 「腾讯」 9. 【离线与线上指标对应】离线的增长对应线上指标的增长是多少,线上看哪些指标? 「美团」 10. 【预测GMV与新用户】预测GMV为什么不算上新用户的成单? 「百度」 **L4 优化与诊断** 1. 【AUC与GMV不一致排查】线上AUC没掉但GMV掉3%,怎么排查? 「拼多多」 2. 【onerec成本】又问onerec范式上线后的cost 「字节跳动」 3. 【uplift模型与随机试验】uplift模型需要注意的是什么,随机试验需要注意什么? 「腾讯」 4. 【分人群AUC下降】分人群的auc下降,该怎么做? 「字节跳动」 5. 【多样性量化】信息流推荐里"多样性"怎么量化? 「字节跳动」 6. 【完播率与CTR矛盾】线上AB测试中,完播率提升但CTR下降是否考虑过有关问题? 「字节跳动」 7. 【特征效果负向排查】加新特征后线上效果没甚至负向可能是什么原因? 「字节跳动」 8. 【留存曲线纠偏】用户留存曲线的纠偏相关问题 「阿里巴巴」 9. 【离在线不一致】模型离在线不一致怎么处理? 「阿里巴巴」 10. 【离线涨在线负】离线涨了,在线指标打平或者偏负的原因有哪些? 「美团」 ## 其他搜推广 **L2 原理理解** 1. 【推荐系统学习路径】作为应届生,你计划如何学习推荐系统相关技术? 「腾讯」 **L3 实现与应用** 1. 【推荐算法工程师工作难点】你觉得推荐算法工程师工作中比较困难的地方是啥? 「拼多多」 **L4 优化与诊断** 1. 【LLM与搜广推结合】现在搜广推都在结合LLM,请谈谈你的看法或相关经验。 「百度」 # AI系统与训练推理工程 ## 分布式训练 **L0 上下文不足(难度待定)** **上下文不足** 1. 到里面得分析,说了一些如指令空泡,怎么调度的之类的。 「腾讯」 2. 哪些可能被冻结? 「美团」 3. 它和Megatron/FSDP 什么关系? 「蚂蚁集团」 **L1 基础认知** 1. 【SFT训练资源配置】SFT训练使用了多少张卡?训练多久?训练20m数据使用了多少张卡? 「京东、拼多多、美团、蚂蚁集团」 2. 【并行方式概述】请解释DP(数据并行)、TP(张量并行)、PP(流水线并行)的概念,并重点介绍DP的原理。另外,3种并行方式可以吗? 「百度、腾讯混元」 3. 【混合精度训练概念】混合精度训练是什么? 「京东、阿里巴巴」 4. 【路由概念】路由是啥意思? 「阿里巴巴」 **L2 原理理解** 1. 【3D并行适用性】平民适不适合玩3D并行? 「腾讯混元」 2. 【AllReduce算法与应用】解释AllReduce算法及其在分布式训练中的应用。 「蚂蚁集团」 3. 【BatchSize选择】BatchSize怎么选? 「百度文心」 4. 【DDP原理】问我用的什么分布式训练方法,然后让我介绍DDP。 「百度」 5. 【DP与PP关系】DP和PP是二选一吗? 「阿里通义」 6. 【FSDP与ZeRO】FSDP实现了ZeRO哪几个阶段?FSDP介绍?讲一下ZeRO。 「腾讯、蚂蚁集团、阿里巴巴」 7. 【GPU资源配置】训练GPU资源配置如何? 「腾讯」 8. 【LoRA训练资源】LoRA 你用了多少卡? 「美团」 9. 【Megatron评价】Megatron行不行? 「蚂蚁集团」 10. 【Micro-Batch与Global Batch】Micro-Batch(MB)和GlobalBatch(GB)之间有什么区别? 「阿里通义」 11. 【Offload归属】Offload是用在Megatron还是ZeRO中? 「阿里通义」 12. 【Tensor并行与数据并行区别】解释Tensor并行和数据并行的区别。 「蚂蚁集团」 13. 【torchrun】torchrun是做什么用的? 「阿里通义」 14. 【TT与TP概念】大模型训练中的TT、TP是什么? 「京东」 15. 【verl框架】verl是什么? 「蚂蚁集团」 16. 【ZeRO三个阶段】论文用DeepSpeed,三个Stage(ZeRO-1/2/3)分别是什么? 「字节跳动」 17. 【分布式并行策略】分布式训练中有哪些并行策略?针对大模型参数规模很大的情况,常见策略包括Tensor Parallel、Pipeline Parallel、Data Parallel等,请列举并简要说明。 「字节跳动、腾讯、阿里巴巴」 18. 【分布式训练实现方式】通过配置文件实现分布式训练还是手搓代码? 「腾讯」 19. 【分布式训练常见问题】分布式训练遇到过什么问题? 「字节跳动」 20. 【分布式训练框架概览与选型】你了解哪些分布式训练框架?如何选择分布式训练框架?请结合你使用过的分布式训练方法或框架,说明在构建大规模并行训练系统时,如何进行框架选型?你了解或熟练使用过哪些训练框架?请列举,例如Megatron、DeepSpeed等。 「京东、腾讯、腾讯混元、阿里巴巴」 21. 【分布式训练通信协议】大模型分布式训练的通信协议? 「阿里通义」 22. 【大模型并行方式】知道哪些大模型加速方式,数据并行、模型并行、序列并行等?简单介绍一些你知道的大模型并行方式。 「字节Seed」 23. 【并行化动机】为什么要做并行化/并行化/并行策略? 「字节Seed、字节跳动」 24. 【并行训练速度】并行化训练速度。 「腾讯混元」 25. 【批量化数据特征】什么样特征的数据可以被批量化处理? 「字节Seed」 26. 【数据并行原理与优缺点】解释数据并行(DataParallelism)的工作原理及其优缺点。 「蚂蚁集团」 27. 【数据量扩大应对策略】如果数据量扩大怎么办? 「字节跳动」 28. 【梯度累加原理】梯度累加的原理是什么? 「阿里巴巴」 29. 【流水线并行bubble】流水线并行中的 bubble 是什么? 「字节Seed」 30. 【流水线并行通信内容】流水线并行中的通信内容是什么? 「字节Seed」 31. 【流水线并行通信原语】流水线并行通过哪些通信原语进行通信? 「字节Seed」 32. 【混合精度计算】请解释AI-HPC中的混合精度计算。 「百度、腾讯」 33. 【训练框架选择】用什么方式什么训练框架训练模型。 「京东」 34. 【调度方法】调度方法是什么? 「字节跳动」 35. 【通信原语】有哪些通信原语?集合通信原语有哪些? 「字节Seed」 **L3 实现与应用** 1. 【Adapter权重合并梯度爆炸】合并adapter权重的时候有没有遇到梯度爆炸? 「美团」 2. 【AllReduce算法对比】NCCL/MCCL集合通信中Ring AllReduce与Tree AllReduce的带宽与延迟差异 「腾讯混元」 3. 【AllReduce通信量计算】有4块卡,数据被切成了4份,每个卡上有一份数据,设一次通信量是x,如果要实现一次All Reduce操作,需要多少通信量? 「阿里巴巴」 4. 【ColossalAI并行维度】ColossalAI有1D/2D/2.5D/3D,是什么情况? 「腾讯混元」 5. 【ColossalAI设计动机】Colossal为啥做这个那个功能? 「字节Seed」 6. 【CPU-GPU通信瓶颈与优化】在分布式AI训练中,CPU和GPU之间的通信瓶颈是如何产生的?有哪些优化方法(如NCCL、RDMA)可以减少通信开销? 「百度」 7. 【DDP通信优化】DDP 的 gradient bucket 和 overlap 通常是如何隐藏通信开销的? 「字节跳动」 8. 【DDP通信模式】中心DDP和P2P的通信过程是怎样的?请详细描述两种通信模式的流程和区别。 「字节Seed」 9. 【DeepSpeed概述与故障排查】讲一下DeepSpeed,DDP和FlashAttention。知道DeepSpeed和Megatron吗?是否了解DeepSpeed?deepspeed训练过程,报找不到主机。介绍一下deepspeed的关键配置参数,及其含义? 多机训练不通,DeepSpeed配置问题。 「京东、字节跳动、腾讯混元、阿里巴巴、阿里通义」 10. 【DP并行负载均衡】做分布式部署,DP并行,只有rank0负载过高怎么办?请分析DP并行负载均衡问题及解决方案。 「阿里巴巴」 11. 【EP并行头拆分】用单卡做的工作还是多卡,多卡时有考虑ep并行的头拆分问题吗? 「腾讯」 12. 【EP通信操作】ep的dispatch和combine 「阿里巴巴」 13. 【Expert Parallel实现】ep 如何实现的? MoE 的 expert parallel 如何做的? 「美团、腾讯」 14. 【FSDP版本对比】FSDP2和FSDP1的区别 「阿里巴巴」 15. 【Gang Scheduling】Gang Scheduling(帮派调度)在AI训练场景中的必要性 「腾讯」 16. 【LLM训练经验】llm训练资源多少,并行方式如何,你训练了多久,调整了哪些参数,训练过程中有遇到什么问题吗? 「腾讯」 17. 【LoRA微调与全参数微调】多机多卡训练里LoRA微调、全参数微调分别怎么操作,LoRA原理、常用超参(R、alpha)、加在哪些层? 「字节跳动」 18. 【Megatron-LM模型并行】Megatron-LM的模型并行实现原理:请解释Column Parallel与Row Parallel矩阵划分策略(横切与竖切),以及如何进行算子侧切分? 「字节Seed、腾讯、腾讯混元、阿里通义」 19. 【micro-batch/gradient accumulation/global batch区别】请区分micro-batch、gradient accumulation、global batch,它们各自影响什么?请详细解释三者的概念和影响。 「字节跳动」 20. 【MMCN与tokenmixer训练速度对比】相同的参数量,MMCN和tokenmixer的训练速度有区别嘛,样本数量,资源数量? 「腾讯」 21. 【MoE通信方式】moe并行过程中,怎么进行通信,有几种通信方式? 「腾讯」 22. 【NeMoCurator去重】为什么用NeMoCurator去重会需要多机多卡?请解释NeMoCurator去重对多机多卡的需求原因。 「腾讯」 23. 【PD分离】了解PD分离吗?请解释PD分离的概念及其在分布式训练中的作用。 「百度」 24. 【PP微批次分配】PP=2时MB应该怎么分配? 「阿里通义」 25. 【PP气泡比较】PP=4和PP=2哪个气泡多? 「阿里通义」 26. 【RL资源与参数关系】rollout数量 batchsize数量和计算资源(卡的数量)有什么关系? 「蚂蚁集团」 27. 【SFT参数量与显卡利用率计算】算模型sft的参数量大小及显卡利用率 「腾讯」 28. 【swift参数设置】你用了swift参数怎么设置的?有2个node你如何分配你的训练参数?请说明swift参数设置方法及多节点分配策略。 「美团」 29. 【work stealing】什么是work stealing?请解释work stealing的概念及其在分布式训练中的应用。 「百度」 30. 【ZeRO优化器阶段】DeepSpeed ZeRO的三个阶段(ZeRO-1、ZeRO-2、ZeRO-3)分别是什么?请说明各阶段的显存优化原理、通信开销,并分析在单机8卡和双机16卡场景下,每张卡上分配的参数量是否相同及原因。 「京东、字节Seed、百度、美团、腾讯、腾讯混元、阿里巴巴、阿里通义」 31. 【ZeRO优化技术】ZeRO优化技术:ZeRO-1、ZeRO-2、ZeRO-3三种优化模式的核心区别是什么?分别切分什么参数?如何减少内存占用?在显存有限时选择哪个方案?ZeRO-2和ZeRO-3分别做了哪些优化?它们是什么并行策略方式?ZeRO机制中Stage1/2/3分别优化什么参数?ZeRO阶段有哪些?介绍DeepSpeed原理及使用,包括ZeRO-1、ZeRO-2和ZeRO-3的区别,以及何时使用FSDP更好?ZeRO在进行并行计算时,如何获取其他机器上的参数?为什么不是ZeRO-2?包括ZeRO方式具体是怎么实现的? 「京东、字节跳动、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 32. 【ZeRO优化策略】描述DeepSpeed的ZeRO优化策略,各阶段的区别?ZeRO-1、ZeRO-2、ZeRO-3分别优化了什么?ZeRO-Offload适用场景与坑点。怎么设置zero-stage的? 「字节跳动、美团、腾讯、阿里通义」 33. 【优化器分布式差异】了解单机跟分布式训练的时候优化器工作原理差别吗?请分析优化器在单机和分布式训练中的差异。 「字节跳动」 34. 【分布式训练故障排查】分布式训练卡住了怎么排查?请列出分布式训练故障排查的步骤和方法。 「美团」 35. 【单机与多机训练差异】之前有接触过单机单卡/单机多卡/多机多卡吗?详细分析一下之间的差异。 「阿里巴巴」 36. 【参数服务器与All-Reduce对比】在分布式机器学习中,参数服务器(Parameter Server)和All-Reduce两种同步模式各有什么特点?分别适用于什么情况? 「蚂蚁集团」 37. 【同步与异步更新】如何处理分布式训练中的同步和异步更新? 「蚂蚁集团」 38. 【多卡通信技术】多机多卡分布式训练的通信问题与整体了解。多卡协同、卡间通信、NVLink、RDMA? 「阿里巴巴」 39. 【多机训练效率】为什么多机训练效率不如单机?请分析多机训练效率低下的原因。 「腾讯混元」 40. 【并行策略与算法】解释数据并行(DDP)、张量并行(TP)、流水线并行(PP)和序列并行(SP)的区别及应用场景。讲讲并行训练的一些算法,数据并行、流水线并行、张量并行,ZeRO算法等。(追问)显卡使用分布和并行处理是怎样的?除了3D并行有没有其他方式大规模训练?额外加哪些并行训练? 「字节Seed、字节跳动、腾讯、腾讯混元」 41. 【并行策略区别与部署实践】分布式训练数据并行、模型并行、流水线并行的区别,阿里大模型训练如何部署?请分析三种并行策略的区别及阿里大模型部署实践。 「阿里通义」 42. 【并行策略原理与调整】DP PP TP的原理和使用场景,各个阶段怎么调整? 「腾讯」 43. 【并行策略概念与实现】并行(dp/tp/pp/ep各自是什么,在vllm中如何实现)? 「字节Seed」 44. 【张量并行节点内放置】为什么TP通常放在节点内?请分析张量并行节点内放置的原因。 「阿里通义」 45. 【张量并行通信开销】TP开大为什么可能导致训练变慢?TP中通信开销来自哪里? 「字节跳动」 46. 【张量并行通信次数】TP的allreduce的次数是多少?请分析张量并行中通信次数与模型结构的关系。 「阿里巴巴」 47. 【朴素并行到Megatron流水并行】讲一下从朴素并行到Megatron的流水并行策略原理?请详细描述流水并行策略的演进和原理。 「字节Seed」 48. 【流水线并行参数调节】说一下pp,pp里的参数调节会怎么影响结果 「百度」 49. 【流水线并行时间与bubble率公式】流水线并行训练理想时间和 bubble 率的计算公式是什么? 「字节Seed」 50. 【流水线并行气泡】为什么会产生bubble?请解释流水线并行中气泡产生的原因及影响。 「字节Seed」 51. 【混合精度训练】混合精度训练如何实现,一般有哪几种精度? 「阿里巴巴」 52. 【自动并行】什么是自动并行?为什么要使用自动并行?请解释自动并行的概念和优势。 「字节Seed」 53. 【训练优化方法】除了DeepSpeed,还用过其他的什么优化方法吗?除了刚刚说到的这些,还了解过哪些模型训练推理优化的方法(DeepSpeed,数据并行,张量并行,流水线并行)? 「字节跳动、腾讯」 54. 【训练效率优化】如何提高大模型训练效率(时间、资源角度)?包括:数据量大时如何提高效率;涉及多少计算资源(有多少卡),是否涉及并行计算,如何提高效率;如果有N张显存足够大的显卡,怎么加速训练?大模型训练优化都能想到哪些方案? 「百度、腾讯、腾讯混元、阿里巴巴」 55. 【训练时间估算】迭代一个模型需要的时间,训练数据多少小时,模型参数如何、用什么卡? 「美团」 56. 【训练速度优化】训练的时候发现训练速度很慢,该从哪些方面去考虑以提高速度? 「阿里巴巴」 57. 【资源隔离】怎么做的资源隔离? 「腾讯」 58. 【通信瓶颈】AI-HPC中的通信瓶颈。 「百度」 59. 【集合通信与开销】通信(reduce、gather、开销考虑)与通信开销比?额外开销有多大?高到什么程度? 「字节Seed、腾讯」 **L4 优化与诊断** 1. 【3D并行设计】如何设计模型训练的3D并行(DP、PP、TP)?假设有超多的8卡A100节点(DGX A100),如何应用3D并行策略?你是如何分配DP、PP、TP的? 「字节跳动、腾讯混元、阿里通义」 2. 【AI调度器对比】Volcano与Kueue调度器在AI负载排队与抢占策略上的区别及适用场景? 「腾讯混元」 3. 【ColossalAI对比】Colossal细节和DS/Megatron比如何? 「字节Seed」 4. 【FSDP与HSDP通信对比】4机32卡H200训练从FSDP换成HSDP,通信时间会减少多少? 「字节跳动」 5. 【FSDP与Megatron对比】FSDP vs Megatron? 为什么选FSDP不选Megatron?为什么选Megatron不选FSDP? 「蚂蚁集团」 6. 【FSDP与ZeRO-3比较】如果同样是“把显存问题拆开”,应如何比较 FSDP 和 ZeRO-3? 「字节跳动」 7. 【GPU亲和性与拓扑调度】GPU亲和性调度如何实现,拓扑感知调度的核心挑战? 「腾讯」 8. 【GRPO训练加速】你使用框架训练 GRPO 时,有没有针对性做训练加速相关优化? 「阿里巴巴」 9. 【K8s Gang Scheduling】在K8s上部署大模型训练时遇到Pod调度死锁或资源碎片,如何用Gang Scheduling解决? 「腾讯混元」 10. 【MCCL优化分享准备】如果让你给团队做一场关于摩尔线程GPU通信库MCCL优化的分享,你会怎么准备内容 「腾讯混元」 11. 【Megatron与DeepSpeed源码】你看过metragon和deepspeed的源码吗? 「腾讯」 12. 【MoE专家死亡检测】专家死亡检测? 「百度」 13. 【NCCL通信优化】NCCL通信优化,如何避免GPU间通信成为瓶颈? 「腾讯」 14. 【pipeline active分析】为什么要去看fp32 pipeline active和bf16 pipeline active? 「阿里巴巴」 15. 【RL分布式调度】RL训练中 rollout 和 actor update 如何分布式调度? 「字节跳动」 16. 【RL训练框架对比】verl/AReaL/openRLHF区别? VeRL/Ray这类框架大致如何组织分布式RL? 「字节跳动、蚂蚁集团」 17. 【TP/PP/DP并行】TP、PP、DP并行的区别与选型考量?给定8节点、每节点8卡、80GB H100,要训练70B级模型,应如何在TP/PP/DP间做第一版拓扑划分? 「字节跳动、腾讯混元」 18. 【Transformer训练加速】有哪些降低Transformer训练时间复杂度的工作? 「字节跳动」 19. 【VeRL代码】是否看过VeRL的代码实现?核心模块有哪些? 「字节跳动」 20. 【ZeRO-3通信原语】ZeRO-3中,详细介绍通信原语(All-Gather,Reduce-Scatter,All-Reduce) 「阿里通义」 21. 【ZeRO与3D并行】有了ZeRO系列,为什么还需要3D并行? 「腾讯混元」 22. 【单机到分布式扩展设计】假设你需要将一个单机训练的模型扩展到分布式训练,你会如何设计? 「京东」 23. 【多模态大模型通信开销优化】在分布式训练多模态大模型时,如何处理多机多卡间的通信开销? 「腾讯」 24. 【大模型并行策略设计】64卡训练70B模型,应该怎么设计并行策略?请给出具体配置,并说明面试中如何回答最稳妥。 「阿里通义」 25. 【大模型训练成本优化】如何优化大模型训练的成本?如何在有限资源下训练大模型? 「蚂蚁集团」 26. 【大规模AI基础设施项目】详细描述你参与过的千卡级或大规模AI训练/推理基础设施建设项目。 「腾讯混元」 27. 【大规模训练经验】描述你参与过的最大的训练任务,以及遇到的挑战。 「蚂蚁集团」 28. 【异步Checkpoint】训练过程中因节点故障触发Checkpoint恢复,如何设计异步Checkpoint降低存储IO对训练的阻塞? 「腾讯混元」 29. 【异步训练陈旧性】full async staleness?fully async训练会带来什么问题? 「字节跳动、阿里巴巴」 30. 【弹性容错与自动重启】弹性容错和自动重启机制。 「腾讯混元」 31. 【微调超大模型资源利用】在微调超大参数模型时,如何高效利用计算资源? 「蚂蚁集团」 32. 【故障恢复】AI工作负载的故障恢复策略,训练作业中途失败如何快速恢复? 「腾讯」 33. 【架构与MFU】为什么这种架构可以提升MFU? 「腾讯」 34. 【梯度分片与环式通信实现】手写实现:在多GPU环境下,使用梯度分片与环式通信优化传输效率。 「字节跳动」 35. 【模型并行/张量并行/流水线并行对比与选型】请对比“模型并行”“张量并行”“流水线并行”三种显存优化方案的技术原理,以及在单节点多卡、多节点多卡场景下的选型逻辑。 「腾讯」 36. 【流水线并行与气泡】PP bubble怎么优化?介绍Pipeline Parallelism (PP) 的原理,以及如何解决气泡问题?并给出气泡(bubble)的计算公式。 「字节Seed、阿里通义」 37. 【策略迁移】调研用模型和目标模型在参数量、Dense/MoE结构、训练阶段不同时,策略迁移需要注意什么? 「字节跳动」 38. 【算力预算分配】如果给定一个固定训练算力预算,如何在“模型参数量、训练 token 数、训练步数”之间做第一次分配? 「字节跳动」 39. 【联邦学习】请解释一下联邦学习在音视频隐私保护中的应用? 「字节跳动」 40. 【训练pipeline设计】到训练的pipeline。你会怎么设计? 「字节Seed」 41. 【训练数据存储方案】存储层面对象存储+Ceph与并行文件系统Lustre/GPFS在训练数据加载中的取舍与缓存加速方案 「腾讯混元」 42. 【调度策略】调度策略如何实现?如何设计,有没有异常fallback? 「阿里巴巴」 43. 【通信带宽排查思路】多机多卡通信带宽不及预期时,从网卡绑定、NUMA、QP数量、MCCL_DEBUG排查的思路 「腾讯混元」 44. 【通信算子与策略选择】在 AI 训练场景中,分布式训练常面临通信瓶颈问题。请说明 AllReduce、Broadcast、ReduceScatter 这三种核心通信算子的适用场景差异,并分析在千亿参数大模型训练中,如何选择通信策略以降低延迟、提升吞吐量? 「腾讯」 45. 【长上下文训练】若将上下文扩展到1000K,该如何估算训练的算力用量?若要将模型训练到1000K的上下文长度,该从哪些方面实现,其中的难点是什么? 「腾讯」 **L5 综合与前沿** 1. 【AI-HPC趋势】AI-HPC的未来趋势。 「百度」 2. 【AI基础设施发展方向】你认为AI Infrastructure未来的发展方向是什么? 「蚂蚁集团」 3. 【LibTorch Java与Flink结合】基于LibTorch Java绑定开发训练框架,如何借助Java的多线程机制与Flink的分布式计算,提升模型训练效率?如何通过LibTorch Java绑定实现模型增量训练,结合Flink的增量数据处理与Spring AI,提升训练迭代速度?用LibTorch Java绑定做模型训练时,如何通过Flink的状态管理保证训练数据一致性,同时发挥Java的可靠性优势? 「阿里巴巴」 4. 【RS方案设计】给你3M的图和视频,只有16张卡,设计一下RS的方案。 「腾讯」 5. 【千卡集群搭建】我们现在要从零开始搭建一个千卡集群用于大模型训练,你会从哪些方面考虑?可能会遇到哪些坑? 「美团」 6. 【多租户ML训练平台设计】设计一个支持多租户的ML训练平台。项目架构设计经验,如何主导设计一个支持多租户的千卡AI训练平台? 「腾讯混元、蚂蚁集团」 7. 【大规模AI集群稳定性与SLA】如何保证大规模AI集群的稳定性和SLA? 「腾讯」 8. 【大规模RLHF训练瓶颈与优化】请说明在分布式训练环境下,进行大规模RLHF训练可能遇到的技术瓶颈及优化策略。 「蚂蚁集团」 9. 【大规模分布式训练系统设计】如何设计一个大规模分布式训练系统?如果你需要设计一个支持大规模模型训练的分布式训练框架,你会考虑哪些关键因素? 「京东、蚂蚁集团」 10. 【训练任务调度系统设计】如何设计一个高效的AI训练任务调度系统,确保资源利用率最大化? 「京东」 11. 【负载均衡调度】AI 训练任务的资源调度常面临“负载不均衡”问题(如部分 GPU 利用率 90%,部分仅 30%)。请分析负载不均衡的常见原因(如任务拆分、数据倾斜、通信等待),并说明如何设计调度算法(如动态任务迁移、负载预测)进行优化? 「腾讯」 12. 【跨地域AI训练】多集群管理方案,如何实现跨地域AI训练?并说明面临的带宽时延与数据同步一致性问题。 「腾讯、腾讯混元」 ## 并行策略 **L2 原理理解** 1. 【并行策略】了解哪些并行策略?解释张量并行和流水线并行的区别。另外,多头多batch如何并行?头和batch之间无关,直接并行,算完再拼起来。了解CP吗? 「字节Seed、腾讯、阿里巴巴」 **L3 实现与应用** 1. 【并行策略选择】并行策略TP、PP、SP的使用场景及如何选择?训练时如何选择TP/PP等分布式策略? 「字节跳动、阿里巴巴」 **L4 优化与诊断** 1. 【MoE并行】手撕:MoE并行处理。 「阿里通义」 2. 【并行策略优化】针对多模态推理时的显存瓶颈,有哪些模型并行或Pipeline并行的优化手段? 「腾讯」 3. 【并行通信原语】手写算法:实现一个简单的模型并行通信原语。 「腾讯」 4. 【流水线并行实现】手写流水线并行策略,将模型分层部署到多设备,计算通信重叠。 「字节跳动」 5. 【混合引擎与自动映射】verl中的hybridengine、auto mapping原理,最大的创新点是什么? 「腾讯」 ## 显存与训练优化 **L0 上下文不足(难度待定)** **上下文不足** 1. 内存占用大吗? 「美团」 2. 对显存优化有何帮助? 「字节跳动」 3. 显存OOM? 「京东」 **L2 原理理解** 1. 【CPU卸载】主要将哪部分迁移到CPU中计算? 「阿里通义」 2. 【参数量计算】已知bsz seq_len dim head,参数量是多少,和哪几个参数有关? 「京东」 3. 【批量大小影响】batchsize 调大有什么影响? 「阿里巴巴」 4. 【显存监控】nvidia-smi看到的显存占用是真实可靠的吗? 「阿里巴巴」 5. 【梯度检查点】activation checkpointing 本质上是用什么换什么? 「字节跳动」 6. 【梯度累积】什么是梯度累积(Gradient Accumulation)?何时使用? 「蚂蚁集团」 7. 【模型显存估算】模型显存估算:8B、14B、2B、7B、13B、70B等模型训练/推理/全参数微调所需显存估算方法。包括:8B模型训练大概用多少显存?Qwen模型大概占用多少内存?14B模型推理和训练要多少显存?2B模型使用BF16全参数训练时显存占用如何估算?7B模型如何计算训练占用的显存?模型参数量与显存对应关系(7B、13B、70B大概对应多少GB显存)?不做量化时占用多少显存?大模型全量微调时哪些部分占用显存?全参数微调需要多少显存?微调模型需要多大显存?微调用什么卡?模型显存占多少? 「京东、字节跳动、快手、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 8. 【混合精度训练】混合精度训练:bf16、fp16和fp32的区别与计算;中间累加结果为什么通常要放到更宽的位宽里去承接?什么是混合精度训练(Mixed Precision Training)? 「腾讯、蚂蚁集团、阿里巴巴」 **L3 实现与应用** 1. 【LoRA显存节省】LoRA 是怎么节省显存的? 「字节跳动」 2. 【OOM处理】如果出现OOM,常见的处理方式是什么? 「腾讯」 3. 【优化器显存占用】假设一个模型大小13B,使用FP16精度,那么在做全量微调的时候,Adam会占用多少显存? 「腾讯」 4. 【推理显存优化】推理主要的显存部分优化技术有哪些? 「阿里巴巴」 5. 【显存不足解决方案】如果显卡的显存不够装下一个完整的模型呢? 「腾讯混元」 6. 【显存优化技术综合】分别做了哪些优化(如优化优化器状态、优化梯度、切分参数等)来全面节省显存?请结合显存OOM、ZeRO、vLLM、梯度累积、混合精度、优化器及参数等概念进行说明。 「京东、阿里通义」 7. 【有限算力微调】在消费级显卡上微调大模型时显存开销能降低多少? 「美团」 8. 【模型显存估算】估算大模型训练和推理的显存占用。变体:1) LoRA微调与全参数微调显存计算及实际项目用量;2) MoE模型训练与推理显存特点;3) 1B模型SFT与GRPO阶段显存开销;4) 精排模型训练与推理显存估算;5) 通用估算:模型参数量X-B,权重FP16,其余假设自补,估算训练和推理GPU显存占用。 「字节跳动、百度、阿里巴巴」 9. 【注意力机制显存优化】PagedAttention能否降低显存?为什么?二维attention mask矩阵耗显存,计算attention时有什么节省显存的优化策略? 「百度、阿里巴巴」 10. 【长上下文显存优化】上下文扩展到1000K后,训练时显存会在哪些地方暴涨? 「腾讯」 **L4 优化与诊断** **显存优化技术综合** 1. 显存占用与哪些因素相关?如何估计训练和推理的显存需求?请详细说明:模型参数、优化器状态、梯度、激活值、KV Cache等各部分的显存计算方法(包括不同精度如FP16/FP32的字节数),并针对具体场景(如7B参数FP16模型,batch_size=4,seq_len=2048)估算推理显存;计算Qwen3-8b推理所需显存;计算全参和LoRA微调分别占多少显存;训练一个7B模型需要多少显存和时间,训练运算量多少;不同ZeRO阶段能节省多少显存;在3D并行下如何估计显存占用;预填充和解码哪个更容易造成显存瓶颈;每个版本都存空间占用高怎么解决? 「京东、字节Seed、字节跳动、快手、百度、美团、腾讯、腾讯混元、阿里巴巴」 2. 显存、延迟、吞吐量这三者构成不可能三角,请解释其关系。训练和推理在资源和消耗上的区别是什么?梯度、信息冗余、性能开销等问题在实际落地中如何体现? 「字节跳动、快手、百度文心」 3. 梯度检查点(Gradient Checkpoint)的原理是什么?如何节省显存?牺牲了什么代价? 「阿里通义」 4. 混合精度训练的原理是什么?FP16与BF16的数值稳定性差异及LossScale原理,FP16和BF16的选择考量,以及训练中哪些部分用什么精度? 「百度、腾讯、腾讯混元」 5. 训练不稳定怎么排查(loss NaN、OOM、吞吐下降)?最先看哪些基础日志/指标? 「拼多多」 6. 训练/推理显存不够时,有哪些缓解策略?请列举除FlashAttention外的其他显存优化方法(如梯度检查点、混合精度训练、ZeRO优化、模型并行、激活重计算、KV Cache优化等),说明其原理、落地难点及解决方案,并追问是否实际使用过其中某些方法。同时,训练过程中出现OOM如何排查和解决?如何在显存受限下保证训练稳定性?如果训练时间和算力不匹配如何优化?训练中有什么时间换空间的做法?有哪些降低Transformer训练时间复杂度的工作? 「快手、百度、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 1. 【OOM处理】你修过一个推理/训练过程中显存异常和长稳问题,这个问题原来为什么会发生?你具体做了什么?为什么修完之后就能稳定? 「阿里巴巴」 2. 【ZeRO显存优化】使用DeepSpeed ZeRO-3微调Qwen2-72B时,估算单卡显存占用量,并解释显存分配的技术原理(如参数分片、梯度累积、优化器状态拆分等)。 「腾讯、腾讯混元」 3. 【性能与成本平衡】如何在训练与推理中平衡性能与算力成本? 「京东」 4. 【有限算力微调】如何在有限算力下做大模型微调? 「美团」 5. 【模型显存估算】10.7B/11.7B规模模型使用GRPO训练时的显存占用开销及优化方式。 「美团」 6. 【训练加速】不降低效果的情况下怎么加速训练? 「百度」 7. 【长上下文显存优化】在长文本训练(如agentic场景)或生成式推荐中,用户行为序列越来越长,容易导致OOM或显存持续膨胀,你有什么好的优化方法? 「字节跳动、美团」 **L5 综合与前沿** 1. 【OOM处理】基于LibTorch Java绑定的训练框架,如何利用Java的JVM调优与Flink的内存管理,避免OOM以保障训练稳定? 「阿里巴巴」 ## 推理加速 **L0 上下文不足(难度待定)** **上下文不足** 1. chunk_size设置的是多少? 「腾讯」 2. 中间有问ntp的一些问题,比如位置关系怎么定义? 「阿里巴巴」 1. 【推理性能优化】推理速度验证。 「腾讯混元」 2. 【推理瓶颈诊断】有没有性能瓶颈? 「腾讯」 **L1 基础认知** 1. 【尾延迟】尾延迟是啥? 「腾讯」 **L2 原理理解** 1. 【KV Cache】KV Cache是什么?其原理是什么?缓存的是什么,为什么要做这个缓存?为什么是KV Cache而不是Q Cache?KV-Cache如何优化?如何帮助推理加速?KVCache的优化方法有哪些? 「百度、阿里通义」 2. 【Prefill与Decode阶段】预填充阶段(Prefill)和解码阶段(Decode)有什么区别? 「小红书、腾讯」 3. 【vLLM】是否了解 vLLM 框架? 「快手」 4. 【推理优化手段】除了msqr,还在哪些场景使用cast? 「字节Seed」 5. 【推理加速】模型加速的方式有哪些,分别? 「百度」 6. 【推理加速技术】有没有用到continuous batching、KV Cache、vLLM等技术? 「字节跳动」 7. 【推理框架对比】解释TensorRT、ONNXRuntime等推理框架的作用,并说明你会使用哪些推理加速框架? 「百度、蚂蚁集团」 8. 【推理瓶颈诊断】解释:瓶颈不在数据传输,在计算那边。 「腾讯」 9. 【算子融合】什么是算子融合?算子融合为什么可以带来性能提升? 「字节Seed、百度」 10. 【连续批处理】有没有听说过Dynamic Batching? 「阿里巴巴」 **L3 实现与应用** **推理加速** 1. 介绍PagedAttention核心思想、vLLM原理及其如何解决显存碎片化问题;对比FlashAttention等优化方法;说明VLLM核心优势、PagedAttention如何提升显存利用率、动态批处理和显存管理创新设计。 「京东、字节跳动、快手、百度、腾讯、腾讯混元、蚂蚁集团」 2. 介绍TensorRT。 「快手」 3. 介绍一个具体的推理场景,问在这个场景下能给出什么推理优化思路。 「字节跳动」 4. 介绍下Text generation inference? 「腾讯混元」 5. 从工程角度看,你是如何优化大模型训练和推理效率的?优化大模型推理速度的方法。优化都有哪些方向,每个方向下有什么优化方法?你在LLM推理优化方面做了哪些工作?你具体看到了什么、你做了什么、你怎么判断哪些算子值得优化?你怎么判断当前是高峰期?百分之三十这个值怎么选的?prefill和decode在GPU上的计算特征有什么区别?你知道哪些大模型推理中的算子融合案例? 「字节跳动、百度、美团、腾讯混元、阿里巴巴、阿里通义」 6. 你们的项目耗费的token情况? 「阿里巴巴」 7. 倒排表与BitSet优化,这种优化对CPU和内存的具体收益是什么? 「阿里巴巴」 8. 假如需要支持Streaming输出,但当前服务延迟又超标,你会怎么折中设计? 「百度」 9. 假设在项目上线前,发现模型推理延迟过高,你会如何快速定位和优化? 「京东」 10. 分层面阐述推理优化思路,结合阿里跨境场景说明具体适配方法。 「阿里巴巴」 11. 分析动态批处理与静态批处理的优缺点,以及在高并发低延迟场景中如何设计批处理策略平衡吞吐量与响应时间?动态批处理了解过吗?动静态检测了解多少? 「腾讯、阿里巴巴」 12. 同一个batch内的prompt之间可能有共同的前缀,怎么在prefill阶段利用它来减少重复计算? 「字节跳动」 13. 后处理计算速度有哪些困难,如何解决? 「美团」 14. 吞吐量的定义是什么? 「字节Seed」 15. 哪些环节最有可能成为性能瓶颈? 「阿里巴巴」 16. 图优化具体是怎么选的,开发流程是什么。 「蚂蚁集团」 17. 在LLM推理里,prefill是什么意思? 「阿里巴巴」 18. 在保证准确率的前提下,是否有办法减少调用链路? 「阿里巴巴」 19. 在大模型推理服务中,如何实现高并发与低延迟? 「字节跳动」 20. 在大模型推理阶段,KV Cache的作用是什么? 「美团」 21. 在大规模推理时,如何优化显存使用? 「腾讯」 22. 在实际本地部署vLLM服务时,如何权衡上下文长度与显存占用的关系?是否应用过量化或动态批处理等技术? 「腾讯混元」 23. 在将一个千亿参数级别的多模态大模型部署到云端进行推理服务时,遇到了首字生成延迟(TTFT)过高导致用户流失的问题。在不改变模型权重和架构的前提下,你会采取哪些纯系统及工程层面的优化策略? 「腾讯」 24. 在推理中,如何平衡速度和精度的要求? 「腾讯」 25. 在端到端延迟必须控制在50毫秒以内的限制下,你会怎么权衡模型的各个模块结构? 「腾讯」 26. 在规划模块中如何避免频繁的内存分配导致的延迟尖刺? 「腾讯」 27. 在训练和推理大模型时,一般会如何选择? 「阿里通义」 28. 在设计这些模块时,你会如何优化模型的推理效率? 「腾讯」 29. 增加了串行流程后为什么还能提速? 「京东」 30. 多context推理与多batch推理的区别? 「百度」 31. 多模态大模型的推理效率如何优化? 「京东」 32. 大模型在decode阶段跑batch和只跑一个有什么区别? 「小红书」 33. 大模型推理优化手段:模型量化、蒸馏、KV缓存、批处理推理原理。 「阿里通义」 34. 大语言模型上下文很长时,kv cache显存爆炸的解决方案。 「蚂蚁集团」 35. 算子强度的定义归一化怎么做的?信号的意义? 「字节Seed」 1. 【Attention加速】在推荐系统或NLP领域,有哪些方法可以加速attention算子的计算?是否了解dpattention? 「字节Seed、百度、阿里巴巴」 2. 【FlashAttention】讲一下FlashAttention的核心原理、思想和做法,以及它主要解决了大模型训练/推理中的什么瓶颈? 「字节跳动、百度、美团」 3. 【FLOPs估算】推理时FLOPs大概多少?计算量(FLOPs)是如何估算的? 「快手、阿里巴巴」 4. 【FP8推理】FP8推理的优势,E4M3和E5M2格式的区别? 「腾讯」 5. 【KV Cache优化】KV Cache减半到底省了什么?请分析KV Cache的内存瓶颈,并讨论KV Cache的优化方法。kvcache压缩手段(MHA、MQA、GQA、MLA) 「字节Seed、阿里巴巴」 6. 【PagedAttention】详细描述vLLM中KVCache管理机制的工作原理。请详细解释PagedAttention的原理、实现方式、解决的问题(如显存利用率低、KV Cache管理问题),以及它相比传统注意力机制的优势。同时说明vLLM中PagedAttention的工作机制,并对比PagedAttention与FlashAttention的区别。 「字节跳动、百度、百度文心、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 7. 【Prefill与Decode阶段】大模型推理分哪两个阶段(Prefill与Decode)?每个阶段的特点是什么?请结合Roofline模型,详细解释Transformer推理中Prefill和Decode两个阶段的区别,包括:各自是计算密集型还是访存密集型?为什么不能提高计算效率?以及每个阶段对应的是GEMM还是GEVM操作? 「字节Seed、字节跳动、小红书、百度、阿里巴巴、阿里通义」 8. 【Prefix Cache】1. prefix cache融合算子融合了哪些? 2. 请介绍SGLang中的RadixAttention以及SGLang代码实现的相关内容。请介绍你对prefix cache的了解。你是否实现过VLLM的prefix cache? 「字节Seed、字节跳动、百度、美团」 9. 【Transformer推理优化】Transformer如何加速推理?请列举推理加速技术,并解释KV Cache是什么?训练vs推理的并行性差异? 「京东、字节跳动」 10. 【vLLM】vLLM推理框架的核心优化点、核心优势、核心性能优势、核心优化原理、优点、功能、核心优势、相较于传统大模型框架的优势、解决的问题、在哪些场景下效果明显、核心原理技术点、如何实现推理加速?请全面阐述vLLM的优化措施、目的、工作原理及适用场景。vLLM怎么进行异步调度?vLLM提出的KVCache管理机制主要解决了什么问题?请详细说明KVCache管理的工作原理。VLLM的请求调度机制具体是如何工作的?vLLM的缺点有哪些?vLLM离线批量推理。之前的实习有对vllm里面的结构进行优化吗? 「快手、百度、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 11. 【延迟与吞吐量】延迟和吞吐量你更关注哪一个?在推理服务中如何平衡? 「百度」 12. 【投机解码】投机解码具体解决什么问题?请结合推理框架,讲一下投机解码的技术原理。 「百度、腾讯」 13. 【推理优化总体思路】性能优化怎么做?模型推理太慢了,你会从哪些维度去优化?是否有做过大模型在GPU上训练/推理的性能优化?模型推理优化除了传统算子,还会用什么样的架构或加速手段?比如优化推理速度、解决兼容性问题,效果如何?讲了讲项目中推理优化的一些手段。 「京东、百度、美团、腾讯、阿里巴巴」 14. 【推理优化手段】大模型推理加速:调参优化。具体包括:1. 在verl推理加速框架中如何调参?2. 大模型推理过程中可通过调节哪些参数提高性能? 「百度文心、腾讯」 15. 【推理加速与量化技术】量化技术(如INT8/FP8/混合精度)在推理加速中的作用与优化:量化与硬件加速的关系;量化在特定场景的优化;量化对Prefill和Decode阶段提速的影响;PD分离、vLLM、PagedAttention等推理加速技术。 「百度、阿里通义」 16. 【推理性能优化】如何优化深度学习模型的推理性能? 「蚂蚁集团」 17. 【推理时延优化】如何保证速度并减少模型推理时延? 「腾讯」 18. 【推理服务设计】什么时候会出现反压(backpressure)? 「字节Seed」 19. 【推理框架对比】了解加速推理框架吗?请列举常见的推理加速框架(如DeepSpeed、vLLM、SGLang等),并说明它们各自的特点和原理。重点介绍DeepSpeed如何优化大模型推理、提高推理效率和资源利用率,特别是PagedAttention如何提升显存利用率?相比传统推理框架有什么优势?另外,是否使用过vLLM或SGLang?请解释其原理。 「字节跳动、百度、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 20. 【推理瓶颈诊断】大模型推理中常见的资源瓶颈有哪些?性能拐点在哪里?这种慢是来自模型结构还是推理策略? 「字节跳动、百度、腾讯」 21. 【推理速度影响因素】影响模型推理速度的因素有哪些?请解释:1)小模型推理时平均步数比大模型更多的原因;2)推理模型通常更慢的原因;3)输入prompt长度增加两倍时,底层模型推理速度会慢多少?4)随着序列长度增加,Transformer模型的计算量、访存量和计算密度如何变化? 「字节跳动、百度、腾讯、腾讯混元、阿里巴巴」 22. 【模型编译技术】模型编译技术(如TensorRT、TVM)在推理优化中的作用。用过TensorRT或其他推理引擎吗?部署中遇到过什么坑?并解释TensorRT在底层是如何加速推理的。 「快手、百度、腾讯」 23. 【算子优化】算子的细粒度,过小与过大的好处与坏处。 「百度」 24. 【算子融合】算子融合(Operator Fusion)在推理优化中的作用、访存瓶颈分析及适用性是什么?是否有过算子融合或KVCache优化的实践经验? 「百度、美团、腾讯混元」 25. 【计算量与访存量】attention层的计算量和访存量的计算,mlp层的计算量 「小红书」 26. 【训练推理一致性】什么是训练推理一致性?训练和推理在系统优化上有什么区别? 「蚂蚁集团」 27. 【连续批处理】什么是连续批处理(Continuous Batching)?它与传统静态批处理、动态批处理(Dynamic Batching)、稳态批处理(Steady Batching)和持久批处理(Persistent Batching)有什么区别?介绍continuous batching和chunked prefill。 「字节跳动、小红书、百度、腾讯」 28. 【量化技术】Float4类型的作用是什么?它是否总是能带来性能提升?在什么场景下使用Float4会更高效?LLM任务和深度学习任务对不同数据精度格式的偏好是什么?是否做过量化或动态批处理? 「百度、腾讯、阿里巴巴」 **L4 优化与诊断** **推理优化手段** 1. 每个参数的含义作用,有没有不适配的model,如何权衡加速比例和质量,怎么和其他加速方法兼容? 「字节跳动」 2. 沙箱执行速度如何优化? 「字节跳动」 1. 【AdaCache】AdaCache 论文的核心亮点是什么? 「字节跳动」 2. 【DeepSeekV3加速】DeepSeekV3为什么快? 「腾讯」 3. 【FlashAttention】FlashAttention原理?核心原理、优化方法(如分块、Online softmax)以及flash/paged attention分块对齐。FlashAttention V1/V2/V3核心差异及解决的问题?FlashDecoding原理?请分别说明各版本的优化点,包括Online softmax、CUDA kernel实现等。FlashAttention数学推理公式是什么?它如何优化内存访问?为什么计算量没减少却能加速?FlashAttention主要用在哪个阶段?attention的优化方式,flashattention怎么维护分母?rankmixer有试过吗? 「京东、字节Seed、字节跳动、百度、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 4. 【FlashDecoding】FlashDecoding原理、与FlashAttention的区别及适用场景? 「阿里巴巴」 5. 【KV Cache管理】大模型推理时,“KV 缓存(KV Cache)”是降低计算量、提升响应速度的核心机制。请解释 KV 缓存的存储原理,以及在长序列对话场景(如上下文长度超 4k)中,如何优化 KV 缓存的存储结构以减少内存占用?具体包括:如何通过PagedAttention等分块管理技术优化KVCache内存碎片?请结合vLLM推理框架说明PagedAttention的核心思想。如果Decoder采用BeamSearch算法,vLLM会如何管理KVCache?本地部署时,如何平衡vLLM的上下文长度和显存占用? 「百度、腾讯、腾讯混元」 6. 【LoRA推理优化】LoRA加载以后会导致延迟,如何缓解? 推理阶段为消除LoRA延迟,会做权重Merge吗? 「腾讯混元、阿里巴巴」 7. 【MoE推理优化】MoE(混合专家)模型推理优化:1. 比较3B Dense模型与32B-a3B MoE模型的推理延迟与速度。2. MoE推理优化关键点(专家切换成本、负载均衡等)。3. 部署235B MoE模型(千分三激活)所需算力估算。 「百度、美团、腾讯」 8. 【OOM排查】推理时出现OOM(Out of Memory),你如何排查和解决? 「百度」 9. 【Prefill与Decode阶段】一个prefill和decode的配额控制策略,在负载高峰时给decode预留百分之三十的算力预算,P99延迟从三秒二降到八百毫秒。请解释该策略的原理和效果。 「阿里巴巴」 10. 【TensorRT】简述TensorRT在多模态模型加速中的常用Trick(如算子融合)。 「腾讯」 11. 【Transformer推理优化】针对Transformer模型的自回归推理过程,forward中有哪些冗余计算可以省去?你会采用哪些优化手段? 「腾讯、蚂蚁集团」 12. 【vLLM】vLLM v0和v1架构有什么区别,比如调度上有什么不同?另外,请解释PagedAttention、连续批处理、chunked prefill、prefix caching等核心机制。vLLM最近有什么新的比较好的特性?例如对DeepSeek V4 Pro的支持等最新进展。 「字节Seed、阿里巴巴」 13. 【低资源部署】如何优化大模型在低资源设备上的部署? 「腾讯混元」 14. 【多模态推理优化】请举例说明你如何优化多模态模型的推理速度。 「蚂蚁集团」 15. 【投机解码】Speculative Decoding(投机解码)的原理是什么?其接收策略的具体公式是什么?草稿模型和教师模型能否保证同分布?在什么场景下使用效果最好?如何与量化技术结合,以及结合时面临哪些工程挑战?vLLM支持哪种投机解码?总显存占用优化还是推理加速,是否加速首个token生成时间? 「字节跳动、百度、腾讯、腾讯混元、阿里巴巴」 16. 【推理优化总体思路】大模型推理性能优化怎么做?请从基本思路、具体方法(包括训练和推理加速)、软件优化(硬件给定情况下)等方面阐述,并说明如果优化方案上线后性能不达预期,如何持续优化?另请描述一个你优化模型推理性能的案例,包括具体的技术手段和效果。 「京东、字节跳动、百度、美团、腾讯、腾讯混元、阿里巴巴」 17. 【推理延迟诊断】AI推理延迟高的诊断方法论及优化策略,可能涉及哪些技术层面?如果在模型推理过程中出现延迟问题或项目上线前发现推理速度不达标,你会如何优化? 「字节跳动、腾讯」 18. 【推理成本优化】如何在保证性能的前提下降低模型推理成本?请对比量化、batching、缓存、蒸馏/小模型兜底等手段的优先级并说明理由。 「京东、拼多多」 19. 【推理服务设计】模态感知负载均衡? 「百度」 20. 【推理框架对比】比较LLM推理框架的优缺点与使用场景:1. LLMGenerator vs vLLM(优缺点);2. TensorRT-LLM vs vLLM(典型使用场景);3. vLLM vs SGLang(包括PagedAttention技术,SGLang相比vLLM的PagedAttention在推理延迟上的优势,以及如何选择vLLM和SGLang)。 「字节跳动、百度、蚂蚁集团、阿里巴巴、阿里通义」 21. 【推理瓶颈诊断】如何判断LLM推理过程中的瓶颈是什么? 「阿里巴巴」 22. 【模型编译技术】为什么很多时候要先把动态图转成静态图再去做融合优化,以及动态图和静态图转换本身的开销怎么处理。 「蚂蚁集团」 23. 【流水线并行】PP推理时,是一个串行的过程,1个GPU计算,其他空闲,有没有其他方式? 「腾讯混元」 24. 【算子优化】算子优化到极致如何判断?能不能继续优化?算子访存效率、计算能到多满,怎么评估? 「百度」 25. 【算子融合】FusedAttention优化怎么做的? 「百度」 26. 【缓存机制】如何设计一个高效的AI模型缓存机制,减少重复计算? 「京东」 27. 【视觉推理优化】若视觉模型在实际部署中推理速度无法满足业务需求(如实时视频分析延迟>100ms),你会如何优化? 「京东」 28. 【训练推理一致性】训练推理一致性相关问题:1. 推理训练的分布不一致怎么解决?2. 训练和推理分离、异步rollout会带来什么收益和风险? 「字节跳动、腾讯混元」 29. 【访存优化】如何通过优化访存来提升性能? 「字节Seed」 30. 【运行时内存管理】运行时的内存管理,(分层设计,内存复用,原地推理)。 「百度」 31. 【长序列处理】推理时若将大量Memory以Token形式给到大模型,Token长度过长该如何处理? 「百度」 **L5 综合与前沿** 1. 【AI编译优化】请说明“AI编译优化”(如TVM、TensorRT)的核心工作流程,对比“基于模板的编译”与“自动搜索的编译”两种技术路线的优缺点,以及在面对异构硬件(CPU+GPU+NPU)时的编译策略设计。 「腾讯」 2. 【MoE推理优化】如何解决MoE推理时的显存带宽瓶颈? 「字节跳动」 3. 【Prefix Cache】如果要做prefix cache,应如何在trie、hash、block table之间选择,为什么? 「字节跳动」 4. 【vLLM】怎么做vLLM的auto tune,有什么方案?手撕vLLM。 「阿里巴巴、阿里通义」 5. 【投机解码】投机采样的加速比分析公式是什么?MoE模型的投机采样会遇到什么性能问题? 「阿里巴巴」 6. 【推理优化总体思路】LLM推理效率问题:部署到在线系统如何解决?从用户请求到模型返回的整个链路经历哪些环节?如何优化降低TTFT、提高吞吐量?Agent推理API低延迟响应系统级优化?情景模拟:评估自动驾驶算法实时性瓶颈、梳理优化方向、设计初步方案、预估效果并汇报。 「京东、美团、阿里巴巴」 7. 【推理优化手段】用LibTorch Java绑定做推理时,如何借助Flink的窗口函数与Java的高效计算,处理时序数据以降低推理latency? 「阿里巴巴」 8. 【推理服务设计】请设计一个支持弹性伸缩的AI推理服务,应对流量高峰。 「京东」 9. 【视觉推理优化】设计计算机视觉推理优化方案,目标是提升“京东科技工业质检系统”的实时性,说明:模型压缩方法(如INT8量化)、推理引擎选择(如TensorRT)、批处理策略及精度损失控制(如量化后准确率下降<1%)。 「京东」 10. 【计算量与访存量】手撕DeepSeek V3的每次推理访存量手算。 「字节跳动」 ## 量化剪枝与蒸馏 **L0 上下文不足(难度待定)** 1. 【上下文不足】这些方法是否会导致其他的问题? 「阿里通义」 **L1 基础认知** 1. 【量化基础概念】模型量化是什么,为什么能加速推理?常见的量化方法有哪些?请谈谈对模型量化的了解。 「字节跳动、百度、腾讯混元、阿里巴巴」 **L2 原理理解** 1. 【LoRA】介绍LoRA。 「字节跳动」 2. 【剪枝】有没有尝试过模型裁剪? 「美团」 3. 【动态量化与静态量化】动态量化与静态量化。 「百度」 4. 【数据类型对比】对比FP32、FP16、BF16、INT8四种数据格式的区别,包括IEEE754标准中的表示方式、优缺点(如精度、范围、内存占用、计算速度),并说明在AI训练和推理中如何选择精度,以及为什么BF16逐渐成为大模型训练的主流选择之一?同时对比int和fp数据类型。 「字节Seed、百度、美团、腾讯混元、阿里通义」 5. 【模型压缩技术概览】模型压缩的必要性与可行性?减小模型内存占用办法?模型压缩加速方法?除了量化,了解稀疏、剪枝、模型蒸馏等技术吗? 「腾讯混元、阿里巴巴」 6. 【知识蒸馏】请介绍知识蒸馏的常见模型、改进方法、蒸馏流程、作用,以及是否考虑过蒸馏或自训练方式? 「字节跳动、百度、美团、腾讯混元」 7. 【量化与剪枝】追问1:如何进行模型量化和剪枝? 「百度」 8. 【量化原理】LLM 量化发挥作用的原理是什么? 「百度、腾讯」 9. 【量化基础概念】什么是模型量化?INT8和INT4量化的区别是什么?会损失多少精度? 「百度」 10. 【量化技术概览】了解哪些模型的量化方法和加速方法?请介绍模型量化和Flash Attention。压缩量化方法有哪些?量化的优点有哪些?权重量化、激活值量化、KV cache量化都有什么好处?大模型推理中的量化技术了解吗?大模型量化的特点。有考虑过量化?大模型的量化? 「字节跳动、快手、百度、腾讯、阿里巴巴」 11. 【量化框架与工具】量化框架与工具。 「百度」 12. 【量化策略选择】量化策略的选择。 「百度」 13. 【量化算法对比】对称量化和非对称量化的区别?量化选用什么算法? 「字节跳动、阿里通义」 14. 【量化精度损失评估】量化后如何评估精度损失?请说明量化带来的精度问题。 「字节跳动、百度」 15. 【量化范围确定】量化范围确定:为什么要按绝对值最大值去决定范围? 「百度」 16. 【量化训练】只做了SFT,没做后续训练是吧,最后有对模型做量化吗? 「腾讯混元」 17. 【量化部署】量化部署:对模型量化部署有了解吗?是否应用过量化或动态批处理等技术? 「京东、腾讯混元」 **L3 实现与应用** 1. 【AWQ原理】AWQ的核心思想与原理。 「小红书、百度」 2. 【INT8量化实现】手写算法:实现INT8 Per-Tensor量化与反量化函数。 「腾讯」 3. 【KVCache量化】如何进行KVCache的INT8量化? 「字节跳动」 4. 【LoRA与QLoRA对比】讲下lora和qlora的区别,具体差异在哪? 「阿里通义」 5. 【PTQ与QAT对比】后量化(Post-Training Quantization)与量化感知训练(Quantization-Aware Training)的区别? 「百度」 6. 【QLoRA】QLoRA相比标准LoRA做了哪些改进?QLoRA是怎么降低资源成本的?QLoRA为什么选择NF4和FP16这组组合?QLoRA在内存优化上的具体实现?层到QLoRA量化。 「京东、百度、美团」 7. 【剪枝】详细讲讲结构化剪枝和非结构化剪枝。 「阿里巴巴」 8. 【数据类型对比】比较INT8、FP8、BF16、FP16、FP32等数据格式的优劣势、精度、动态范围、溢出风险,以及在量化中的表现和适用场景。具体包括:INT8与FP8的优劣势及各自适用场景;BF16、FP16、FP32的差异,FP16与BF16的区别(FP16精度高但易溢出,BF16动态范围大);训练大模型时如何选择(训练常用BF16混合精度,推理用INT8量化加速);除了W4A16,对INT8、FP8等业界常见量化方案的了解。 「百度、蚂蚁集团、阿里巴巴、阿里通义」 9. 【激活值量化】W4A16、W8A8等量化方案中,激活值(Activation)如何量化?请结合Weight-only量化(如W8A16)说明激活值的处理方法。 「字节跳动、阿里通义」 10. 【知识蒸馏】知识蒸馏在大模型压缩中的应用:如何将大模型蒸馏到小模型?黑盒蒸馏(仅使用API)和白盒蒸馏(可访问参数)有什么区别? 「字节跳动、腾讯、阿里巴巴」 11. 【量化原理】模型量化原理:介绍量化算子具体怎么算;如果把一个FP16的权重量化成INT8+FP32 scaling,量化过程怎么理解? 「百度」 12. 【量化实践】不同模型在本地部署和量化时会不会有明显差异?去除了什么冗余权重,int8量化Embedding?如果给你一个还没有量化的模型,要怎么推进量化?根据哪些指标来判断码本是否收敛? 「百度、蚂蚁集团、阿里巴巴」 13. 【量化技术概览】说说你知道的那些针对LLM的量化技法,包括LLM.int8()、SmoothQuant、AWQ、GPTQ等,并说明量化的好处。 「京东、字节Seed」 14. 【量化框架与工具】TensorRT量化。 「百度」 15. 【量化硬件】量化的硬件需要啥 找最大值,除法(倒数和乘法),round。 「腾讯」 16. 【量化策略选择】为什么权重和激活在很多场景下会采用不一样的精度策略?在量化方案选择(如INT8、INT4、GPTQ、AWQ)时,你根据什么标准选? 「百度、阿里巴巴」 17. 【量化算子】大模型量化的目标算子是什么?请详细讲解大模型的量化,包括量化算子。具体地,量化的矩阵乘维度 block 32的话左矩阵 m/32,k,右矩阵k,n/32。 「百度、美团、腾讯」 18. 【量化算法对比】常见的量化方式有哪些,并解释不同量化方式的权衡?另外,QLoRA为什么选择NF4和FP16这组组合,而不是别的组合? 「美团、蚂蚁集团」 19. 【量化粒度】量化粒度:Per-Tensor、Per-Channel和Per-Row量化的区别,权重量化为什么常用Per-Channel? 「腾讯、阿里巴巴」 20. 【量化精度恢复】精度恢复的技术手段:说明模型量化过程中“校准(Calibration)”步骤的核心作用,以及在量化后出现精度下降时,可采取哪些技术手段(如混合精度、量化感知训练)进行优化? 「百度、腾讯」 21. 【量化精度损失评估】你说可以量化,他就问你是模型量化还是向量量化,用什么方法,精度会损失多少。 「字节跳动」 22. 【量化训练】fp16量化训练的策略。 「阿里巴巴」 **L4 优化与诊断** 1. 【8bit量化算法设计】设计8bit量化算法,手写权重训练校准与伪量化过程 「字节跳动」 2. 【AWQ原理】像AWQ这种量化方式,看起来其实给模型增加了很多步骤,比如把BF16压成更低比特,计算的时候又要做一些反量化,那为什么最后整体还是会有加速? 「蚂蚁集团」 3. 【NF4量化】你能说说NF4的分布拟合逻辑吗? 「美团」 4. 【QLoRA量化】QLoRA的NF4量化会不会破坏初始化优势? 「百度」 5. 【SmoothQuant】SmoothQuant的核心思想是什么?它如何通过解决激活值难量化的问题来确保INT8 LLM的精度正确? 「京东、字节跳动、腾讯」 6. 【低比特量化】先问fp4 说了一下mxfp4和nvfp4,但nvfp4记不大清,只知道是两层scale,然后block大小也记不得。 「腾讯」 7. 【模型压缩经验】你有过LLM模型压缩或模型轻量化的经历吗?请分享一个在模型压缩与加速中的实践经验。 「京东、字节跳动」 8. 【模型压缩蒸馏】如何对经过后训练的大模型进行高效的压缩和蒸馏,以适配端侧或低资源部署? 「蚂蚁集团」 9. 【模型压缩部署】多模态模型在移动端部署时,常见的量化(Quantization)和剪枝策略有哪些? 「腾讯」 10. 【知识蒸馏】请分享你在模型蒸馏方面的实践经验。怎么避免蒸馏限制新模型的上限?有没有想过teacher模型logits不可获取的情况下,怎么做OPD?请解释一下知识蒸馏在音视频模型压缩中的应用? 「字节跳动、百度、蚂蚁集团」 11. 【量化技术概览】量化的未来发展方向。 「百度」 12. 【量化推理实现】展开讲自己做的量化推理runtime:做了哪些改动、量化落在哪部分、精度掉了多少、用什么数据集测的;Linear层怎么改、数据结构怎么设计、内存布局怎么处理、正确性怎么验证? 「蚂蚁集团、阿里巴巴」 13. 【量化硬件】先问硬件怎么做量化的。 运算器算完一个tile后反量化。然后等整个内积算完再量化送回存储器。 「腾讯」 14. 【量化策略选择】LLM量化技术INT8、W4A16流程,若数据分布极不均匀(最小值-10000,其余在[-1,1])应选何种量化策略? 「腾讯混元」 15. 【量化算法对比】比较GPTQ、AWQ、TurboQuant等量化算法的核心区别、适用场景及数学/工程技巧。另问:W8A8、FP8、AWQ/W4A16这些方案到底差在哪? 「百度、腾讯、阿里巴巴」 16. 【量化精度恢复】量化:INT4还能怎么救? 「百度文心」 ## CUDA与Triton及算子 **L0 上下文不足(难度待定)** 1. 【上下文不足】设计能让回答关注重点。还问过我写过 CUDA等内容没有(可以看出关注开发能力而不是研究能力)。 「腾讯混元」 **L1 基础认知** 1. 【CUDA编程模型基础】CUDA编程模型基础:请说明CUDA编程模型是怎样的,包括如何求CUDA的thread id,以及能否直接编译执行.cu代码。另外,请列举你写过哪些Kernel。 「字节跳动、快手、腾讯、阿里通义」 **L2 原理理解** 1. 【Block与Thread分配】CUDA Kernel的Block与Thread分配。 「百度」 2. 【Block与Warp关系】block=256和warp的关系是什么? 「百度」 3. 【Constant Memory】Constant Memory的作用是什么?请举例说明在什么场景下适合使用Constant Memory。 「百度」 4. 【CUDA Context】CUDA Context的简介。 「百度」 5. 【CUDA关键字】CUDA关键字_shared_、_device_、_global_的含义和调用关系? 「阿里通义」 6. 【CUDA编程手段】CUDA有哪几种编程手段? 「百度」 7. 【Global Memory到Shared Memory搬运】数据从global memory搬运到shared memory的搬运过程。 「百度」 8. 【NVIDIA硬件基础】nv基础(grid、block、thread、warp、l0cache/l1cache(shared memory)/l2cache/global memory、sram/hbm、tensor core、tma等)。 「字节Seed」 9. 【性能分析工具】开发算子的时候用什么工具进行分析? 「百度」 **L3 实现与应用** 1. 【Bank Conflict】Shared Memory Bank Conflict的定义;请解释shared memory的bank conflict是什么,并说明解决Shared Memory Bank Conflict的方法。 「百度、阿里巴巴、阿里通义」 2. 【CPU算子向量化】优化CPU的算子,向量化指令集。 「百度」 3. 【CUDA优化技术概述】解释CUDA编程中的常见优化技术。 「蚂蚁集团」 4. 【DeepEP】介绍deepep。 「百度」 5. 【DeepGEMM】有没有了解deepgemm? 「阿里巴巴」 6. 【GEMM优化】gemm AI Infra 「字节跳动」 7. 【Global Memory访问优化】如何高效地访问Global Memory? 「百度」 8. 【Kernel Launch开销】CUDA Kernel Launch的耗时来源。 「百度」 9. 【Kernel优化技能点】在kernel优化方面的技能点主要点在哪个part?是在上层针对具体场景,还是kernel本身,还是下层利用硬件特性。 「字节跳动」 10. 【Register Spill】什么是Register Spill?发生Register Spill是好是坏?为什么?如何避免或减少Register Spill? 「百度」 11. 【Shared Memory vs HBM】加载到shared memory和直接从HBM取input比为什么更快(取得数组里面数的数目都是一样的)? 「阿里巴巴」 12. 【Shared Memory使用】为什么这里没有用shared memory? 「百度」 13. 【Warp Shuffle指令】warp的shuffle指令up、down和XOR的使用场景是什么? 「百度」 14. 【向量加法Kernel】手写CUDA Kernel实现向量加法并解释优化思路(核心内容)。需要手写CUDA吗?手撕CUDA;写一道CUDA编程题。 「字节Seed、百度、腾讯、阿里通义」 15. 【循环展开优化】为什么循环展开可以提速? 「阿里巴巴」 16. 【性能分析工具】你有哪些工具(如ncu)可以观察kernel的性能瓶颈?能观察到多细的粒度?如何用这些工具检查访存次数并定位瓶颈? 「百度、蚂蚁集团、阿里巴巴」 17. 【显式拷贝机制】Host to Device、Device to Host这种显式拷贝在今天的框架里到底怎么发生? 「阿里巴巴」 18. 【算子优化手段】常用的算子优化手段? 「百度」 19. 【算子层组织】具体到算子层是怎么组织的? 「阿里巴巴」 **L4 优化与诊断** 1. 【CUDA算子融合】有没有做过kernel级别的优化?比如用CUDA做算子融合? 「百度」 2. 【CUDA资源调度】训练框架底层,如何调度cuda资源? 「阿里巴巴」 3. 【FlashAttention Kernel】FlashAttention的cuda kernel核心逻辑? 「阿里巴巴」 4. 【Fused Norm算子】代码题是CUDA or Triton实现一个fuse的norm算子。 「字节跳动」 5. 【GEMM优化】GEMM 为什么能做到 95+% cuBLAS?GEMM算子有哪些主流优化思路,我有没有实践过?写CUDA GEMM算子:实现一个base版本,并讲解优化方法(包括一个thread算多个数、数据复用、访存合并、双buffer边读边算、避免bank conflict),同时讲评估指标。 「字节跳动、美团、腾讯混元、蚂蚁集团」 6. 【Independent Thread Scheduling】什么是Independent Thread Scheduling?它是如何实现的?在CUDA中如何利用这种机制优化性能? 「百度」 7. 【Kernel性能分析】一个kernel内部(不考虑memcpy、malloc预分配好的内存耗时)运行时如何分析算子性能? 「百度」 8. 【Marlin算子】极速反量化的marlin算子了解过吗? 「阿里巴巴」 9. 【Reduce实现与优化】手撕CUDA reduce,要求实现block reduce,并使用warp shuffle优化,能否进一步优化?变体:对二维矩阵的每一行做reduce;输入为[N, C, H, W] = [128, 16, 256, 256],输出为[N, H, W];输入为(1000000,128)矩阵,reduce到(1,128)。 「字节跳动、百度、阿里巴巴」 10. 【Softmax优化】CUDA softmax 优化。 「百度」 11. 【SRAM与HBM带宽优化】它们如何利用GPU SRAM与HBM之间的带宽瓶颈进行优化? 「字节跳动」 12. 【Tiled MatMul】写代码题:tiled matmul。 「字节Seed」 13. 【Tilelang vs Triton】Tilelang和Triton有哪些性能差异,为什么,问我有没有自己上手验证过。 「腾讯混元」 14. 【Tiling Block Size选择】你的tiling block size怎么选的?为什么这样选? 「阿里巴巴」 15. 【Timing插件实现】你在实习里写的一个timing插件,为什么要写,它底层是怎么实现的,解决了什么问题,以及为什么不用Nsight、NCU这种profiling工具直接做。 「蚂蚁集团」 16. 【Transpose Kernel设计】多维tensor的transpose kernel怎么设计,是否需要根据i, j的位置设计不同的kernel。 「字节跳动」 17. 【前缀和实现】写cuda算子:前缀和。实现一个base的,讲优化方法。 「美团」 18. 【卷积IM2COL+GEMM】卷积的实现IM2COL+GEMM。 「百度」 19. 【算子优化极致判断】如何判断算子优化到极致? 「百度」 **L5 综合与前沿** 1. 【MMA与ldmatrix布局】解释mma和ldmatrix在cutlass CuTE中的thread value layout。 「阿里巴巴」 2. 【Triton实现Online Softmax Attention】用Triton实现一个tiling加online softmax的Attention kernel,在SRAM上完成局部计算避免中间矩阵写入HBM,对比标准PyTorch实现,在seq_len等于2048的设定下HBM读写量减少了百分之六十。 「阿里巴巴」 3. 【矩阵乘+ReLU融合】从硬件适配、数据布局、指令调度三个维度,说明矩阵乘+ReLU融合算子的关键优化思路。 「腾讯」 4. 【自定义CUDA显存分配器】现场想一个更灵活有效的显存分配方式cudaAllocator。 「百度」 5. 【跨架构算子设计】在AI Infra底层硬件适配中,需考虑不同芯片架构(如x86、ARM、RISC-V)的指令集差异。请以“卷积算子”为例,说明如何设计跨架构兼容的算子实现方案,同时兼顾不同硬件的性能优势? 「腾讯」 6. 【量化GEMM算子实现】用CUDA/Triton/Tilelang/任何我可以的语言实现一个quant GEMM算子。 「腾讯混元」 ## 模型部署与服务 **L0 上下文不足(难度待定)** **上下文不足** 1. 如果一个 P 的队列空了会怎么办? 「百度」 2. 它如何平衡不同请求的优先级和资源分配? 「百度」 3. 应从哪些工程侧做限制? 「字节跳动」 4. 推理部署细节是什么? 「美团」 5. 用户端侧不需要调这个大模型的api吧 「美团」 6. 部署设备配置是什么? 「百度」 **L2 原理理解** 1. 【K8s监测插件】k8s里面的cAdvisor和DCGM exporter监测插件是什么? 「阿里巴巴」 2. 【llama.cpp】llama.cpp了解吗? 「字节跳动」 3. 【PD分离概念】pd分离(没细问,简单说说怎么回事)? 「字节Seed」 4. 【Sandbox】sandbox了解过吗? 「阿里巴巴」 5. 【向量存储位置】向量是存在本地吗? 「美团」 6. 【推理框架使用经验】你在项目中用过哪些模型推理框架?请列举大模型推理部署的主流框架。vLLM用过吗?vLLM API Server?线上推理用的是什么? 「字节跳动、腾讯混元、阿里巴巴」 7. 【日志结构化】日志怎么结构化? 「美团」 8. 【本地AI coding】你本地能不能AI coding? 「阿里通义」 9. 【线上高峰吞吐量】线上高峰吞吐量大概是多少? 「字节跳动」 10. 【训练与推理区别】大模型训练和推理的区别 「字节跳动」 **L3 实现与应用** 1. 【Agent部署问题】Agent部署时遇到哪些问题? 「美团」 2. 【AI服务完整流程】能描述一下从用户请求、模型训练到在线serving的完整流程吗? 「字节跳动」 3. 【API超时与报错处理】如果遇到api超时和报错怎么解决? 「字节跳动」 4. 【DCGM监控告警】DCGM监控告警怎么搭? 「美团」 5. 【K8s配置与指标注入】怎么修改k8s里面的config正则表达来注入指标? 「阿里巴巴」 6. 【PD分离推理框架】PD分离推理框架:vLLM / TensorRT (Sglang了解不多) nano-vLLM。 「百度」 7. 【Pod自动恢复】Pod挂了怎么自动恢复? 「美团」 8. 【Text Generation Inference】Text generation inference的优点、缺点、功能有哪些?以及如何使用docker运行web server? 「腾讯混元」 9. 【Token成本控制】如何控制AI业务的Token成本?从分块、提示词、缓存、模型选型多维度说明。 「阿里通义」 10. 【vLLM启动参数】VLLM启动服务时到底会传哪些常见参数? 「百度」 11. 【vLLM请求调度】VLLM作为服务框架,提出的请求调度机制主要解决了什么问题? 「百度」 12. 【代码沙箱执行】代码(沙箱)是怎么执行的,是本地吗?怎么确保代码执行的环境存在? 「蚂蚁集团」 13. 【可观测性维度】日志、链路追踪、指标监控覆盖哪些维度? 「美团」 14. 【向量化服务要求】向量化服务是整个流程的关键环节之一,你认为向量化服务需要满足哪些性能或质量要求? 「美团」 15. 【向量数据库选型】为什么选择Milvus,有没有了解其他向量数据库? 「京东」 16. 【多模态模型部署经验】你有过将多模态模型部署到生产环境的经历吗? 「京东」 17. 【大模型工程难点】大模型应用开发中,你认为最大的工程难点是什么? 「美团」 18. 【异常fallback策略】是否有异常fallback策略? 「阿里巴巴」 19. 【推理框架对比】推理框架对比:SGLang和vLLM在推理服务中分别适合什么场景?Ollama和vLLM区别在哪儿?为何选择vLLM? 「字节跳动、百度、腾讯混元」 20. 【推理框架特点与设计理念】推理框架的特点和设计理念,以及与传统框架不同的地方。 「百度」 21. 【推训一致性】推训一致性? 「蚂蚁集团」 22. 【模型上线资源消耗评估】模型上线有多少资源消耗? 「腾讯」 23. 【模型参数量与硬件需求】模型部署相关,说下模型部署的参数量和需求硬件之间的关系 「美团」 24. 【模型大小选择】模型大小如何选择? 「腾讯混元」 25. 【模型工具层优化】别人的模型,再加一些工具层优化? 「字节Seed」 26. 【模型部署与调优经验】有没有做过模型的部署和调优? 「阿里巴巴」 27. 【模型部署经验教训】请分享你在模型部署过程中的经验教训。 「蚂蚁集团」 28. 【离在线链路架构】离在线链路是分离的还是统一的? 「字节跳动」 29. 【算子与推理框架关系】是否了解算子和推理框架之间的关系? 「百度」 30. 【系统分层设计】为什么你的系统要分层设计而不是一次性让大模型生成最终业务输出结果? 「蚂蚁集团」 31. 【线上推理流程】介绍线上推理流程。 「百度」 32. 【线上部署性能问题】线上部署时有没有遇到性能问题? 「京东」 33. 【自动回滚恢复】如何自动检测并进行回滚恢复? 「字节跳动」 34. 【训推分离收益】训推分离有什么收益? 「字节跳动」 35. 【配置管理模块实现】实现配置管理模块,后端模型服务可使用Mock。 「蚂蚁集团」 **L4 优化与诊断** 1. 【AI平台安全】请描述一个你处理过的AI平台安全问题的案例,以及你的解决方案。 「京东」 2. 【K8s算力调度与数据适配】如果不同业务部门的数据格式依赖偏好不同,怎么做在k8s里做算力调度支持? 「阿里巴巴」 3. 【K8s部署大模型挑战】在Kubernetes上部署AI大模型遇到的最大挑战是什么,如何解决? 「腾讯」 4. 【PD分离与混合部署】详细讲PD分离。推理框架层的问题,PD混合怎么做? 「美团、阿里巴巴」 5. 【Router机制】router以什么方式存在?其启动方式及数据流到来时的具体处理流程(包括函数名)是什么?router的策略是什么? 「字节Seed」 6. 【vLLM稳定性与高效性】VLLM在大规模训练中,如何确保稳定性和高效性? 「腾讯」 7. 【vLLM部署与调优】怎么用vLLM部署并调优一个推理服务? 「美团」 8. 【云平台与自建平台对比】你如何看待云厂商的AI平台(如SageMaker, VertexAI)和自建平台之间的取舍(Build vs. Buy)? 「美团」 9. 【低延迟高吞吐技术选型】客户要求同时满足低延迟和高吞吐,如何进行技术方案选型? 「腾讯」 10. 【向量索引系统改造】假如你要引入向量索引系统,在线serving服务要做什么改造? 「腾讯」 11. 【大模型推理算力分配与负载均衡】对DeepSeek 671B模型进行推理时,是如何做算力分配和负载均衡的? 「字节跳动」 12. 【工程优化与模型微调权衡】你们会怎么判断这个问题是通过工程链路优化就够了,还是需要做模型微调和训练? 「字节Seed」 13. 【推理服务自动扩缩容】如何设计一个AI推理服务的自动扩缩容策略? 「腾讯」 14. 【推理框架搭建】推理框架是如何搭建的? 「阿里通义」 15. 【插件与底层profiling】为什么要做成插件里的补丁,而不是直接做进更底层的profiling工具里? 「百度」 16. 【模型Serving设计】什么是模型serving,如何设计一个高性能的模型serving系统? 「蚂蚁集团」 17. 【模型版本回滚机制】如何设计一个高效的AI模型版本回滚机制,确保快速恢复? 「京东」 18. 【模型精度与部署效率权衡】计算机视觉研发需平衡“模型精度”与“部署效率”,你会如何权衡? 「京东」 19. 【模型部署兼容性问题】请描述一个你解决过的AI模型部署兼容性问题的案例。 「京东」 20. 【模型部署性能瓶颈排查】如果在模型部署过程中出现性能瓶颈,你会如何解决? 「字节跳动」 21. 【沙箱与监控实现】沙箱、监控怎么做的? 「美团」 22. 【特征生产与快照流转】特征生产,快照流转的完整架构是怎样的? 「腾讯」 23. 【线上AI系统故障排查与修复】线上AI系统常见故障:超时、报错、上下文溢出、幻觉频发,如何排查与修复? 「阿里通义」 24. 【线上推理系统故障排查】描述一次线上推理系统的故障排查经历。 「蚂蚁集团」 25. 【线上故障定位】如何区分线上问题是检索故障、模型生成故障还是业务数据故障? 「美团」 26. 【自动驾驶算法工程化】作为校招自动驾驶算法工程师,如何协助开展算法的工程化落地与测试验证工作?请说明核心协助方向(如算法代码优化、数据采集与处理、仿真测试场景搭建、实车测试数据分析)、常用方法及注意事项? 「京东」 27. 【边缘与端侧模型部署优化】在大模型部署到边缘设备、车载、端侧、移动端(如京东APP)或资源受限环境时,你会采取哪些优化措施?请分别说明部署方式、考虑因素及具体优化方案。 「京东、字节跳动、百度、蚂蚁集团」 28. 【高并发模型服务处理】模型面对高并发的时候如何处理? 「百度」 **L5 综合与前沿** 1. 【Agent沙箱设计】如果想做Agent的沙箱环境秒级启动应该怎么设计,具体讲一下其中的并发弹性调度、会话级状态保持及强安全隔离。 「阿里巴巴」 2. 【LibTorch Java与Flink集成】基于LibTorch Java绑定构建的训练/推理框架,如何适配Flink的动态扩缩容与容错机制,结合Java的生态优势确保训练/推理不中断并提升系统整体可用性?需说明如何利用Java优势提升框架稳定性。同时,如何优化LibTorch Java绑定在Flink集群中的资源占用,结合Spring AI的配置管理,实现高性能推理?如何让Spring AI调用LibTorch Java绑定推理时,与Flink的流数据处理无缝衔接,减少数据传输延迟?如何在Spring AI中封装LibTorch Java绑定的推理接口,配合Flink的Checkpoint机制,确保推理结果可回溯?另外,用Spring AI整合LibTorch Java绑定时,如何优化模型参数传递效率,配合Flink提升高并发场景下的推理性能?同时,如何解决模型加载与Flink任务调度的协同问题,以加速推理响应? 「阿里巴巴」 3. 【LoRA权重快速切换】假设要在腾讯云上提供一个支持企业用户高度自定义微调(如LoRA)的多模态API集群服务,如何设计底层的模型加载架构,以支持数万个不同客户的LoRA权重实现毫秒级快速切换,且不会造成服务器显存瓶颈? 「腾讯」 4. 【千万级用户实时推理系统】设计一个支持千万级用户的实时AI推理系统。 「蚂蚁集团」 5. 【多模态统一服务平台】如何设计一个支持多模态模型的统一服务平台?同时支持实时和离线模型。 「京东」 6. 【多租户AI平台架构】请设计一个支持多租户的AI平台架构,确保资源隔离和公平调度。 「京东」 7. 【大模型推理HTTP网关】实现一个面向大模型推理场景的HTTP网关,支持:智能路由、负载均衡、KVCache感知调度。 「蚂蚁集团」 8. 【大模型部署方案】两台8卡H100做700B部署,精度FP8,要求TTFT<2秒,TPOT在50ms内,不能调节max-num-seqs等参数,有什么方案? 「阿里巴巴」 9. 【大规模AI集群SLA与稳定性】怎么保证大规模AI集群的SLA与稳定性,灰度发布、熔断及故障演练机制? 「腾讯混元」 10. 【端侧模型精度下降协同优化】对于端侧(如手机微信内部)部署的极轻量化视觉语言模型,如果发现在特定的垂类场景(如单据票据OCR理解)上精度下降严重,你会如何在云端和端侧分配重新训练或微调的负载链路? 「腾讯」 11. 【高可用大模型推理服务】设计高可用大模型推理服务;如何设计一个高可用的模型服务化平台,确保99.99%的SLA? 「京东、字节跳动」 12. 【高并发服务优化】高峰期用户咨询卡顿、Agent响应超时,LLM推理耗时波动极大,如何从服务架构、队列策略、缓存、降级四层做全链路优化?同时,高并发场景下,Agent服务如何做限流、降级、熔断、缓存优化? 「美团」 ## GPU与硬件架构 **L0 上下文不足(难度待定)** 1. 【上下文不足】CPU侧和GPU侧各怎么计? 「百度」 **L1 基础认知** 1. 【GPU资源分配与调度】组内卡多少,每个人平均能用多少?这边是否有独占的卡池,排队时间大概怎么样? 「腾讯、阿里通义」 2. 【PPU定义】PPU是什么卡? 「腾讯」 3. 【训练GPU与框架】实际训练使用什么GPU,单卡显存是多少?是否用过其他厂商的芯片?用什么卡部署的?用的什么卡什么训练框架?用的训练资源? 「字节跳动、百度、阿里巴巴、阿里通义」 **L2 原理理解** 1. 【AI PC芯片】有没有具体了解一些AIPC芯片? 「百度」 2. 【CPU与GPU架构对比】CPU与GPU在架构设计上有哪些主要区别?为什么GPU更适合大规模并行计算和AI训练,而CPU更适合低延迟任务? 「京东、百度」 3. 【CPU存储层次】CPU的存储层次结构是什么样的(如寄存器、L1/L2/L3缓存、主存等)?它们之间的速度、容量和访问延迟有什么特点? 「百度」 4. 【CPU峰值算力计算】如何计算CPU的峰值算力?例如,对于一个4核CPU,主频为3.0GHz,每个周期可以执行4条浮点指令,其峰值算力是多少? 「百度」 5. 【CPU并行策略】CPU的并行策略。 「百度」 6. 【CPU缓存结构】CPU Cache的组织结构。 「百度」 7. 【cspuid】cspuid的含义是什么? 「美团」 8. 【GPU基本执行单元与线程调度】1. 是否有过性能测试和其他卡的对比?请说明测试结果。 2. GPU的基本执行单元是什么? 3. 线程块和warp的关系是什么? 「快手、腾讯」 9. 【GPU存储层次】GPU的存储层次结构是什么样的(如寄存器、Shared Memory、Local Memory、Global Memory等)?它们之间的速度、容量和访问延迟有什么特点? 「百度」 10. 【GPU高吞吐设计】GPU从哪些方面体现出自己是以提高吞吐量为中心的?请阐述其高吞吐设计。 「百度」 11. 【Nsight工具】Nsight了解吗? 「阿里巴巴」 12. 【PCIe与NVLink】什么是PCIe、NVLink,它们对训练性能有何影响? 「蚂蚁集团」 13. 【Tensor Core与CUDA Core】Tensor core和CUDA core的区别。 「百度」 14. 【内存与显存区别】内存和显存的区别? 「阿里巴巴」 15. 【基座模型硬件选型】你这里选用的基座模型用的什么卡? 「百度」 16. 【壁仞卡CUDA兼容性】壁仞卡是否兼容CUDA? 「阿里通义」 17. 【操作类型与计算限制】大矩阵相乘和求和类操作分别属于哪类限制(memory bound 或者 compute bound)? 「字节Seed」 18. 【模型训练资源需求】32B模型训练用了多少显卡? 「腾讯」 19. 【浮点数格式对比】浮点数格式对比:FP32、FP16和BF16的区别? 「百度」 20. 【能效比】AI-HPC中的能效比。 「百度」 21. 【芯片峰值算力】BR166的峰值算力是多少? 「阿里通义」 **L3 实现与应用** 1. 【AI集群监控指标】监控AI集群需要关注哪些关键指标? 「腾讯」 2. 【Burst传输对齐】burst length = 5,第一笔不对齐,下游要传几笔? 「字节Seed」 3. 【CPU Cache Line与GPU Sector对比】CPU的Cache Line是64 Bytes,GPU的一个Sector通常是多少?它们在设计上有哪些不同? 「百度」 4. 【CPU并行策略】CPU上有哪三大并行策略(如指令级并行、数据级并行、线程级并行)?请分别举例说明它们的应用场景和实现方式。 「百度」 5. 【CPU延迟优化设计】CPU从哪些方面体现出自己是以降低延迟为中心的?例如分支预测、缓存设计、流水线等技术是如何减少延迟的? 「百度」 6. 【CPU流水线级数】CPU流水线级数的影响:是否越多越好?增加流水线级数会带来哪些优点(如提升主频)和缺点(如分支预测失误的惩罚增加)? 「百度」 7. 【CPU访存优化】CPU访存优化方法。 「百度」 8. 【GPU Warp调度】发射很多个线程,GPU如何调度选择实现哪个Warp? 「百度」 9. 【GPU型号对比与选型】AI芯片发展趋势(ASIC、FPGA等);不同代GPU架构特点(Volta、Ampere、Hopper等);加速卡如何选择?对比A100和H20的算力、通信性能,以及与NVIDIA卡的区别。 「腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 10. 【GPU存储层次】数据从global memory放到local memory要过L1、L2 cache。 「百度」 11. 【GPU并行与协作】GPU与CPU的协作优化;GPU的并行计算优势。 「百度」 12. 【GPU异步同步】GPU上的异步与同步。 「百度」 13. 【GPU性能与能效优化】GPU的性能优化方法;GPU的能效比优化。 「百度」 14. 【GPU流多处理器与线程束】详细讲讲GPU里面的流多处理器,讲讲线程束? 「阿里巴巴」 15. 【GPU生态对比】不同GPU生态的差别? 「阿里巴巴」 16. 【Hopper架构精度支持】H20的hopper架构对什么数据精度格式的算力支持/优化更好? 「阿里巴巴」 17. 【IndependentThreadScheduling】IndependentThreadScheduling的概念。 「百度」 18. 【K8s GPU管理】K8s上怎么管理GPU资源? 「美团」 19. 【Memory-bound判断指标】如何判断memory-bound?用什么指标判断? 「阿里巴巴」 20. 【RegisterSpill】RegisterSpill的定义与影响。 「百度」 21. 【Roofline模型】Roofline分析? 「阿里巴巴」 22. 【SIMD与SIMT区别】SIMD(单指令多数据)和SIMT(单指令多线程)的主要区别是什么?SIMT如何更好地适应CUDA编程模型? 「百度、腾讯」 23. 【Warp与SM Occupancy】Warp和SM activity/SM active/SM occupancy的关系? 「阿里巴巴」 24. 【X86与ARM架构对比】X86和ARM架构在深度学习侧的区别? 「腾讯混元」 25. 【内存通道设计】为什么写有三个通道、读有两个通道? 「字节Seed」 26. 【单卡训练LLM要求】想要训练1个LLM,如果只想用1张显卡,那么对显卡的要求是什么? 「腾讯混元」 27. 【卡间通信】卡与卡之间通信。 「百度」 28. 【国产芯片适配】910B适配过程中遇到的问题? 「京东」 29. 【处理器性能评估】如何评估处理器性能? 「字节Seed」 30. 【异构集群设备profile】异构集群中的设备profile应该包含什么? 「阿里通义」 31. 【统一地址空间与显式地址空间】统一地址空间和显式地址空间的差别是什么? 「阿里巴巴」 **L4 优化与诊断** 1. 【AI基础设施评估】你认为京东目前的AI基础设施是否足以支撑未来的大模型战略? 「京东」 2. 【AI基础设施趋势】AI Infra领域的技术趋势,边缘计算和Serverless AI平台的发展方向 「腾讯」 3. 【AI芯片架构对比与适配】AI芯片(如NVIDIA H100、国产芯片)的架构差异及优化策略;华为的卡和N卡有何异同,架构上,场景上,强项上?国产GPU(摩尔线程等)与NVIDIA架构在MUSA/CUDA算子移植、通信库适配中的差异与坑点;国产AI芯片在集群部署中的显存隔离(MIG/cGPU类)、驱动兼容性及生态适配难点;异构加速卡适配如何验证?技术选型时面对MUSA新特性与稳定CUDA生态的取舍,考虑的维度有哪些?如果在模型部署过程中遇到硬件兼容性问题,你会如何处理?使用华为的框架和显卡进行SFT有没有遇到什么问题? 「京东、字节跳动、腾讯、腾讯混元、阿里通义」 4. 【GPU监控与性能优化】AI Infra中监控GPU利用率、显存、IB网络丢包、PCIe抖动的关键指标及Prometheus+DCGM落地;如果DCGM和NVML不够,如何利用Nsight System和Nsight Compute进行多卡集群性能优化分析?需要查看更底层的硬件指标怎么办?多卡集群GPU指标监测怎么设计?如何定位和优化GPU利用率低的问题?GPU拓扑感知调度(NVLink/PCIe)在K8s中的实现难点及缓存亲和性场景题,以及MIG切分是怎么配的? 「百度、百度文心、美团、腾讯混元、蚂蚁集团、阿里巴巴」 5. 【RDMA网络与选型】RDMA在AI集群中的优势,RoCE与InfiniBand的选型对比及丢包影响,以及如何调优? 「腾讯、腾讯混元」 6. 【Tensor Core与CUDA Core活跃度及退化判断】详细解释一下tensor core active和cuda core active,根据这些管线指标如何判断LLM推理有没有因为精度或者维度不匹配而发生退化? 「阿里巴巴」 7. 【模型参数量计算】手撕DeepSeek V3的参数量手算 「字节跳动」 **L5 综合与前沿** 1. 【GPU资源调度与配额系统设计】如何设计一个GPU资源调度系统?如何设计一个支持多租户的GPU资源配额系统? 「腾讯、蚂蚁集团」 2. 【下一代Infra硬件协同】下一代Infra硬件协同设计:下一代“积木”本身该长成什么样,即更偏下一代infra和硬件协同设计的问题?如果让你来设计下一代的AI芯片或服务器,你会关注哪些特性? 「美团、阿里巴巴」 3. 【大模型Infra挑战】从Infra的角度看,未来的大模型技术(比如MoE架构、多模态)会带来哪些新的挑战和机遇? 「美团」 4. 【端到端模型适配低算力】如果不给你用英伟达的GPU,或者只能用地平线的J6(征程6),你会怎么设计你的端到端模型来适配这种“贫瘠”的算力? 「字节跳动」 ## 工程框架 **L1 基础认知** 1. 【AI编码工具】你平时的AI Coding工具是什么? 「腾讯」 2. 【PaddlePaddle框架】会paddle吧? 「百度」 3. 【PyTorch核心功能】是否了解pytorch?PyTorch核心的基础功能是什么? 「快手、百度」 4. 【职业方向偏好】未来希望做算子还是框架? 「百度」 **L2 原理理解** 1. 【CC使用经验】cc的使用习惯和心得? 「字节Seed」 2. 【CC压缩阈值】cc默认超过百分之多少会自动压缩? 「字节Seed」 3. 【Harness与循环工程】讲一下harness,loop engineering这些名词。 「百度文心」 4. 【动态图与静态图区别】简述PyTorch中动态图与TensorFlow静态图的本质区别。 「京东」 5. 【开源框架使用经验】是否真正用过verl、vLLM、Ray、DeepSpeed?用过哪些开源框架,DeepSeed,PyTorch等? 「字节Seed」 6. 【微调框架选择】直接用PEFT库,还是用LLama Factory做的? 「蚂蚁集团」 7. 【数据加载器与采样器】torch dataloader和data sampler区别?Dataloader,有哪些函数? 「腾讯、腾讯混元」 8. 【计算图工作原理】计算图是如何工作的? 「快手」 **L3 实现与应用** 1. 【AI基础设施新技术】最近在学的AI Infra相关新技术(如Serverless推理、异构调度、FP8训练、dspark架构)?有没有关注infra最新进展? 「腾讯混元、阿里巴巴」 2. 【PyTorch GPU资源管理】(追问)是否尝试用PyTorch管理GPU资源? 「快手」 3. 【TensorFlow插件与PyTorch扩展对比】TensorFlow插件机制为什么让人觉得麻烦,和PyTorch的extension比起来差别在哪? 「阿里巴巴」 4. 【中间结果依赖处理】如果一串算子里有中间结果被别的分支依赖,那你怎么办? 「阿里巴巴」 5. 【变长序列处理】Pytorch中如何处理变长输入(如不同的轨迹长度)?具体说明pack_padded_sequence和pad_packed_sequence的用法陷阱。 「字节跳动」 6. 【数据加载流水线优化】大模型或深度学习的数据预加载怎么做?如何优化数据加载pipeline? 「蚂蚁集团、阿里巴巴」 7. 【模型版本管理】请描述一个你处理过的AI模型版本管理问题,以及你的解决方案。 「京东」 8. 【混合专家模型框架实现】MOE架构在框架中是怎么做的? 「百度」 9. 【组批后算子处理】组batch之后算子层是怎么做的? 「百度」 10. 【自动微分实现】PyTorch的自动微分是怎么实现的? 「百度」 11. 【自动机器学习训练】你有了解过用AI来auto训练模型吗,把你知道的都说一下。 「字节跳动」 12. 【训练框架使用与选型】常用什么训练框架?训练框架如何选型? 「字节跳动、腾讯混元」 **L4 优化与诊断** 1. 【AI基础设施团队管理】如何管理AI Infra团队的技术路线和技术债务? 「腾讯」 2. 【AI基础设施性能瓶颈】请描述一个你在AI基础设施项目中遇到的性能瓶颈问题,以及你是如何分析和解决的? 「京东」 3. 【AI系统架构概念】在设计一个复杂AI系统时,engine、 sub-engine、skil这些概念你会怎么理解和划分? 「字节跳动」 4. 【AI训练存储系统】如何选择合适的存储系统用于AI训练? 「蚂蚁集团」 5. 【Gang调度器实现】手写算法:实现一个简单的Gang Scheduler调度算法。 「腾讯」 6. 【Kubernetes Operator与CRD】Kubernetes Operator开发经验,如何设计CRD管理训练任务生命周期与弹性伸缩? 「腾讯混元」 7. 【平台工程与研发效率】平台工程在AI Infra中的实践,如何提升研发效率? 「腾讯」 8. 【数据加载性能优化案例】请描述一个你优化AI训练数据加载性能的案例,包括具体的技术手段和效果。 「京东」 9. 【机器学习CI/CD流程】如何实现ML模型的CI/CD流程? 「蚂蚁集团」 10. 【流水线并行性能分析】写pp的时候如何profile的? 「字节Seed」 11. 【特征存储系统设计】如何设计一个高效的特征存储系统(Feature Store)? 「蚂蚁集团」 12. 【训练全流程搭建】能不能搭建数据、训练、rollout 和评测流程? 「字节Seed」 13. 【训练框架源码分析】对着训练框架源码讲解算法实现。 「腾讯」 14. 【训练流水线评估与优化】如何评估和优化端到端的训练pipeline? 「蚂蚁集团」 **L5 综合与前沿** 1. 【MLOps平台设计】如何设计一个高效的MLOps平台,来管理大模型的整个生命周期(从数据准备、模型训练、到上线部署)? 「美团」 ## 其他AI系统 **L2 原理理解** 1. 【AI基础设施实习贡献】介绍相关实习的AI Infra技术工作及核心贡献。 「阿里巴巴」 **L3 实现与应用** 1. 【大规模多模态数据挑战】在处理大规模多模态数据时,你遇到过哪些存储和计算挑战? 「蚂蚁集团」 **L4 优化与诊断** 1. 【模型性能优化】算法设计:如给定场景优化模型性能。 「腾讯混元」 # 数据与评测 ## 数据采集与清洗 **L0 上下文不足(难度待定)** **上下文不足** 1. 训练数据? 「阿里巴巴」 2. 这个问题后,你会用什么数据和训练方法四、线上用户Log数据筛选与训练价值判断? 「字节Seed」 3. 这个问题后,你会用什么数据和训练方法提高这部分能力? 「字节Seed」 **L1 基础认知** 1. 【合成数据使用】有合成数据吗? 「腾讯」 2. 【大规模数据处理经验】大规模数据处理有做过吗? 「腾讯」 3. 【数值型数据类型】你说的那些数值型数据有哪些? 「字节跳动」 4. 【数据分布描述】数据分布是什么样的 「百度」 5. 【数据来源】数据来源相关问题:1. 使用的数据集是什么?数据集的来源是哪里?2. 数据来源是什么? 「京东、百度、蚂蚁集团、阿里巴巴」 6. 【数据量级】数据量级相关问题:1. 会有多少的人工标注参与,最终量级有多大?2. 你们一天会产生多少的数据呢?3. 后训练的数据规模有多少?4. 数据库中有多少数据?5. 数据量级是多少? 6. 数据集有多大?7. 线上每天多少数据?8. 分别大概用多少数据量? 「京东、百度、美团、腾讯、腾讯混元、蚂蚁集团」 7. 【数据集构成】数据集的构成是什么? 「百度」 8. 【标签来源】标签是人打的嘛?还是谁打的? 「阿里巴巴」 **L2 原理理解** 1. 【不同信号数据类型】按不同信号下的数据类型分开讲?请分别说明不同信号数据类型的特点。 「字节Seed」 2. 【图像视频数据筛选工具】图像、视频筛选数据的工具你用过哪些?请列举并简要说明。 「蚂蚁集团」 3. 【数据Shuffle必要性】数据shuffle的必要性是什么?请解释其作用。 「阿里通义」 4. 【数据增广方法】有没有考虑做数据增广,有哪些数据增广的方式?请列举常见方法。 「百度」 5. 【数据层级岗位理解】这个岗位主要做数据层级,你对岗位方向有什么理解?请谈谈你的认识。 「字节跳动」 6. 【数据清洗与均衡采样目的】为什么要做数据清洗与均衡采样?请说明目的和必要性。 「阿里巴巴」 7. 【数据筛选与清洗逻辑】筛选逻辑是什么?清洗逻辑是什么?请分别说明数据筛选和清洗的逻辑。 「京东、百度」 8. 【样本选择偏差】什么是样本选择偏差?请解释其概念及影响。 「阿里通义」 9. 【正负样本来源】正负样本从哪里来?请说明正负样本的来源和获取方式。 「美团」 10. 【用户调研对象选择】用户调研具体会找什么样的用户?请说明用户调研对象的选择标准。 「字节Seed」 11. 【线上数据采样方法】线上数据怎么采样的?请说明线上数据采样的方法。 「美团」 12. 【训练数据准备】训练数据是怎么准备的?请说明训练数据准备的流程。 「百度文心」 13. 【训练数据清洗】训练数据如何清洗?请说明训练数据清洗的步骤和方法。 「美团」 14. 【训练语料获取与规模】训练语料怎么获取的,有多少?请说明训练语料的获取方式和规模。 「京东」 **L3 实现与应用** 1. 【ETL逻辑灵活性】为什么不用写死的ETL逻辑? 「阿里巴巴」 2. 【LLM训练数据处理观点】对于LLM训练中的数据处理是咋看的。 「腾讯」 3. 【Minhash原理与桶定义】minhash原理是什么?minhash中的桶指的是什么,怎么定义? 「腾讯」 4. 【Prompt获取渠道】哪些渠道可以规模化获取prompt? 「字节Seed」 5. 【SFT数据清洗与质量过滤】SFT数据清洗的流程,质量过滤如何做? 「字节跳动、美团」 6. 【插桩对执行流影响】插桩本身会不会影响原来的执行流、会不会让结果产生偏差? 「百度」 7. 【数据不平衡处理】数据不平衡如何处理? 「美团」 8. 【数据分布多样性保证】怎么保证数据分布的多样性? 「字节Seed」 9. 【数据收集后分析处理】收集后该如何分析处理? 「字节跳动」 10. 【数据清洗策略与筛选】如何进行数据清洗?采用了什么策略?有没有数据筛选或清洗? 「京东、字节跳动、腾讯、蚂蚁集团」 11. 【数据筛选与训练价值评估】log,你会怎么筛选数据,确保筛选出来的数据有训练价值? 「字节Seed」 12. 【数据采集与清洗】数据处理与清洗全流程:包括AI实现方法、数据采集与分布影响、数据清洗与有效性验证、噪音清洗、数据集处理与清洗、标签清洗流程与效果、样本与特征一致性、样本落盘机制、从数据爬取到模型训练的详细流程、知识库数据来源与构建流程、人设冲突清洗规则、从用户行为日志抽取训练对话、预训练数据选择。请详细说明每个环节的具体做法、规则、效果及对成功率的影响。 「京东、字节Seed、字节跳动、百度、腾讯」 13. 【数据集准确性保证】怎么保证构建数据集的准确性 「百度」 14. 【时序数据集划分】如果一个时序的数据集怎么划分测试集和训练集? 「蚂蚁集团」 15. 【时空数据收集方法】提到的收集时空两方面的数据,如何收集? 「字节跳动」 16. 【测试数据增强技术】请分享一个你在测试中使用的数据增强技术。 「京东」 17. 【测试数据多样性与代表性】请描述你如何确保测试数据的多样性和代表性? 「京东」 18. 【测试环境真实性与可控性】请描述你如何确保测试环境的真实性和可控性? 「京东」 19. 【点击定义不一致处理】不同场景对于点击的定义不太一样怎么办? 「字节跳动」 20. 【用户不满意样本提取】如何提取用户不满意回答的样本? 「字节Seed」 21. 【训练集采样方法】你们是怎么进行训练集采样的? 「字节跳动」 **L4 优化与诊断** 1. 【Scaling up与参数量评估】介绍scaling up:场景的数据量如何评估当前场景需要的dense参数量要多少呢? 「字节跳动」 2. 【复杂数据清洗案例】请分享你处理过的最复杂的数据清洗案例(描述最复杂的数据集及遇到的挑战)。 「蚂蚁集团、阿里巴巴」 3. 【大模型数据清洗与配比】大模型训练中,如何进行数据清洗、处理与配比?怎样操作能更容易使模型达到更好的性能? 「百度、百度文心」 4. 【推理链数据清洗核验】将数据统一构造prompt输入GPT生成推理链后,做了哪些数据清洗、质量核验工作? 「百度」 5. 【数据合成与清洗Pipeline】数据合成pipeline,数据清洗 「蚂蚁集团」 6. 【数据回灌测试与仿真场景生成】什么是数据回灌测试?如何利用路采数据生成仿真场景来回归验证规划算法的更新? 「腾讯」 7. 【数据探查与特征构建】三张表的数据探查、特征构建及效果显著特征的启示? 「京东」 8. 【欺诈团伙新用户判断】如果说有一个表格,有一些欺诈团伙,公用一个ip交易放在一起成表,有很多属性,比如时间,金额,收货地址等,这样的表格,需要你做一个判断,有多少用户,是属于三天内新用户? 「蚂蚁集团」 9. 【海量数据敏感词处理与问题应对】面对海量数据的时候怎么对数据进行处理,比如说去除掉敏感词等等,面对海量数据会出现哪些问题,该如何去处理? 「腾讯」 10. 【电商预训练数据低质过滤与去重】如果要做电商领域预训练数据:低质过滤与去重会怎么做?用哪些简单指标快速判断数据质量? 「拼多多」 11. 【语音识别LLM样本采集】现在我们有一个语音识别LLM的项目,你会如何采集样本? 「腾讯」 12. 【领域模型继续预训练数据选取】领域模型ContinuePreTrain数据选取? 「字节跳动、百度」 **L5 综合与前沿** 1. 【海量多模态数据自动清洗管线】设计一套全自动的数据清洗、阈值过滤及课程学习管线,用于从千亿级海量多模态互联网数据(含大量水印、低俗内容)中获取高质量样本,支持快速迭代预训练,避免脏数据污染。需涵盖从最开始的收集到最终样本输出的完整流程,包括数据源选择、清洗策略、质量评估、课程学习安排等。 「京东、字节Seed、腾讯」 ## 数据构造与标注 **L1 基础认知** 1. 【数据集来源与构造】数据集的具体信息是什么?包括其形态、数据样例、数据格式、文本数据类型以及是否为问答数据集或其他类型?数据集使用的是公开数据集还是自己构造的?构造逻辑是自动的还是人工?是运营那边打标的吗? 「京东、字节Seed、字节跳动、百度、美团、腾讯混元、蚂蚁集团、阿里巴巴」 **L2 原理理解** 1. 【微调数据集规模】微调的数据集有多大规模? 「腾讯」 2. 【数据构造与合成】数据如何构造?请描述数据构造方案。用的什么模型去合成数据?那合成的网页数据也会用到fasttext去过滤吗?算法工作有哪些(数据合成、小模型预训练)?训练数据一般怎么做,注重什么?项目细节:用来训练的数据,有没有覆盖各个领域,还是偏向某个垂直领域? 「京东、字节跳动、百度文心、美团、腾讯、腾讯混元、阿里巴巴、阿里通义」 3. 【数据标注】label是怎么设计的?打label、标签选择器?标注成什么样算合格? 「美团、蚂蚁集团、阿里巴巴」 4. 【数据格式与结构】数据结构、数据格式长什么样? 「字节Seed、美团、阿里巴巴」 5. 【数据类别划分】判断数据类别的时候是否考虑分更多类? 「腾讯」 6. 【数据集划分】数据集怎么划分的? 「美团」 7. 【样本不均衡处理】数据集的正样本负样本是怎么样的一个比例? 「京东」 **L3 实现与应用** 1. 【CoT人工标注方法】追问2:如何对上述CoT实施人工标注?描述CoT(思维链)数据的人工标注流程,包括标注规范、质量控制等。 「字节Seed」 2. 【动态采样策略】DynamicSampling:动态采样提升样本效率引入动态采样策略,过滤掉准确率为0或1的样本,确保每个批次中保留具有有效梯度的样本,从而提高训练稳定性和效率 「百度」 3. 【反馈数据用于训练】馈好的数据,具体会怎么用于训练?讨论如何将反馈数据(如人类反馈)用于模型训练,例如强化学习、微调等。 「字节Seed」 4. 【合成数据质量保证】合成数据质量如何保证? 「美团」 5. 【困难数据筛选】高价值难例是怎么筛选的?描述困难数据筛选的方法,如基于模型不确定性、损失值、多样性等。 「蚂蚁集团」 6. 【困难负样本构造】困难负样本是如何做的? 「腾讯」 7. 【多模态数据比例失调】如何处理训练数据中图像和文本比例严重失调(如1:100)的情况? 「腾讯」 8. 【微调数据构造】SFT的数据怎么造的?给一个场景,怎么去造数据?要考虑哪些?在微调Qwen的时候,数据是怎么构造的?有用到什么数据清洗方法吗(如去重、降噪、格式标准化)?数据配比是怎么做的(如通用数据与领域数据的比例)? 「腾讯、腾讯混元、蚂蚁集团」 9. 【微调数据集构建与清洗】微调数据集如何构建、清洗、去重、标注?劣质数据会导致什么问题?请结合项目中的微调数据集结构、规模,以及数据清洗和质量验证步骤详细介绍。指令数据集怎么构建的?数据是怎么构建的?怎么构造高质量训练集?怎么体现训练集高质量?怎么通过定义的核心组件Dataset来做?数据和prompt构建的过程。数据集构建怎么做:数据爬取、高质量数据筛选流程?样本如何构造的?训练数据是怎么构建的?项目中训练样本如何构建的,输出的格式? 「京东、字节跳动、腾讯、腾讯混元、阿里巴巴、阿里通义」 10. 【教师模型温度设置】教师模型打标答案的时候温度怎么设置? 「腾讯」 11. 【数据合成方法】数据合成怎么做的? 「美团」 12. 【数据增强方法】你具体是怎么做数据增强的?为什么选择这三个数据增强手段? 「字节跳动」 13. 【数据构造方法】你的数据是怎么构造的,其中特殊形式是什么样的? 「腾讯混元」 14. 【数据标注】数据标注流程相关问题:1. 打标签是系统流程还是人工流程?有哪些标签?判断依据?打标这步有什么特殊处理?2. 人工标注 vs 模型标注,如果使用模型来打标,可能会遇到什么样的问题?如果对于一个教学级代码想要打标签如何进行?(参考力扣等平台数据分类,公开数据作为基座,然后打标签)人工标注,那之前的余弦相似度不是多此一举吗? 「百度、腾讯、阿里巴巴」 15. 【数据混合策略】数据怎样混合? 「美团」 16. 【数据蒸馏】数据蒸馏特点是什么? 「腾讯」 17. 【数据质量与多样性】在数据构建时,如何保证数据质量和多样性? 「阿里巴巴」 18. 【数据过滤】敷衍性回答是怎么过滤的? 「腾讯」 19. 【数据配比策略】微调的数据配比是怎样的?数据构造,数据配比,为什么要这么做,这个比例有什么讲究吗?数据配比怎么做?数据配比怎么调的?是否存在动态调整计划的机制?数据配比是如何考虑的?为什么用6倍的通用数据?你说的配比实验,里面的比例是怎样的?如何做数据配比?训练数据动态配比:解释数据配比的概念,并讨论如何动态调整不同来源或类型数据的比例以优化模型训练。 「京东、字节Seed、字节跳动、拼多多、百度文心、美团、蚂蚁集团、阿里巴巴」 20. 【数据预处理】公式编辑等元数据是否特殊处理? 「腾讯」 21. 【样本不均衡处理】样本不均衡处理:包括正负样本比例不均衡和难易程度不均衡。具体方法:1)正负样本不均衡:过采样、欠采样、SMOTE、调整损失函数权重、Focal Loss等;2)难易不均衡:困难样本挖掘(OHEM)、重采样、Focal Loss、课程学习等。 「美团、阿里通义」 22. 【样本控制策略】AReal新旧样本怎么去控制? 「腾讯混元」 23. 【特征工程】特征工程时遇到的难点,怎么解决? 「美团」 24. 【评估数据集构造】评估数据集怎么构造才靠谱?讨论评估数据集的构造原则,包括代表性、多样性、避免数据泄露等。 「阿里巴巴」 25. 【零样本利用】丢弃全0的case太可惜了,怎么能利用起来? 「百度文心」 **L4 优化与诊断** 1. 【困难数据筛选】如果爬取了1亿条数据,如何筛选出模型不太会的数据? 「字节跳动」 2. 【图像数据清洗与标注】计算机视觉训练数据包含大量京东商品图像,如何设计数据清洗与标注策略,以提升“商品细分类别”模型的效果? 「京东」 3. 【多模态数据构造】场景题:多模态场景,input是一个图片,上面是一些手写的数据答题公式,output是要对这些答题进行打分。里面的细节会涉及到要考虑数学逻辑、数学符号等。你觉得从数据的构造上需要怎么去考虑? 「字节跳动」 4. 【指令数据清洗】如何设计高质量指令数据的自动清洗pipeline? 「字节跳动」 5. 【数据过滤与长视频处理】数据集构建技巧+过滤方法,图像、视频数据过滤方法,长视频如何避免OOM? 「腾讯」 6. 【数据配比策略】介绍一种你熟悉的数据配比策略:如何平衡代码、数学、通用文本、多语言数据之间的比例? 「字节跳动」 7. 【数据集合并训练】应该怎么做能达到几乎合并训(数据集1&2)的效果? 「京东」 8. 【测试数据构造】构造各种测试数据,发现至少10类不同问题,输出详细的报告 「蚂蚁集团」 9. 【自我纠错数据构造】模型自我纠错的数据是怎么构造的? 「腾讯」 10. 【训练结果分析与数据改进】如何分析训练结果并改进训练数据的构造方式? 「百度」 **L5 综合与前沿** 1. 【Agent日志分类与指标体系】如何对超长多段结构复杂的agent日志数据根据代码任务类型进行分类打标签?生产代码/教学代码/测试运维代码,thinking input output工具调用执行效率等等六个维度来搭建一套可对比可量化的指标体系? 「百度」 2. 【数据蒸馏】设计梯形编码的数据蒸馏算法,从高维S11曲线中提取关键频响特征,降低数据存储与模型训练开销,使模型训练时间缩短40% 「字节Seed」 ## 数据质量与去重 **L1 基础认知** 1. 【噪声处理】数据噪声? 「阿里巴巴」 2. 【数据去重方法】是否有去重? 「腾讯」 3. 【数据可读性】可读性是什么? 「阿里巴巴」 4. 【数据命名规范】命名是否清晰? 「阿里巴巴」 5. 【标签分布】各个 label 数量级? 「阿里巴巴」 **L2 原理理解** 1. 【数据倾斜判断】怎么判断是否是出现了数据倾斜? 「拼多多」 2. 【数据时效性】数据过时staleness? 「蚂蚁集团」 3. 【数据质量维度与评估】1. 判断数据质量时需要考虑哪些维度?是否包括正确性、流畅度?2. 哪样的数据满足高质量的特征?3. 怎么评估数据质量? 「字节Seed、百度文心、腾讯」 4. 【负样本定义与正负样本比例】1. unlike是否算负事件?2. 数据里正负样本的占比关注过吗? 「字节跳动、百度」 **L3 实现与应用** **数据质量与去重综合** 1. 有噪声样本怎么做? 「美团」 2. 有样本能共用吗? 「腾讯」 3. 有没有出现过取数很慢,什么原因(数据倾斜)? 「拼多多」 4. 有没有坏例? 「美团」 5. 有没有自动化质检方法判断prompt质量? 「字节Seed」 6. 有没有采用双模型互相打分校验数据的方案,当时为何没有落地? 「百度」 7. 机评人评如何协调,如果有不一致的如何判断? 「腾讯」 8. 样本分布差异大的可能原因? 「京东」 9. 模型训练数据如何做检验的? 「蚂蚁集团」 10. 比如如何处理图像-文本对的噪声(如描述与图片不符),保证数据质量? 「京东」 11. 生产的训练数据是否存在样本不均衡问题? 「百度」 12. 训练数据有效、准确指的是什么? 「美团」 13. 请详细描述数据处理到训练的pipeline,重点包括:1. 去重(文本、图像去重)、过滤、去污(Decontamination)的完整流程;2. 需要过滤哪些关键噪声(如逻辑矛盾、事实错误等);3. 评估caption数据的维度;4. 高质量数据和低质量数据的混合策略;5. 如何大批量筛选高复杂度数据;6. 通过训练模型进行数据质量验证时的lr schedule;7. 自动化评分的准确度如何保证,是否有人工审核环节。 「字节Seed、字节跳动、美团、腾讯、阿里通义」 1. 【AI生成mask验证】AI生成的mask你们如何做的人工验证,还有什么trick? 「腾讯」 2. 【合成数据质量评估】合成数据质量如何保证和评估? 「京东、美团」 3. 【增量更新问题】增量更新有没有什么问题? 「阿里巴巴」 4. 【数据丢弃与采样策略】怎么做丢弃或采样? 「腾讯」 5. 【数据去重方法】假设对小红书笔记做去重,怎么做笔记之间的去重?怎么做笔记内的去重?大规模数据去重是怎么做的? 「百度文心、腾讯」 6. 【数据可用性判断】怎么判断数据可以被送到模型训练了,判断标准是啥? 「腾讯」 7. 【数据差异影响】有10%不一样,你觉得这种情况对于训练是有增益的还是有损害的? 「腾讯」 8. 【数据有效性验证】怎么保证sft数据是有用的? 「腾讯」 9. 【数据比例动态调整】而不是简单地说高质量数据占百分之多少,低质量数据占百分之多少,然后从头到尾都不变。 「字节跳动」 10. 【数据混合问题】数据混在一起确实可以一定程度上解决这个问题,但会带来哪些新的问题呢? 「美团」 11. 【数据清洗策略】去洗数据或调整策略? 「字节Seed」 12. 【数据质量判定与标注SOP】如何判定数据质量,人工标注的时候SOP怎么定? 「腾讯」 13. 【数据质量标准定义】在特定的业务场景下,怎么定义“好数据”和“坏数据”? 「字节Seed」 14. 【数据质量评估】我们构造的cpt数据的用途以及数据的最终质量如何? 「腾讯」 15. 【数据质量问题处理】在数据分析中,你遇到过数据质量差的情况吗?你是怎么处理的? 「蚂蚁集团」 16. 【数据量与质量把控】数据量,数据质量怎么把控的? 「蚂蚁集团」 17. 【数据闭环筛选标准】在模型迭代优化中,什么样的数据能进入数据闭环,筛选标准是什么? 「腾讯」 18. 【无反馈抽检方法】在没有用户反馈的情况下,如何进行有效的抽检? 「字节跳动」 19. 【时间分布验证】你有尝试比如说像我们业务一样,拿去年的客户数据训练模型,但是拿今年的数据单独验证吗? 「字节跳动」 20. 【标注质量评估】如何评估标注数据的质量?请定义标注数据的合格标准,从哪些维度判定标注有效,并说明在实际业务中如何量化评估标注数据集的质量? 「美团」 21. 【标注质量问题处理】当遇到数据标注质量问题时,你有哪些解决方案? 「蚂蚁集团」 22. 【样本质量影响】你有没有观察到哪些训练样本质量问题对模型行为有很大影响? 「百度」 23. 【特征穿越】特征穿越问题怎么考量? 「蚂蚁集团」 24. 【用户生成数据筛选标准】你会用什么质量筛选标准判断用户生成的数据? 「字节Seed」 25. 【跨部门沟通】如何采取比较通俗的语言说服质检或者数据部的人接受你的指标或者标签分级? 「百度」 26. 【过程错误数据影响】如果只使用最终答案正确但过程错误的数据,会有什么后果? 「字节跳动」 27. 【阈值确定】用相似度去筛选样本,阈值怎么确定? 「美团」 28. 【难数据筛选问题】对于这样自动化的生成数据如果难数据被筛选掉了怎么办 「蚂蚁集团」 **L4 优化与诊断** 1. 【低质量数据应对策略】在数据质量不佳且不使用人工逐一检查的情况下,如何从策略层面优化以保证模型效果?变体1:电商数据中存在大量同质低质量数据,如何策略优化?变体2:数据质量不好不使用人工怎么改善? 「拼多多、百度、蚂蚁集团」 2. 【噪声与偏差处理】如何处理数据中的噪声或系统偏差?变体1:发现合作团队提供的数据存在严重的标注噪声或系统偏差,直接影响模型训练效果,如何处理?变体2:原始训练数据中存在大量噪声,如何去除噪声对模型的影响?变体3:模型训练过程中发现数据质量极差,如何处理? 「字节跳动、百度、蚂蚁集团」 3. 【大模型辅助数据质量】如何利用大模型辅助数据质量相关工作?变体1:大模型做数据检验你是怎么做的?变体2:怎么用大模型去分析标注质量、迭代? 「腾讯、蚂蚁集团」 4. 【数据一致性】三者结合使用数据一致性其实是有损失的,那如何保证三个之间的一致性?项目中怎么去做的? 「京东」 5. 【数据不平衡处理】你有过解决多模态数据不平衡的经历吗? 「京东」 6. 【数据偏见与毒性处理】如何处理大模型训练中的数据偏见和毒性? 「腾讯混元、蚂蚁集团」 7. 【数据投毒防御】如果要在数据入口拦截 poisoning,应把防线放进哪几个阶段? 「字节跳动」 8. 【数据泄露处理】如果在模型训练过程中出现数据泄露问题,你会如何处理? 「字节跳动」 9. 【标注质量评估】假设有多个标注员,标注员会根据问题评判A模型和B模型,但是标注员质量参差不齐,如何判断标注结果能不能用,以及标注质量有没有问题,如何判断? 「百度」 10. 【特征重要性及离线一致性】怎么分析特征重要性,怎么分析特征在离线不一致? 「美团」 **L5 综合与前沿** 1. 【标注偏差处理】当你发现用于训练奖励模型的众包标注数据存在明显的标注者主观偏差,且已影响了模型行为,但重新标注成本极高、时间紧迫,你会如何处理? 「蚂蚁集团」 ## 评估指标 **L0 上下文不足(难度待定)** **上下文不足** 1. 180题怎么分布? 「字节Seed」 2. 你是怎么去看这两个指标的? 「百度」 **L1 基础认知** 1. 【测试样本数量】用了多少测试样本? 「美团」 2. 【评估指标】评估指标有哪些?包括准确率、召回率等常用指标。追问:AI准确率多少?一直在质疑准确率,召回效果。你们看什么指标? 「京东、字节跳动、百度、美团、腾讯、腾讯混元、阿里巴巴」 **L2 原理理解** 1. 【AUC指标】AUC的定义、物理含义、取值范围(最差为0.5,对应随机猜测)、几种计算方法(包括GAUC计算)以及AUC/GAUC的区别?是否只用了AUC?有没有用别的指标判断? 「百度、腾讯、阿里巴巴」 2. 【BLEU指标】BLEU指标 「阿里巴巴」 3. 【F1-macro指标】F1-macro指标怎么计算的? 「腾讯」 4. 【Pass@k指标】pass@k和pass@1是什么? 「百度」 5. 【分类任务评测指标】讲一下 RAG 项目 分类任务常用的评测指标有哪些?分类任务常用的评测指标有哪些? 「蚂蚁集团」 6. 【召回率与精确率计算】讲一下召回率和精确率怎么计算的?检测出来他的一个召回率是多少? 「百度、蚂蚁集团」 7. 【思维链评估指标】有规则来评价模型输出结果中是否带思维链的一些指标。 「百度」 8. 【检索评估指标与基准】检索评估metric,benchmark 「阿里巴巴」 9. 【模型评估指标选择】你平时怎么评估模型的好坏,用哪些指标?模型训练好以后如何评价模型好坏?你的项目是否进行过有效性验证或系统评估?如果有,评测方法是什么?如何实现的?你还了解哪些指标?请分享一个你在测试中使用的机器学习模型测试方法。请列举关键的评估维度和方法。包括: 数据分析采用了哪些指标? 每次迭代之后,有检查一些相关的指标,判断模型学习得更好嘛?泛化性怎么样? 「京东、字节跳动、美团、腾讯、蚂蚁集团、阿里巴巴」 10. 【留存率计算】留存率是怎么算的? 「百度」 11. 【评估指标】评估指标相关问题:1. 用什么指标来评价检索结果?2. 训练时除了最终的准确率还看哪些指标?3. 讲一讲ROUGE、BLEU、Sim这几个指标以及为什么起作用。4. 评估生成文本质量的方式。5. 评测集是怎么算正确率的?6. 这个功能上线后,你用哪些指标评估效果? 「京东、字节跳动、腾讯、蚂蚁集团、阿里巴巴」 12. 【费用评估】评估过费用吗? 「美团」 **L3 实现与应用** **评估指标** 1. 如何设计测试方案?包括:1)针对自动驾驶算法在复杂光照/动态场景/车辆交互/夜间/恶劣天气/极端天气下表现不佳时改进测试方案;2)针对自动驾驶算法/系统的性能优化测试/性能测试设计测试方案。 「京东」 2. 如何评估模型效果?包括:1)自动与人工评估指标(如AUC、F1、覆盖率F1、区分度等);2)针对不同领域(CV、NLP、LLM、自动驾驶、金融对话机器人)的评估方法;3)加权方法(如大流量用户加权)使评估更公平;4)LLM as Judge的评估维度;5)测试方案设计(复杂光照/动态场景/恶劣天气、自动驾驶性能测试、短时间大量测试);6)过程与结果评估(未按流程但达到目的);7)训练与评测reward model一致是否不公平;8)AUC计算(样本预估值0.1如何算AUC、离线AUC0.85的分子分母);9)F1 score计算;10)训练集测试集切分(按时间或随机);11)如何证明模型有区分度;12)如何评估微调后模型有提升。 「京东、字节跳动、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 3. 评估指标相关问题:指标是什么?如何制定?如何计算?为什么设定该数值(是否调参)?是否虚高?是全局还是分场景?数值评估方法;数据不均衡对F1、Acc等指标的影响;是否评估推理过程可解释性(还是仅Acc/mIoU)?是否设计自动化评测流程?如何衡量模型好坏?最终效果如何评估? 「京东、字节跳动、美团、腾讯、蚂蚁集团、阿里巴巴」 4. 评估指标综合题:涵盖多模态模型、大语言模型、RAG、AIGC、检索、视觉模型、后训练模型等的核心评价指标;准确率优化方案;F1 Score在生成式任务中的计算与评测;R@K、BLEU、CIDEr在电商场景(如商品匹配)中的衡量;如何判定模型优化效果正向/负向;如何判断后训练策略迁移性;如何定义成功指标;如何衡量模型实际业务效果;如何设计计算机视觉模型评估体系及动态场景鲁棒性;如何评价微调后模型提升、幻觉率、通用能力变化;如何评价检索效果及指标提升;如何评估AIGC生成内容质量;如何评估RAG模型效果及常用指标;如何评估后训练模型在安全性、有用性、无害性方面的表现;如何评估不同数据增强方法(旋转、裁剪、色彩抖动)对视觉模型的提升;多次迭代后效果分化时如何用消融实验定位问题;分享一次大模型评测经历及关注指标。 「京东、字节Seed、字节跳动、拼多多、百度、百度文心、美团、腾讯、蚂蚁集团」 1. 【AIGC绘图评估】AIGC绘图质量如何评估? 「阿里巴巴」 2. 【AUC与相关指标】介绍AUC、GAUC、UAUC的概念、计算及区别。手撕AUC/GAUC(写代码)。 「百度、美团、腾讯、阿里巴巴」 3. 【AUC指标】请说明AUC的定义、物理意义和计算方法,并用Python实现AUC的计算。同时,讨论数据随机采样对AUC的影响,以及当AUC指标较高时,如何判断性能提升幅度是否显著。 「字节Seed、拼多多、腾讯」 4. 【LLM作为裁判】评测中GPT as judge怎么做的? 「腾讯」 5. 【MRR与NDCG、Precision区别】介绍MRR,并从评估目标说明其与NDCG、Precision的区别。 「百度」 6. 【NLP2SQL评估】NLP2SQL的表现如何评估?使用召回率、精确率、F1-Score,构造正确SQL语句验证大模型结果。 「百度」 7. 【PPL指标】PPL阈值如何设置? 「腾讯」 8. 【RAG评估】RAG有哪些评估方法? 「腾讯混元」 9. 【决策评估】AI的决策是否符合预期,通过什么来判断? 「腾讯」 10. 【分层验证】每一层分别如何验证? 「字节Seed」 11. 【分支覆盖率统计】代码单测的分支覆盖率如何统计? 「字节跳动」 12. 【安全性评估自动化】介绍一种用于评估模型输出安全性的自动化方法或工具。 「蚂蚁集团」 13. 【安全过滤效果评估】安全过滤效果如何评估? 「字节跳动」 14. 【对齐程度评估指标有效性】这个指标真的能评估对齐程度吗? 「腾讯混元」 15. 【指标加权评分】这些指标最后如何进行加权评分? 「字节跳动」 16. 【模型与规则上限对比】模型的上限会比rule-based高吗,如何说明? 「美团」 17. 【测试结果质量保证】请描述你如何确保测试结果的准确性、可重复性、可信度、一致性,以及测试过程的透明度和可追溯性? 「京东」 18. 【消融实验】是否做过消融实验?每个模块贡献了多少? 「京东、腾讯混元、蚂蚁集团」 19. 【生成效果量化指标】能不能想个量化指标去衡量生成效果? 「美团」 20. 【相似度评估】相似度评估用什么做的(如BERT)? 「蚂蚁集团」 21. 【统计显著性检验】统计显著性检验了吗? 「美团」 22. 【裁判模型稳定性】裁判模型打分怎么确定是否稳定? 「美团」 23. 【评估指标设定与合理性】任务评价指标如何设定?如何判断指标合理性?传统指标有哪些局限性?如何量化评估输出质量?之后采用哪些指标检验洞察? 「京东、字节跳动、百度、百度文心、美团」 24. 【逻辑推理答案提取】评估逻辑推理时候,预训练大概率没有指令遵循输出答案评估,你是如何提取答案做的? 「拼多多」 **L4 优化与诊断** 1. 【Agent评估】Agent系统的整体效果怎么评估? 「字节跳动、美团」 2. 【AI生成检测泛化性】AI生成检测你的方法对新出现的生成器来讲,效果如何? 「蚂蚁集团」 3. 【AUC回归应用】AUC怎么适用于回归问题? 「拼多多」 4. 【Deep Research报告评估】deep research的report评估方法是什么? 「腾讯」 5. 【LLM作为裁判】要llm-as-judge评测财务指标计算是否正确,该有哪些评估标准? 「字节跳动」 6. 【代码评测集效果分析】假设GitHub的一个客观评测集,模型评估效果不好,可以从长代码和短代码出发,分析造成这种问题的原因。 「百度」 7. 【仿真平台模型评估】仿真平台如何评判模型的好坏? 「美团」 8. 【内部评价指标设计】介绍一下内部评价指标,怎么设计的?内部评价指标是否合理,怎么证明? 「腾讯」 9. 【可解释性生成评估】可解释性生成你是如何做的评估? 「蚂蚁集团」 10. 【增量预训练性能提升判断】(追问)如何判断增量预训练是否真正提升了模型性能? 「腾讯」 11. 【多模态评估指标设计】请描述你设计过的最复杂的多模态评估指标。 「蚂蚁集团」 12. 【多轮对话维度分析】追问1:如果是benchmark上的多轮对话维度分数低,要怎么进一步分析? 「字节Seed」 13. 【大模型评估方法论】评估方法论:如何科学评估大模型性能? 「阿里巴巴」 14. 【完整测评考虑因素】项目中的背景 挑战 困难 测评 对于训练完的模型 如果做比较完整的测评 要从哪些方面考虑 业务场景如何测试? 「百度」 15. 【模型评估可信度】使用Qwen-VL-2.5这样的模型做模型评估如何保证可信度? 「腾讯混元」 16. 【评估体系设计】设计评估体系,包含:动态模糊程度分级、运动速度区间、识别准确率衰减曲线。 「京东」 17. 【评判模型准确率验证】依靠模型自动评判,你在训练优化过程中,有没有验证过评判模型自身的准确率? 「阿里巴巴」 18. 【评测结果与COT分析】追问2:如果已获取权威benchmark各维度的评测结果和COT,要怎么进一步分析? 「字节Seed」 19. 【轨迹评估】AReal怎么评估一个轨迹新旧混杂程度? 「腾讯混元」 20. 【风控模型上线评估】你如何评估一个风控模型上线后的实际效果?除了AUC还看什么? 「蚂蚁集团」 **L5 综合与前沿** 1. 【评估体系设计】固化成上线前的评估标准。你会怎么设计评估体系? 「字节Seed」 ## 评测集与Benchmark **L3 实现与应用** **评测集与Benchmark** 1. 为什么需要对RAG进行评测? 「腾讯混元」 2. 你觉得什么是一个好的benchmark? 「腾讯」 3. 假设有一组主观任务,大概是给一段文字判断情绪类别,这是多分类的任务,而最好的闭源大模型也没法达到80%以上的正确率,那么如何构造出正确的评测集? 「腾讯」 4. 在论文中,有一个qwen3vl提点非常高的benchmark(baseline异常低),是什么原因? 「阿里通义」 5. 基座模型怎么评估? 「美团」 6. 多语言场景怎么评估:如何做一套简单可执行的离线评测集?如何覆盖不同语言与类目? 「拼多多」 7. 如果你发现一个测试用例覆盖率不足,你会如何改进? 「京东」 8. 如果你负责一个全新的自动驾驶项目,你会如何制定测试策略?(包括可靠性测试、回归测试、安全测试、端到端测试、集成测试、验收测试、验证测试等不同维度的测试策略/流程设计) 「京东」 9. 工具调用准确率怎么定义的,评测集怎么构建的,badcase在哪? 「蚂蚁集团」 10. 怎么验证数据质量,用什么basemodel,用什么评测集? 「腾讯」 11. 数学榜单构建技巧 「腾讯」 12. 数学榜单除了acc的reward还有什么吗? 「腾讯」 13. 是否有考虑构建针对业务的cpt阶段bench? 「腾讯」 14. 训练完验证使用的是什么数据集? 「蚂蚁集团」 15. 评估多模态大模型时,除了传统的CIDEr、BLEU,还有哪些更科学的Benchmarks? 「腾讯」 16. 评测体系你是怎么搭建的? 「腾讯混元」 17. 评测集如何构建、覆盖真实业务场景? 「美团」 18. 评测集是从哪里找的? 「字节跳动」 19. 请描述你如何设计一个高效的自动驾驶算法测试框架? 「京东」 20. 领域模型微调领域评测集构建? 「字节跳动、百度、腾讯混元」 ## AB测试与实验设计 **L1 基础认知** 1. 【AB测试基本原理】请介绍AB测试的基本原理。 「京东、拼多多」 **L2 原理理解** 1. 【AB测试设计】AB测试设计流程:如何设计AB测试?具体步骤?是否做过?对照组模型设置:对照组使用什么模型?是否与实验组相同架构和参数量?策略有效性验证:如何验证策略的有效性?分组方式探讨:是否尝试过完全不分组或随机分组? 「京东、百度、美团、腾讯」 **L3 实现与应用** 1. 【AB测试综合】AB实验设计、操作与异常处理:1. 分桶、周期、显著性怎么理解?遇到大促波动时如何解释实验结果?2. 业务上想看发送招标邮件的效用,如何设计实验?3. 分流护栏怎么做的?4. 如何处理模型的A/B测试?5. 开一个时间较长的实验来累积更多的样本量,这样的方式可能会导致什么问题?怎么解决?6. 怎么做的小流量AB实验?7. 描述一下你做过的一个A/B测试,怎么设计实验的?8. 提到了AB test具体怎么操作的?合成控制法?AA期指标波动较大的情况?9. 要怎么切片去看不同属性下实验效果怎么样? 「京东、拼多多、百度、美团、腾讯、蚂蚁集团、阿里巴巴」 **L4 优化与诊断** 1. 【AB测试效果不一致原因分析】AB测试实验效果显著正向但全量上线后效果消失或实际落地不显著的可能原因有哪些?请从网络效应/SUTVA违反、选择偏差、实验期与全量期分布漂移等角度分析。 「京东、拼多多、美团」 2. 【DID平行趋势检验】DID的前提是平行趋势,你能拿什么数据证明平行趋势?如果证明不了,你敢不敢拍板说就是模型问题?如果平行趋势检验不通过怎么办? 「百度、蚂蚁集团」 3. 【Switchback实验干扰解决】Switchback实验流量互相干扰,有什么解决办法? 「腾讯」 4. 【反馈闭环设计】在模型迭代中,如何设计一个有效的反馈闭环,让线上表现能快速指导线下模型优化? 「蚂蚁集团」 5. 【多优化点合并问题定位】离线不同的优化点合并在一起上线,线上出了问题,要怎么去发现是哪一块不及预期? 「美团」 6. 【多指标权衡决策】AB测试多指标权衡决策:Chat bot上线A模型和B模型,观测到A模型用户次日留存率更高,B模型对话时间更长,如何判断上线哪个模型? 「百度」 7. 【数据配比实验设计】请设计一个实验,来评估不同数据配比(如SFT数据、偏好数据、安全数据)对最终模型性能的影响。 「蚂蚁集团」 8. 【离线线上效果不一致分析】当算法改进在离线评估中表现优异,但在线上A/B测试中效果不显著甚至为负时,你的分析思路和后续行动是什么?复盘会怎么做?下一步优先改哪里? 「拼多多、百度、蚂蚁集团」 **L5 综合与前沿** 1. 【策略评估与因果推断框架】设计一个A/B测试或因果推断框架,评估策略(如风控、新模型、新工具)对业务指标(如通过率、坏账率、DAU)的长期影响,并处理子人群负向、自然流量无AB等场景。变体:1)大盘DAU持平但高价值子人群显著负向,是否全量?决策框架怎么搭?2)如何设计A/B测试评估新老风控策略对通过率、坏账率的长期影响?3)无AB的自然流量入口,如何做因果推断?4)设计Agent线上评测与灰度机制,保证新模型、新工具上线不批量翻车,量化效果优劣。 「字节跳动、美团、蚂蚁集团」 ## 监控与错误分析 **L0 上下文不足(难度待定)** 1. 【上下文不足】这样的现象可能有哪些原因? 「京东」 **L2 原理理解** 1. 【日志关键指标】日志中你最关心哪几项指标? 「百度」 **L3 实现与应用** 1. 【Bad Case分析】如何分析bad case?包括如何找到bad case、如何确定其占比、如何找到原因以及如何确定是哪个具体原因导致的bad case? 「京东、美团」 2. 【Bad Case回流与迭代】哪些badcase进行回流了?怎么做badcase回流?针对这些Bad Case,下一步如何迭代? 「字节Seed、百度」 3. 【实验结果分析思路】当实验结果与预期不符时,你的分析思路是什么? 「蚂蚁集团」 4. 【实验跟踪与模型管理】解释实验跟踪和模型管理的最佳实践。 「蚂蚁集团」 5. 【模型一致性检查】会做哪些checking工作确保它和你的判断一致? 「字节Seed」 6. 【模型上线前检查】模型上线前应考虑哪些问题?如何避免学偏的模型上线? 「阿里巴巴」 7. 【模型效果归因分析】模型评测后,效果不好,怎么做归因分析? 「字节Seed」 8. 【监控与定位方法】你会如何监控和定位的? 「百度」 9. 【线上问题定位经验】有没有定位过线上问题? 「阿里通义」 10. 【训练日志打印内容】训练的时候,打印什么内容可以定位上述问题? 「蚂蚁集团」 **L4 优化与诊断** 1. 【中间指标与Scaling问题排查】有没有除了结果之外,根据其他中间指标观察模型收敛?能不能举一个具体的case来排查模型scaling的问题? 「字节跳动」 2. 【复杂场景下算法问题定位】如果你在测试中发现一个算法在复杂交通信号、交通、行人、路口或道路拓扑场景下表现不佳,你会如何定位问题? 「京东」 3. 【异常模式发现与预警】请描述一次你通过数据分析发现异常模式并成功预警的经历。 「蚂蚁集团」 4. 【指标下降归因分析】支付宝某页面的点击率掉了2个百分点,业务方说是算法模型的问题,数据组说是埋点上报延迟。你作为一个数据分析师,怎么让两方闭嘴,找到真因? 「蚂蚁集团」 5. 【模型上线后监控与迭代】在模型部署上线后,如何进行监控和持续优化?请描述监控模型效果的方法、确保及时发现和解决问题的监控系统设计,以及持续迭代的流程。 「京东、蚂蚁集团、阿里巴巴」 6. 【离在线不一致排查】当模型在测试集表现好但线上效果差时,离在线不一致问题如何排查和解决?请给出排查思路和解决方案。 「蚂蚁集团、阿里巴巴」 7. 【线上故障定位与止血】举一个常见线上故障(超时、输出为空、质量下降等):如何快速定位原因并止血? 「拼多多」 8. 【线上问题排查】如果发现线上模型的预测结果有偏差、效果不理想或突然下降,怎么排查是哪个环节出了问题?从哪些方面分析情况? 「百度、美团、阿里巴巴」 9. 【评分正确但grounding错误分析】怎么看模型评分正确但是grounding有问题的案例? 「腾讯」 10. 【长期项目监控体系】在一个长期迭代的后训练项目中,如何建立有效的指标监控体系,以及时发现模型性能衰退或出现新的安全风险? 「蚂蚁集团」 ## 其他数据评测 **L3 实现与应用** 1. 【其他数据评测】代码插桩的具体实现原理是什么? 「字节跳动」 # 系统设计与后端基础 ## 操作系统 **L0 上下文不足(难度待定)** 1. 【上下文不足】是否了解操作系统等 「字节跳动」 **L1 基础认知** 1. 【Linux命令】Linux命令:1. 查看目录下文件数量(包括子目录?);2. 递归复制目录 ./aaa 到 ./bbb 的命令。 「百度、阿里通义」 2. 【字节序】小端和大端存储。 「百度」 3. 【磁盘结构】介绍磁头和磁道。 「百度」 4. 【进程管理】让进程在后台运行的命令行是什么? 「百度」 **L2 原理理解** **进程与线程** 1. 异步中进程、协程的认识? 「腾讯混元」 2. 线程与进程的区别是什么?进程/线程区别;进程通信与共享内存API? 「京东、字节跳动、腾讯、阿里巴巴、阿里通义」 1. 【Activity启动模式】介绍安卓的启动模式(standard、singleTop、singleTask、singleInstance),项目中的使用场景。 「百度」 2. 【Linux命令】Linux常用命令:1. 查询CPU、内存、磁盘情况(如df、du、free、top等);2. 查看磁盘信息及挂载情况(如lsblk、mount、df -h);3. 查询端口占用情况(如netstat -tuln、ss -tuln、lsof -i:端口);4. 查看当前执行的任务(如ps、top、jobs)及终止任务(kill、killall、pkill);5. 查找文件中字符串(如grep 'road_graph' data.txt);6. 给字符串中大写字母加上括号(如sed 's/[A-Z]/(&)/g');7. 系统卡顿排查(如top、htop、iostat、vmstat、dmesg);8. 常用命令(如ls、cd、cp、mv、rm、chmod、ps、kill、grep、sed、awk、find、tar、git等)。 「百度、美团、腾讯」 3. 【Linux文件系统】Linux中的proc文件夹有什么作用? 「阿里通义」 4. 【ROS】ROS中Service和Topic的区别?以及param和broadcast的介绍? 「百度、腾讯」 5. 【内存管理】介绍内存布局,并说明内存泄漏如何检测和避免?物理内存和虚拟内存的区别?物理地址和虚拟地址的区别?虚拟内存解决了什么问题?为什么要有虚拟地址?解释内存/显存、物理/虚拟、堆/栈内存的区别,重点说明堆和栈的区别? 「字节跳动、百度、阿里巴巴、阿里通义」 6. 【原子性】你怎么理解原子性? 「阿里巴巴」 7. 【容器隔离】请解释Namespace和Cgroups机制,并说明cgroupv2的作用。 「腾讯、阿里巴巴」 8. 【寄存器】寄存器类型和作用? 「阿里巴巴」 9. 【指令执行】一条指令执行的过程,比如load指令? 「阿里巴巴」 10. 【死锁】死锁的四个必要条件是什么? 「字节跳动、百度」 11. 【进程管理】如何杀死一个进程?如果kill不掉怎么办?强制kill的原理是什么? 「百度」 12. 【锁】计算机操作系统里面,怎么理解“锁”的核心概念? 「阿里巴巴」 **L3 实现与应用** **GMP模型** 1. 每个 P 有几个队列? 「百度」 2. 解释 GMP 模型中 G、M、P 分别是什么? 「百度」 1. 【Activity栈】一个栈里有四个activity,这四个能不能是不同进程的,能不能是不同应用的? 「百度」 2. 【Handler机制】Handler、Looper、MessageQueue的对应关系是什么?Handler是一对一还是一对多的关系?Handler机制在项目中哪里使用了?怎么用的?IdleHandler是干啥用的?一个延时执行的任务,Looper是采取什么策略让它这个任务延时去执行的? 「百度」 3. 【Kubernetes调度】污点Taint和容忍度Toleration? 「阿里巴巴」 4. 【Pod】Pod的概念、生命周期及从提交到拉起的全流程。 「腾讯、阿里巴巴」 5. 【令牌桶算法】介绍令牌桶算法如何根据优先级让高优请求先拿令牌。 「百度」 6. 【信号量】信号量的底层是怎么实现的? 「字节跳动」 7. 【内存泄漏】内存泄漏:如何检测?如何避免?如何判定一个view有没有内存泄漏?内存泄漏的原因,如何解决? 「百度、阿里巴巴」 8. 【内存管理】请解释mmap是什么,并说明在什么情况下mmap会更慢?同时,请讲讲操作系统内存管理的相关内容。 「字节跳动、阿里巴巴」 9. 【函数调用机制】方法调用的原理(栈,汇编)。 「百度」 10. 【容器与虚拟机】VMware和Docker/K8S等虚拟容器有什么本质上的区别?请解释容器原理,并说明容器与虚拟机的区别。 「阿里巴巴、阿里通义」 11. 【容器存储与网络】请解释容器网络模型和存储卷挂载,并说明当Pod漂移到不同Node时,挂载emptyDir和hostPath分别会面临什么问题? 「阿里巴巴」 12. 【容器技术】会写Dockerfile吗?请解释Docker沙箱机制的原理,并说明你是否使用过容器? 「美团、阿里通义」 13. 【容器运行时】在高版本的k8s里面已经弃用docker,如果希望轻量化容器应该用哪些。 「阿里巴巴」 14. 【线上问题排查】有没有查看过线上程序的状态? 「阿里通义」 15. 【虚拟内存】主存256Mb,外存100GB,25位寄存器,虚拟内存最大是多少?既然虚拟地址空间比物理地址空间大很多,那岂不是物理地址空间终会出现不够用的时候,这个时候怎么办? 「百度」 16. 【调度算法】实际的调度算法是怎么做的? 「百度」 17. 【进程与线程调度】进程调度的过程,和线程调度什么区别? 「字节跳动」 18. 【进程间通信】进程间通信的手段;进程间如何共享内存,调用的API是什么? 「阿里巴巴」 19. 【零拷贝】解释零拷贝。 「阿里巴巴」 **L4 优化与诊断** 1. 【CPU访存优化】你知道哪些方法可以优化CPU的访存效率?例如数据对齐、缓存预取、循环展开等技术是如何提升性能的? 「百度」 2. 【垃圾回收】在实际应用中,垃圾回收机制可能会对系统性能产生什么样的影响?你会如何优化垃圾回收以减少对性能的影响? 「美团」 3. 【性能优化】App 在低端机上卡顿严重,用户投诉很多,你打算怎么做。 「阿里巴巴」 4. 【进程与线程】解释进程、线程、协程的区别,并结合后端开发场景说明如何选择使用进程还是线程,并举例。 「腾讯」 ## 计算机网络 **L0 上下文不足(难度待定)** **上下文不足** 1. cpp协议是什么? 「百度」 2. 了不了解网络、容器、数据库这些知识? 「腾讯」 3. 是怎么转换成路由图的?底层实现了解吗? 「百度」 **L1 基础认知** 1. 【DNS协议】计网里面的 DNS 协议是做什么用的? 「阿里巴巴」 2. 【网络分层模型】介绍计算机网络层级结构,包括OSI七层模型和TCP/IP四层体系结构,并说明TCP、IP、HTTP分别属于哪一层。 「京东、百度、美团」 **L2 原理理解** 1. 【DNS解析过程】对于DNS的解析,能解释一下它过程大概什么样子的? 「腾讯」 2. 【HTTP报文】HTTP报文格式是什么? 「腾讯」 3. 【HTTP状态码】网络请求错误码(HTTP状态码) 「百度」 4. 【HTTP长连接】HTTP长连接如何开启? 「阿里通义」 5. 【PCIe协议层】PCIe有几层协议? 「字节Seed」 6. 【TCP/UDP对比】TCP和UDP属于哪一层?它们有什么区别?应用场景如何? 「京东、腾讯」 7. 【TCP状态】CLOSE_WAIT与TIME_WAIT的区别 「腾讯」 8. 【加解密算法】加解密算法有哪些? 「字节Seed」 9. 【双向通信】客户端和服务端双向通信的方式 「阿里通义」 10. 【认证机制】Cookie/Token登录态维持? 「字节跳动」 11. 【路由器与交换机对比】路由器和交换机的区别是什么? 「字节跳动」 **L3 实现与应用** 1. 【HTTPS与加密】HTTPS的加密过程是怎样的?对称加密和非对称加密在HTTPS中如何使用?HTTP和HTTPS的区别是什么?什么是中间人攻击,HTTPS是如何解决的? 「百度」 2. 【HTTP版本对比】HTTP/1.0、HTTP/2.0和HTTP/3.0的区别;重点说明HTTP/2相比于之前协议的优化点,以及HTTP/2和HTTP/3的区别 「百度、腾讯、阿里通义」 3. 【TCP半连接队列】TCP半连接队列是什么? 「腾讯」 4. 【TCP数据传输】有两台计算机a和b,尽可能的详述一下,如果他们要进行TCP数据传输的话,全过程是什么样的? 「腾讯」 5. 【TCP连接建立】TCP 建连时还会沟通哪些信息? 「字节跳动」 6. 【TCP连接管理】TCP为什么需要三次握手和四次挥手?三次握手除了校验可用性,还能解决什么问题?两次握手为什么会有误连?请详细描述四次挥手过程中每次挥手的状态变化。 「字节跳动、腾讯」 7. 【TCP连接问题】对端没有初始化会出现什么问题? 「字节Seed」 8. 【URL输入到页面展示】浏览器输入URL到页面展示全过程 「字节跳动」 9. 【WebSocket】为什么用WebSocket不用HTTP、SSE?WebSocket在项目中的具体应用 「百度、腾讯」 10. 【乱序识别】如何识别乱序传输(out-of-order)? 「字节Seed」 11. 【话题通信底层】话题通信机制中,数据底层是怎么传输的,底层机制? 「百度」 **L4 优化与诊断** 1. 【HTTPS密钥管理】预主密钥被窃取了怎么办,私钥也被窃取了怎么办 (定时换)? 「百度」 2. 【WebRTC建连】WebRTC建连过程中,ICE、STUN、TURN和SDP分别是什么? 「腾讯」 3. 【传输正确性验证】上游64B、下游32B,如何验证传输正确? 「字节Seed」 4. 【大文件传输优化】上传大文件受到网络波动影响,应该怎么处理?大文件传输优化具体是怎么做的? 「百度、蚂蚁集团」 5. 【连接管理对比】Nginx可以维护几十万连接,为什么数据库不能? 「腾讯」 ## 数据库 **L0 上下文不足(难度待定)** **上下文不足** 1. 数据库有几条数据? 「蚂蚁集团」 2. 表格设计。 「腾讯」 3. 设计数据库表的时候会。 「腾讯」 4. 追问 为啥不用cursor 「美团」 **L1 基础认知** 1. 【MySQL与Redis】了解mysql和redis吗? 「腾讯」 2. 【MySQL索引】MySQL有哪些索引类型?索引底层是什么数据结构?不创建索引,会默认创建索引吗? 「字节跳动、百度」 3. 【SQL使用经验】是否使用过SQL? 「京东」 4. 【SQL连接】SQL里面left join和right join的区别是什么?inner join和outer join的区别是什么? 「京东」 5. 【事务ACID与隔离级别】MySQL中事务的特性是什么?四种事务隔离级别是什么? 「百度、腾讯」 6. 【数据库知识广度】对大数据技术的掌握情况,了解哪些数据库? 「百度」 7. 【数据库规模】这个数据库有了解现在是多少的量级的? 「百度」 **L2 原理理解** 1. 【Buffer Pool】数据从哪里读到 Buffer Pool? 「字节跳动」 2. 【B树与B+树对比】B树和B+树有什么区别?B+树相比B树有什么优势?为什么数据库使用B+树而不是B树? 「字节跳动、百度」 3. 【B+树特点】B+树的特点是什么?为什么只在叶子节点存储数据? 「百度」 4. 【E-R图】数据库逻辑E-R图 「百度」 5. 【ES倒排索引】ElasticSearch的原理(倒排索引+TF/IDF) 「美团、阿里巴巴」 6. 【GROUP BY与PARTITION BY】SQL中group by和partition by有什么区别? 「京东」 7. 【INSERT ON DUPLICATE】MySQL里insert ...on duplicate key update怎么用? 「百度」 8. 【PostgreSQL与MySQL对比】PostgreSQL和MySQL有哪些区别?为什么认为PostgreSQL的连接和JSON支持更好? 「腾讯」 9. 【事务失败处理】如果一个事务中第二条 SQL 执行失败,会发生什么? 「百度」 10. 【事务隔离级别】读已提交与可重复读的区别? 「腾讯」 11. 【幻读与不可重复读】幻读和不可重复读有什么区别? 「腾讯」 12. 【幻读示例】举个例子说明一下幻读? 「腾讯」 13. 【数据存储方式】问我数据的存储方式 「百度」 14. 【数据库连接开销】数据库建连接到底贵在哪里? 「腾讯」 15. 【流量数据存储】流量数据是用什么存储的? 「阿里巴巴」 16. 【窗口函数】SQL里面row_number、rank、dense_rank的区别是什么? 「京东」 17. 【索引使用确认】如何确认SQL使用了索引? 「腾讯」 18. 【聚簇与非聚簇索引】什么是聚簇索引和非聚簇索引?区别是什么?聚簇索引怎么实现? 「字节跳动、百度」 19. 【范式与SQL】数据库的第二范式、第三范式,增删改查的语句。 「百度」 20. 【读写分离】读写分离你了解吗? 「百度」 21. 【连接池】为什么需要连接池?连接池真正解决什么?连接池是不是越大越好? 「腾讯」 **L3 实现与应用** 1. 【B+树数据页查询】MySQL中查到叶子节点后,怎么在数据页查询具体数据? 「百度」 2. 【config_db virtual】config_db中为什么加virtual? 「字节Seed」 3. 【ES应用场景】项目中使用ES,主要用于什么场景?用于解决什么问题? 「京东」 4. 【key查询优化】按 key 查询慢怎么优化? 「字节跳动」 5. 【LSM-Tree】知道LSM-Tree嘛?LSM-Tree容易产生什么问题? 「腾讯」 6. 【MongoDB选型】为什么不用MongoDB? 「腾讯」 7. 【MySQL优化】MySQL是如何优化的,数据量有多少? 「美团、阿里巴巴」 8. 【MySQL日志】MySQL的undolog,redolog,binlog区别和场景? 「字节跳动」 9. 【MySQL索引】谈谈MySQL索引的作用,并考虑什么场景下需要建立索引?建立索引需要考虑哪些因素? 「京东」 10. 【RDB写时复制】讲一下RDB的bgsave写时复制原理 「字节跳动」 11. 【RocksDB】知道RocksDB吗? 「腾讯」 12. 【SQL查询设计】多个SQL查询文本设计。 「腾讯」 13. 【SQL能力】SQL能力怎么样,写过的最复杂语句是什么? 「阿里巴巴」 14. 【主从一致性读】从库还未更新好数据,这时候读,读不到最新数据怎么办? 「百度」 15. 【主从延迟】主从同步的延迟你了解吗? 「百度」 16. 【事务宕机恢复】假如数据库事务执行了一半,服务器宕机了,问重新启动后原来的记录会不会发生变化? 「阿里通义」 17. 【分页与key分布】只展示前1000,数据是否仍在一个key? 「腾讯」 18. 【历史版本记录】历史版本怎么记录? 「腾讯」 19. 【字段兼容性】字段变更时如何兼容? 「阿里巴巴」 20. 【数据一致性】修改数据时怎么保证数据一致性? 「腾讯」 21. 【数据库对比】讲讲Elasticsearch和MySQL数据库的区别,分别适用什么场景。了解MongoDB吗? 「腾讯」 22. 【数据库性能指标】如果做数据库性能评测,都要测哪些指标? 「腾讯」 23. 【数据库恢复】记录变更怎么做恢复? 「腾讯」 24. 【数据库选型对比】数据库选型,为什么选PostgreSQL不选MySQL? 「腾讯」 25. 【正排与倒排索引】如果用正排倒排去用在你这个场景里,有了解过怎么做吗? 「字节跳动」 26. 【百万级检索优化】如果数据量达到上百万,你怎么解决检索效率问题? 「腾讯」 27. 【索引设计】如何设计索引I? 「腾讯」 **L4 优化与诊断** 1. 【ES性能调优】Elasticsearch在AI集群日志检索与异常定位中的使用经验;倒排索引在海量训练日志聚合分析中的性能瓶颈及Segment合并调优。 「腾讯混元」 2. 【SQL留存率计算】写一个SQL,表有三列:user_id, action_time, action_type (pay/click/leave),求7日留存率,用窗口函数写,不准用子查询套子查询。 「蚂蚁集团」 3. 【大表优化】SQL单表数据量10亿,跑不动,怎么办?包括:分库分表设计考虑;分区键选择(业务方非要按天查但底层是小时级分区);跨库查询;数据分表策略(用户数据不一定落在固定表);双写一致性(双写失败不一致问题);数据迁移方案。 「百度、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 4. 【库存表设计】12306火车票抢票:一辆火车,100个座位,有三个站(北京、天津、上海),使用MySQL管理火车票库存,这张库存表如何设计? 「蚂蚁集团」 5. 【隔离级别与一致性】MySQL的隔离级别及在分布式训练任务状态管理中的一致性保障。 「腾讯混元」 ## 缓存与Redis **L0 上下文不足(难度待定)** 1. 【上下文不足】低优单分不出去的问题是的这个主要怎么解决的呢?redis是中心的还是共享? 「百度」 **L1 基础认知** 1. 【缓存容量】缓存用到了多大? 「阿里巴巴」 **L2 原理理解** 1. 【LRU淘汰策略】介绍LRU。请说明LRU淘汰策略的原理、实现方式(如双向链表+哈希表)以及Redis中近似LRU的实现。 「百度、腾讯」 2. 【Redis与Memcached对比】为什么使用Redis作为缓存而不使用Memcached?请对比Redis和Memcached在数据结构、持久化、集群、功能等方面的差异。 「京东」 3. 【Redis优势】如果查询MySQL也很快,为什么还用Redis作缓存?请说明Redis相比MySQL作为缓存的优势(内存速度、数据结构、并发能力等)。 「京东、腾讯」 4. 【Redis应用场景】Redis还能干什么?什么场景用到过Redis?请列举Redis的典型应用场景(如缓存、分布式锁、计数器、消息队列等)并说明具体用法。 「京东、阿里巴巴」 5. 【String类型使用】用String存储,key是什么?value是什么?请说明Redis String类型的使用场景、常用命令及设计key的规范。 「阿里巴巴」 6. 【TTL设置】TTL怎么确定?请说明Redis中TTL的设置方式、过期策略(定期删除、惰性删除)以及如何合理设置TTL。 「腾讯」 7. 【主从复制与哨兵】了解主从复制和哨兵模式?请说明主从复制的原理、哨兵模式的功能(监控、自动故障转移)以及两者如何配合使用。 「阿里巴巴」 8. 【分布式锁】分布式锁的使用场景?请说明Redis实现分布式锁的原理(SETNX、Redlock)、注意事项(死锁、锁超时)及典型应用场景。 「京东」 9. 【持久化】Redis有哪些持久化方式?请详细说明RDB和AOF的原理、优缺点及适用场景。 「字节跳动、阿里巴巴」 10. 【数据结构对比】Caffeine和Redis中的数据结构分别是什么?请对比两者的数据结构。 「阿里巴巴」 11. 【淘汰策略】你选择哪种淘汰策略?请说明Redis支持的淘汰策略(如LRU、LFU、TTL、随机等)及其适用场景,并给出选择建议。 「京东」 12. 【缓存击穿与雪崩】缓存击穿和缓存雪崩的区别?请说明缓存击穿、缓存穿透、缓存雪崩的定义、原因及解决方案。 「京东」 13. 【缓存模式】用了什么缓存模式?请说明常见的缓存模式(Cache Aside、Read/Write Through、Write Behind)及其优缺点。 「腾讯」 14. 【连接池】为什么Redis也有连接池?请说明Redis连接池的作用、原理及使用注意事项。 「腾讯」 15. 【部署模式】Redis部署在哪?是哨兵模式还是主从模式?请说明主从复制和哨兵模式的区别、工作原理及适用场景。 「阿里巴巴」 **L3 实现与应用** **缓存与Redis** 1. 记忆用什么存储? 项目里面Redis存了什么? 「腾讯、阿里巴巴」 2. 读取用分批命令替代全量命令,如HSCAN替代HGETALL 「京东」 3. 谈谈MySQL、Redis、本地缓存的使用场景。 「京东」 1. 【LRU淘汰策略】LRU淘汰策略:1. LRU淘汰不看Key有没有TTL,内存满了照淘不误。所以解决思路不是设永不过期?2. 你选了最近最少使用,那么一个刚刚被淘汰的又被查询了,会发生什么? 「京东」 2. 【Redis事务】Redis事务:1. (Hash + ZSet方案) 写入时怎么保证Hash和ZSet的原子性?2. Redis中事务的执行机制是什么?事务失败会回滚吗?执行过程中是否会被其他命令插入? 「字节跳动、百度」 3. 【Redis应用场景】Redis介绍及其在AI训练任务元数据缓存中的适用场景 「腾讯混元」 4. 【Redis底层优化】Redis底层做了哪些优化? 「百度」 5. 【Redis必要性】如果不用Redis数据库能不能承受? 「腾讯」 6. 【ZSet底层实现】Redis ZSet:1. 底层怎么实现?跳表和压缩列表的使用场景是什么?zset查询和B+树查询是否相似?2. 按分数范围查找的时间复杂度?3. 为什么ZSet不直接设计成Hash+链表?4. 只查某个key是否在ZSet里,时间复杂度是多少? 「字节跳动、百度」 7. 【内存不足处理】如果有很多商品,Redis内存不足了,怎么办? 「京东」 8. 【大Key拆分】Hash大Key:按用户ID取模或时间分片,拆成N个小Hash 「京东」 9. 【布隆过滤器】怎么使用的布隆过滤器,为什么不直接使用zset,而是使用布隆过滤器的位图数组? 「百度」 10. 【扩容策略】为什么是1.5倍扩容(空间可重用)?为什么是两倍扩容? 「百度」 11. 【数据库压力衡量】你说使用Redis减轻MySQL数据库的压力,根据什么衡量MySQL数据库压力大小? 「京东」 12. 【热Key问题】查询量大时,一个Redis key是否可行? 「腾讯」 13. 【缓存一致性】缓存数据库一致性。 「美团」 14. 【缓存兜底策略】缓存被淘汰后怎么兜底:互斥锁只让一个请求查库重建缓存,其余等待;或者加一层本地缓存,Redis兜不住时本地缓存顶上。 「京东」 15. 【缓存击穿】缓存击穿介绍一下,除了分布式锁还有其他方法解决吗? 项目中写到了解决缓存雪崩问题,那缓存击穿应当怎么防护? 「京东、百度」 16. 【缓存更新顺序】先更新db还是先更新redis? 「腾讯」 17. 【缓存机制】RecyclerView的缓存机制。 「百度」 18. 【缓存隔离与清理】你们有做缓存隔离或清理机制吗? 「腾讯」 19. 【缓存预热】三级缓存的缓存预热怎么做的? 「百度」 20. 【限流算法】固定窗口,滑动窗口,漏桶算法,令牌桶算法的优缺点是什么? 「百度」 **L4 优化与诊断** 1. 【分布式锁】Redission 分布式锁 + 看门狗(为什么用、如何续期/释放)。 「美团」 2. 【大Key与热Key】Redis大Key与热Key问题是什么,在AI任务队列中的表现及拆分、本地缓存、Proxy层限流等解决方案,以及如何优化? 「京东、腾讯混元」 3. 【排行榜设计】在实际应用中,如果我们需要实现一个实时排行榜功能,你会如何利用SortedSet来设计这个功能?请包括客户端上报、MQ缓冲、实时聚合、批量写数据库、Redis ZSet做排行榜,并说明如何做去重。如果排行榜中某个数据的分数发生变化(比如点击量增加了),你会如何更新Sorted Set中的数据以确保排行榜的准确性? 「美团、腾讯」 4. 【缓存一致性】Redis+DB数据一致性如何保证?在多节点部署的情况下,某个节点先更新Redis缓存,再更新自己的本地缓存,其他节点如何知道该更新本地缓存? 「京东、字节跳动」 5. 【缓存层设计】缓存层设计与优化,为什么要把黑白名单逻辑从在线服务抽离到独立的离线缓存层? 「阿里巴巴」 6. 【集群扩容】redis的集群扩容机制 「阿里巴巴」 ## 消息队列 **L1 基础认知** 1. 【Kafka基本概念】请介绍Kafka的作用和基本概念。项目里消息队列做什么的? 「腾讯、蚂蚁集团、阿里巴巴」 **L2 原理理解** 1. 【消息队列基础】消息队列相关问题:1. 不用消息队列用定时任务可以吗?对比优缺点。2. 如果本地队列满了会怎么办?处理策略。3. 消息怎么做推送?消息怎么触发?触发机制。 「百度、腾讯」 **L3 实现与应用** 1. 【延迟消息】延迟消息怎么解决?请说明RocketMQ中延迟消息的实现原理(如延迟级别、ScheduleMessageService),以及如何自定义延迟时间。 「百度」 2. 【消息可靠性保证】如何保证消息不丢失、不重复且发送成功?如果消息丢失怎么办?请从生产者、Broker、消费者三个层面分析,包括ACK机制、持久化、重试、幂等性等。 「腾讯、蚂蚁集团」 3. 【消息堆积处理】消息队列的消息堆积了如何处理?请分析堆积原因(如消费能力不足、生产过快),并给出解决方案(如扩容消费者、调整批量大小、优化消费逻辑、使用死信队列等)。 「百度、蚂蚁集团」 4. 【消息队列选型对比】为什么不用Redis的消息队列而用RocketMQ?对比Redis消息队列与RocketMQ的适用场景、可靠性、功能特性(如延迟消息、事务消息)等。 「京东」 **L4 优化与诊断** 1. 【消息队列综合应用】Kafka在AI训练流水线中解耦数据预处理与训练节点的场景题;Kafka消息积压在特征流转场景下的成因,如何从分区扩容、消费并发、下游算力排查?;RocketMQ事务消息原理及如何保证训练任务下发与资源预留的最终一致性?;怎么设计更可靠的消息投递? 「腾讯、腾讯混元」 ## 并发与多线程 **L2 原理理解** 1. 【Channel】请解释Channel的概念、与消息队列的区别以及如何使用Channel。 「腾讯」 2. 【goroutine与线程对比】goroutine 和线程有什么区别? 「百度」 3. 【volatile】volatile需要加锁吗? 「阿里巴巴」 4. 【全局锁】多线程处理是否会受到全局锁的影响? 「阿里巴巴」 5. 【多线程应用场景】多线程的使用场景? 「京东」 6. 【并发上传】支持并发上传吗? 「蚂蚁集团」 7. 【并发问题】有并发问题吗? 「阿里巴巴」 8. 【生产者消费者模式】使用生产者消费者为了解决什么问题? 「百度」 9. 【线程创建】父线程和子线程,如何创建子线程? 「百度」 10. 【线程同步】线程间同步的机制? 「百度」 11. 【线程池参数】谈谈线程池的核心参数。 「京东」 12. 【线程间通信】java里面线程之间通信方式? 「阿里巴巴」 13. 【锁类型】多线程的锁都有什么?lock和Rlock有什么区别? 「字节跳动」 **L3 实现与应用** 1. 【CAS自旋】CAS自旋会导致耗时增加吗? 「阿里通义」 2. 【goroutine调度】goroutine创建之后会被放到哪里?goroutine是如何被调度执行的?请详细说明其调度机制。 「百度、腾讯」 3. 【Handler消息分发】由一个looper创建了多个handler,那么messageQueue如何确定应该交给哪个handler去执行任务? 「百度」 4. 【ThreadLocal】谈谈ThreadLocal(包括其作用、为什么会内存泄漏、用来存什么类型的数据)。 「京东」 5. 【乐观锁】乐观锁实现逻辑? 「字节跳动」 6. 【单例模式】算法:实现一个线程安全的单例模式(构造方法需要被声明为private类型) 「阿里通义」 7. 【并发map】Go 的 map 能否并发读写?sync.Map 和普通 map 有什么区别?如果需要并发读写 map,应该怎么做? 「百度」 8. 【并发安全】如何保证并发安全? 「腾讯」 9. 【异步转同步】质疑:把异步改为同步,没有什么性能下降? 「腾讯」 10. 【悲观锁】悲观锁代码怎么写? 「字节跳动」 11. 【无锁方案】有无不加锁的方案? 「腾讯」 12. 【死锁】多线程写一个死锁。 「字节跳动」 13. 【线程不足处理】线程不足时的数据处理。 「百度」 14. 【线程与进程选择】如何选择使用线程或进程?父线程和子线程如何创建子线程?如何通信?线程间同步的机制有哪些? 「百度」 15. 【线程交替打印】手撕代码:两个线程交替打印0-100 「拼多多」 16. 【线程安全】你是如何保证线程安全的? 「百度」 17. 【线程池】讲一下java线程池? 「字节跳动」 18. 【读写锁】读写锁具体怎么工作? 「腾讯」 19. 【锁性能比较】一定比互斥锁要快吗? 「阿里通义」 20. 【锁选择】扣减使用乐观锁还是悲观锁? 「蚂蚁集团」 21. 【锁释放】如果线程执行过程中异常退出,锁一直不释放怎么办? 「百度」 **L4 优化与诊断** 1. 【信号量】生产者和消费者模型:10个线程需要先执行taskA,然后执行taskB,设计信号量。 「百度」 2. 【多进程通信】在多进程通信中,如何处理高频的规划数据发布? 「腾讯」 3. 【并发控制】性能优化、并发控制怎么做? 「美团」 4. 【并发数据迁移】如果两个线程最坏情况下迁移了同一行数据,怎么避免重复插入? 「百度」 5. 【无锁队列】平时用什么方式实现线程安全?看我简历上有延迟优化的部分,解释一下无锁队列的实现,解释一下原子序(一般不考,安心)。 「字节跳动」 6. 【死锁解决】如何利用行为树(Behavior Tree)或状态机来解决“死锁”问题? 「腾讯」 7. 【线程池参数】创建一个线程池后去设置核心线程数和最大线程数的依据是什么?怎么样设置是友好的? 「京东」 8. 【读写锁】基于互斥锁实现读写锁 「腾讯混元」 9. 【锁过期问题】如果线程不是异常退出,而是任务太慢导致锁过期,被其他线程抢走,会有什么问题? 「百度」 10. 【高并发方案选择】一个Agent的应用,想接几百个高并发,应该怎么做?是在Python虚拟机这个层面,应该是多线程还是多进程? 「阿里巴巴」 11. 【高并发计数器】算法:实现一个支持高并发的计数器(读写锁/LongAdder/CAS自旋) 「阿里通义」 **L5 综合与前沿** 1. 【线程池设计】如果你重新设计一个线程池会怎么设计? 「字节跳动」 ## 分布式系统 **L0 上下文不足(难度待定)** **上下文不足** 1. 的时候失败了怎么处理一致性保证? 「腾讯」 2. 这个解决不了超卖问题啊 「腾讯」 3. 都做了哪几种隔离? 「腾讯」 4. 除了使用分布式锁你还有别的方法来应对这个场景吗? 「京东」 **L1 基础认知** 1. 【节点间通信】比如有三台电脑,node间可以进行数据传输吗? 「百度」 **L2 原理理解** 1. 【Kubernetes存储】Kubernetes中如何做数据持久化?请解释PV和PVC是什么。 「阿里巴巴」 2. 【Kubernetes架构与原理】K8s 架构中 Master 和 Node 节点组件有哪些?K8S 的原理是什么? 「阿里巴巴、阿里通义」 3. 【MapReduce】Mapreduce介绍 「拼多多」 4. 【上下文不足】什么是outstanding? 「字节Seed」 5. 【云计算基础】请介绍云基础设施服务,包括对云计算的全面了解,如技术迭代情况以及主要玩家有哪些? 「百度」 6. 【分布式事务】什么是两阶段提交? 「字节跳动」 7. 【分布式数据库】分布式数据库介绍一下。 「百度」 8. 【分片策略】可以考虑按照用户ID或者节点分片吗?比如按用户ID取模,所有服务实例用同一套分片规则,读写都根据规则算出该去哪个小Key。 「京东、腾讯」 9. 【容器使用场景】为什么不每次开个Docker? 「腾讯」 10. 【容器编排调度】有做过容器编排/调度吗? 「阿里通义」 11. 【流量与聚合】流量规模?聚合策略? 「阿里巴巴」 12. 【消息推送】同步怎么做推送?用户之间的消息怎么推? 「腾讯」 13. 【窗口类型】sliding还是tumbling? 「字节跳动」 14. 【负载均衡】讲一下负载均衡以及有哪几种类型? 「美团」 15. 【限流算法】限流有哪些常见算法? 「百度」 **L3 实现与应用** 1. 【Kubernetes扩展性】K8s 的横向扩展能力,自定义资源。 「阿里巴巴」 2. 【Kubernetes控制器与Informer】Kubernetes控制器模式,Informer机制原理。 「腾讯」 3. 【Kubernetes网络】kube-proxy 的负载均衡机制。 Service 的网络模型。 「阿里巴巴」 4. 【Kubernetes调度器】节点亲和性Affinity调度? 「阿里巴巴」 5. 【Spark数据倾斜】Spark里面发生数据倾斜怎么办? 「京东」 6. 【冲突解决】两人同一位置写入不同内容,怎么合并?多人在线编辑如何解决冲突? 「腾讯」 7. 【分布式ID生成】详细介绍sid的生成 「美团」 8. 【分布式事务】事务层:四种请求类型,non-post与post的区别? 「字节Seed」 9. 【分布式存储】详细解释OSS、NAS和Longhorn是什么,它们之间的异同? 「阿里巴巴」 10. 【分布式数据分片与路由】分布式的话KV怎么散列?怎么决定他在哪个节点? 「阿里巴巴」 11. 【分布式系统原理】分布式怎么实现? 「蚂蚁集团」 12. 【分布式锁】为什么使用分布式锁?请结合项目讲一讲分布式锁的使用场景、锁的对象和范围,以及实施方案。分布式锁你是如何使用的?分布式锁的持有最大时间5s和10s怎么决定?第一个请求一直占用这个分布式锁怎么办? 「京东、百度」 13. 【分片上传】如何保证分片上传后文件的完整性?分片上传之后还会做文件的拼接吗? 「百度、蚂蚁集团」 14. 【分片策略】在按房间ID分片时,主播、主持人和管理员消息无法仅在一个分片内处理,且所有用户room_id相同导致分片失效;若按用户子房间分片,会有什么问题? 「腾讯」 15. 【容器运行时】详细解释容器运行时runtime,讲讲docker、containerd、rkt。 「阿里巴巴」 16. 【幂等性】如何保证接口的幂等性?例如在重复点赞场景中,通过user+post去重,保证幂等。 「字节跳动、百度」 17. 【序列化】下游序列化/反序列化风险?微服务架构中涉及客户端和服务端的通信,避免不了序列化和反序列化,谈谈你项目中用的什么序列化方式,你还了解哪些不同的序列化方式,它们的差异和应用场景有什么不同? 「京东、阿里巴巴」 18. 【异常兜底设计】异常兜底怎么设计?已有定时任务兜底,为什么不能用? 「腾讯、阿里巴巴」 19. 【接口兼容性】把一个 RPC 接口的返回值从 Map 改成 DTO,下游服务会不会出错? 「阿里巴巴」 20. 【消息推送】在消息推送场景中,如果有一百万用户,其中千分之一每秒发言(即一千条/秒),用户是否看得完?如果每秒推送一次,仍然要给一百万用户发一遍,怎么办? 「腾讯」 21. 【窗口快照修正】窗口结束后如何修正快照? 「字节跳动」 22. 【网络地址管理】当前做的工作里有没有碰到更先进一些的地址管理或者互联能力? 「阿里巴巴」 23. 【重试与熔断】重试熔断机制(固定次数/指数退避)? 「美团」 24. 【链路追踪】怎样的结构才能更好地追踪整个Trace? 「美团」 25. 【高并发处理】在大促高并发场景中如何保证响应速度? 「京东」 **L4 优化与诊断** 1. 【AI服务高可用设计】如何实现AI服务的高可用?请设计超时重试、熔断、降级、幂等机制,并针对风控系统中的单点故障进行预防和降级方案设计。你提到的限流和熔断具体是如何实施的?比如你是基于什么条件触发熔断的?限流的策略又是如何设计的? 「美团、蚂蚁集团、阿里通义」 2. 【Kubernetes Operator开发】Kubernetes Operator开发经验,如何设计CRD满足业务需求? 「腾讯」 3. 【Kubernetes发布与扩缩容】讲讲k8s容灾机制,蓝绿发布、金丝雀发布,自动扩缩容的HPA和VPA等内容。 「阿里巴巴」 4. 【Kubernetes调度器】Kubernetes调度器工作原理,如何扩展调度器满足AI负载需求?你需要实现一个带策略权衡的调度器,而不是纯轮询。 「腾讯、蚂蚁集团」 5. 【多频率数据对齐】感知、定位、规划分别运行在不同频率(如10Hz,100Hz,20Hz),如何保证规划模块拿到的时间戳对齐的数据? 「腾讯」 6. 【大key拆分一致性】比如有个hash的大key,某个版本拆开后删掉了,那么怎么保证数据的一致性? 「京东」 7. 【大规模文件分发】有一个10T的大文件,要发到北上广深、美国、德国、新加坡,大概10万台服务器(类似Linux服务器),要发到它的data Workspace目录下,大概怎么处理? 「腾讯」 8. 【节点间通信】说一说节点间的通讯吧,如果让你实现节点间的通讯你可能会采取什么样的方式? 「百度」 9. 【高并发处理】如何在高并发场景下保证一致性?请描述一个你处理过的AI平台高并发问题的案例,以及你的解决方案。 「京东、百度」 ## 系统设计 **L2 原理理解** 1. 【全局参考线地图】介绍一下全局参考线用的地图。 「百度」 **L3 实现与应用** 1. 【DTO变更影响】Object改成DTO,下游服务会不会炸? 「阿里巴巴」 2. 【Feed流架构】百度feed流大概架构? 「百度」 3. 【任务库与查询库分离】随着数据量变大,你们有没有考虑把任务库和在线查询库拆开? 「百度」 4. 【分片上传设计】分片上传为什么选择50mb,理由是什么? 「蚂蚁集团」 5. 【平台系统架构】平台整体系统架构组成 「蚂蚁集团」 6. 【拉取与推送对比】在这种大流量场景下,客户端拉取和服务端推送各有什么优缺点? 「腾讯」 7. 【搜索请求处理流程】假设在百度网页上输入一个词,点了一下搜索,从点击开始到结果出来,中间会经历哪些过程? 「百度」 8. 【数据库远程备份】数据库远程备份系统 「百度」 9. 【模块放置环节】在线链路中,这个模块应该放在哪个环节? 「腾讯」 10. 【模块间协议设计】各个模块之间的协议是怎么设计的? 「阿里巴巴」 11. 【系统搭建方法】现有“积木”已经有了,系统该怎么搭? 「阿里巴巴」 12. 【系统模块实现】现在开始实现核心类型定义、配置管理、后端管理、路由策略等模块。 「蚂蚁集团」 13. 【系统瓶颈分析】怎么分析系统瓶颈? 「腾讯」 14. 【设计选择理由】你更倾向于使用哪种设计?为什么? 「腾讯」 15. 【跨Session日志记录】跨Session是否需要记录日志系统? 「美团」 **L4 优化与诊断** **点赞统计与Top-K系统** 1. 设计一个系统,支持精确查询(如指定post过去一分钟的点赞数)和近似热门榜(如全局Top-K、按region的Top-K)。要求:精确查询必须准确,热门榜可以近似。 「字节跳动」 2. 设计系统支持:指定post过去一分钟的点赞数、全局Top-K、按region的Top-K。要求精确查询准确,热门榜可以近似。请给出数据模型、存储方案、计算逻辑和接口设计。 「字节跳动」 1. 【TUI视频剪辑工具分层架构】如果让你开发一个带TUI界面的交互式视频剪辑工具(MVP版),你会怎么设计分层架构?请描述各层职责(如UI层、业务逻辑层、数据层)、模块划分和交互流程。 「字节跳动」 2. 【分段设计问题分析】如果从北京到新疆,分成一百个段,按照你的设计(如视频剪辑或聊天系统),会有什么问题呢?请分析分段带来的延迟、一致性、上下文丢失等问题,并提出解决方案。 「蚂蚁集团」 3. 【大模型接口重试与降级】你在项目里遇到过大模型接口调用超时或限流的问题吗?怎么设计重试与降级机制?请详细说明重试策略(如指数退避、最大重试次数)、降级方案(如返回缓存结果、默认值、提示用户)以及如何保证用户体验。 「字节跳动」 4. 【子房间与上下文分片】在聊天系统或视频剪辑工具中,可以设计子房间吗?如何通过分片控制每个用户看到的上下文?请设计子房间的分片策略,确保用户只看到相关上下文。 「腾讯」 5. 【实时排行榜设计】场景题:要做一个实时的歌曲播放量排行榜,怎么设计服务端?请考虑实时性、准确性、可扩展性,包括数据采集、存储、计算和展示方案。 「腾讯」 6. 【性能成本可维护性平衡】如何平衡系统的性能、成本和可维护性?请从架构设计、技术选型、运维策略等方面阐述,并给出具体例子。 「蚂蚁集团」 7. 【点对点聊天系统架构】设计点对点聊天系统架构,包括用户注册、登录、好友管理、消息发送与接收、离线消息处理、消息存储等模块。要求支持高并发、低延迟、可靠传输。 「字节跳动」 8. 【自动周报系统设计】设计一个自动周报系统,每周自动整理工作周报并发送到老板邮箱。要求:1)分成至少5个子任务;2)指出哪些子任务需要人工参与,哪些是全自动的;3)如果用户这周没有记录,如何处理这种异常? 「美团」 9. 【限流熔断用户体验保障】在限流和熔断的过程中,如何确保用户体验不会受到过多影响?比如,当用户触发现流或熔断时,你是否设计了备用方案或降级策略?如果有,能具体讲讲是怎么实现的吗?请详细说明降级策略(如返回缓存数据、简化功能、排队等待)和用户体验保障措施。 「美团」 10. 【高并发服务能力】一个并发量比较高的to C业务场景,你的服务应该具备哪些能力?请从高并发、高可用、可扩展、安全性等方面阐述。 「阿里巴巴」 **L5 综合与前沿** 1. 【AI Coding系统设计】设计一个AI Coding系统。 「阿里巴巴」 2. 【多端App Demo设计】设计一个千问App的demo,支持Web端、Android端、iOS端。 「阿里巴巴」 3. 【实时多模态数据流架构】当需要处理实时多模态数据流时,你的架构设计思路是什么? 「蚂蚁集团」 4. 【实时音视频传输系统】请设计一个实时音视频传输系统,说明其关键技术和挑战? 「字节跳动」 5. 【智能客服系统架构】设计一个企业内部的智能客服系统,支持多产品线知识库隔离、多租户权限控制,以及回答质量的可观测性监控,请描述整体架构。 「字节跳动」 6. 【百万级直播间评论系统】设计一个支持百万级用户同时在线的直播间的评论系统。怎么做消息推送? 「腾讯」 7. 【群聊系统设计】设计万人级群聊系统。 「字节跳动」 8. 【高并发大模型推理服务架构】设计一个高并发的大模型推理服务(日活百万级),画架构图。 「百度」 ## 编程语言 **L0 上下文不足(难度待定)** **上下文不足** 1. amend的作用 「百度」 2. contiguous的作用? 「腾讯」 3. C++中,什么函数的作用? 「字节跳动」 4. G0程序编程是什么? 「百度」 5. golang平时写的多吗? 「阿里巴巴」 6. Go程序是什么? 「百度」 7. java掌握到什么程度? 「阿里巴巴」 8. Lua里面那个你用的主要是用哪几个命令? 「百度」 9. 怎么去调整代码块或者别的区块的渲染样式 「阿里巴巴」 10. 有没有用过一些比较高级的用法(如快捷命令、命令行等)? 「腾讯」 11. 系统用了什么语言? 「腾讯」 12. 编码是怎么操作的? 「美团」 **L1 基础认知** 1. 【C++ const】const关键字 「百度」 2. 【C++ STL容器】C++里STL库有哪些常用容器?对STL熟悉吗? 「百度、腾讯」 3. 【C++能力】了不了解C++,能不能快速的复习重新掌握? 「百度」 4. 【Java数组】Java基础,数组... 「腾讯」 5. 【Java集合】Java集合基础。 「美团」 6. 【Python元组与列表】Python 元组和列表的区别和相同点? 「阿里巴巴」 7. 【命名规范】在命名布尔值变量时,哪种命名方式更好? 「美团」 8. 【编程语言熟悉度】优化方法是什么编程语言?会Java吗?会不会C++和Java?写过C++吗?你平常使用什么编程语言?主语言是Python吗?你最熟悉的语言是哪一个? 「字节Seed、拼多多、百度、美团、腾讯、阿里巴巴」 **L2 原理理解** 1. 【Activity启动模式】Activity的四种启动模式:standard、singleTop、singleTask、singleInstance。请分别说明其特点和应用场景。 「百度」 2. 【Android Context】ApplicationContext和ActivityContext的不同和应用场景。ApplicationContext生命周期与应用进程一致,适合全局操作;ActivityContext与Activity绑定,适合UI相关操作。 「百度」 3. 【C++11新特性】C++11中的新特性有哪些?包括auto、decltype、nullptr、范围for、lambda表达式、右值引用、移动语义、智能指针、unordered容器、正则表达式等。 「百度」 4. 【C++ const与constexpr】const和constexpr的区别。const表示变量不可修改,但初始化可以在运行时;constexpr表示常量表达式,必须在编译期求值,用于优化和模板元编程。 「百度」 5. 【C++ static】C++ static关键字的用法:静态局部变量(生命周期延长)、静态全局变量/函数(文件作用域)、静态成员变量(类内声明,类外定义,所有对象共享)、静态成员函数(无this指针,只能访问静态成员)。 「百度」 6. 【C++与Java对比】C++与Java有什么不同?多态方面:C++支持编译时多态(函数重载、模板)和运行时多态(虚函数),Java支持重载和重写(虚方法默认)。其他区别:内存管理、指针、继承机制等。 「美团」 7. 【C++与Python对比】C++与Python有什么不同?请从内存管理、智能指针等方面进行说明。C++手动管理内存,Python自动垃圾回收;C++有智能指针(shared_ptr, unique_ptr, weak_ptr),Python无指针概念;C++编译型,Python解释型;C++性能高,Python开发快。 「美团、阿里通义」 8. 【C++临时对象】C++临时对象产生的时机:值传递参数、函数返回对象、类型转换、表达式求值(如a+b返回临时对象)。 「百度」 9. 【C++关键字】C++关键字volatile/const/mutable/explicit的作用。volatile防止编译器优化,每次从内存读取;const定义常量;mutable允许在const成员函数中修改;explicit防止隐式转换。 「百度」 10. 【C++内存分区】C++内存分区:栈(局部变量)、堆(动态分配)、全局/静态区(全局变量、静态变量)、常量区(字符串常量)、代码区(函数代码)。 「百度」 11. 【C++多态】C++多态怎么实现?C++多态分为编译时多态(函数重载、模板)和运行时多态(虚函数)。运行时多态通过虚函数表(vtable)实现:基类指针或引用调用虚函数时,根据实际对象类型动态绑定。 「百度、腾讯」 12. 【C字符串函数】strcpy函数和strncpy函数的区别?哪个函数更安全? 「百度」 13. 【C++引用与指针】引用和指针的区别? 「百度」 14. 【C++性能】C++为什么偏底层,为什么你觉得C++快?C++直接操作内存,无运行时开销(如垃圾回收),零开销抽象,编译优化,适合系统编程。 「百度」 15. 【C++指针与常量】常量指针和指针常量的区别?请解释指针常量、常量指针以及常指针常量的概念。 「字节跳动、百度」 16. 【C++指针与智能指针】C++中,指针和智能指针的区别?原始指针需手动管理内存,易泄漏;智能指针自动管理生命周期:unique_ptr独占所有权,shared_ptr共享所有权(引用计数),weak_ptr弱引用避免循环引用。 「字节跳动」 17. 【C++智能指针】C++智能指针:shared_ptr(引用计数)、unique_ptr(独占所有权)、weak_ptr(弱引用,避免循环引用)。使用make_shared/make_unique创建。 「百度」 18. 【C++模板】C++模板:函数模板和类模板,支持泛型编程。模板特化、偏特化,模板元编程。 「百度」 19. 【C++类型转换】C++中四种强制类型转换(static_cast、dynamic_cast、const_cast、reinterpret_cast)分别是什么?它们与C语言类型转换的区别是什么?为什么要用static_cast而不用C语言中的转换?static_cast用于相关类型转换,编译时检查;dynamic_cast用于多态类型向下转换,运行时检查;const_cast去除const属性;reinterpret_cast用于不相关类型转换。C风格转换过于强大,易出错。static_cast更安全,意图明确。 「百度」 20. 【C++编译链接】C++编译链接流程:预处理(宏展开、头文件包含)、编译(生成汇编)、汇编(生成目标文件)、链接(合并目标文件和库,生成可执行文件)。 「字节跳动」 21. 【C++虚析构函数】C++的虚析构函数是什么?当基类指针指向派生类对象时,通过基类指针删除对象,若析构函数非虚,则只调用基类析构,导致派生类资源泄漏。虚析构函数确保正确调用派生类析构。 「腾讯」 22. 【Git rebase】git rebase的作用 「百度」 23. 【Go defer】Go 语言中 defer 是什么时候执行的?多个 defer 的执行顺序是怎样的? 「百度」 24. 【Go GC】Go 的垃圾回收机制是什么? 「百度」 25. 【Java equals与hashCode】重写String的equals方法,通常还会重写一个方法是什么,为什么要重写hashcode()? 「百度」 26. 【Java字符串对象】String a = new String("abc")会生成几个对象?String a = new String("abc") String b = new String("abc")对于这个,a==b? a.equals(b)? 「百度」 27. 【JVM GC】JVM垃圾回收机制 「百度」 28. 【JVM监控】如何查看JVM进程的内存占用? 「阿里通义」 29. 【JVM跨平台】JVM跨平台原理? 「字节跳动」 30. 【MyBatis vs MyBatis-Plus】mybatis和mybatisplus版本的区别 「腾讯」 31. 【new vs malloc】new和malloc的区别? 「百度」 32. 【Python GIL】Python全局解释器锁(GIL)是什么?请解释其作用及对多线程的影响。为什么要有GIL?Python多线程是否了解?为什么说Python的多线程比较鸡肋? 「字节跳动、百度、阿里巴巴」 33. 【Python装饰器】Python装饰器作用。 「阿里巴巴」 34. 【RAII】RAII原则和应用 「百度」 35. 【ROS】ROS1和ROS2的区别是什么?ROS中的节点和话题是什么? 「百度」 36. 【static关键字】static的用法是什么?关键字static修饰局部变量和全局变量的含义有什么不同? 「百度」 37. 【std::vector扩容】C++中std::vector的扩容机制是怎样的?当size()==capacity()时,分配新内存(通常为原容量的1.5或2倍),将原元素移动或拷贝到新内存,释放旧内存。 「腾讯」 38. 【this指针】介绍this指针。 「百度」 39. 【内存管理】堆内存和栈内存的区别?用pointer定义一个类型A,它是放在堆上还是栈上? 「百度、阿里巴巴」 40. 【单例模式】什么情况下用饿汉式,什么情况下用懒汉式? 「京东」 41. 【多态】多态指的是什么?它是如何实现的? 「百度」 42. 【宏计时】timing宏的计时原理是什么? 「百度」 43. 【智能指针】介绍智能指针。 「百度」 44. 【架构模式对比】MVP、MVVM对比MVC的理解。 「百度」 45. 【编译过程】介绍编译过程,包括编译分哪些步骤? 「字节跳动、百度」 46. 【虚函数】虚函数、纯虚函数、虚析构函数的概念及使用场景。什么时候声明纯虚函数?什么时候使用普通虚函数而不是纯虚函数? 「百度、腾讯」 47. 【设计模式分类】设计模式使用过嘛,设计模式的三大类是什么? 「百度」 48. 【语言对比】对比一下C++和Python的区别?每个语言的优劣势? 「百度、阿里巴巴」 **L3 实现与应用** 1. 【C++ atomic】C++ atomic如何实现的? 「百度」 2. 【C++ vector内存管理】简单说说Vector的内存管理逻辑? 「腾讯」 3. 【C++值类别与移动语义】左值&右值&左值引用&右值引用&move。 「百度」 4. 【C++协程】C++20协程是有栈还是无栈?C++协程(Coroutine)的特点是什么?C++协程有栈和无栈的区别? 「字节跳动」 5. 【C++多态】C++多态分静态多态和动态多态两种,静态多态一般是指函数重载,其实奇异递归模版CRTP也可看做一种静态多态,动态多态是靠虚函数实现的。 「百度」 6. 【C++标准库】std forward,move,enable if各有什么作用? 「百度」 7. 【C++模板特化】模板实例化、特例化、偏特化的概念。 「百度」 8. 【C++重写与C语言调用】说一下重写,c语言中有重写吗?换句话说,你知道在c++中调用c语言用什么声明吗?编译的时候怎么处理重写的? 「百度」 9. 【Go空结构体用途】空结构体 struct{} 还有什么用途? 「百度」 10. 【Java GC原理】请你解释一下垃圾回收机制 GC 的基本原理,以及它在 Java 中的作用是什么? 「美团」 11. 【JVM参数调优】有没有调整过JVM参数? 「阿里通义」 12. 【JVM类加载机制】怎么把class文件加载到jvm中? 「字节跳动」 13. 【MFC消息处理】MFC消息处理如何封装的? 「百度」 14. 【Python GIL】GIL设计的初衷是什么,源码是否了解? 「阿里巴巴」 15. 【Python并发编程】Python工程相关(异步/多线程/多进程)经验? 「阿里巴巴」 16. 【ThreadLocal】ThreadLocal内存泄露 「京东」 17. 【volatile关键字】volatile关键字在嵌入式中的用法及为什么要加volatile关键字? 「字节跳动、百度」 18. 【事件分发】事件分发机制有了解嘛,嵌套的事件拦截怎么写(比如说子组件消费滑动100px后,父组件来继续消费)? 「百度」 19. 【代码质量】你如何保证代码质量和可维护性? 「蚂蚁集团」 20. 【写屏障】写屏障是为了解决什么问题? 「百度」 21. 【单例模式】单例模式实现:1. 延迟加载(懒汉式)2. 双重校验锁(DCL)3. 静态内部类。手撕代码。追问:synchronized锁一个静态变量可以吗?getInstance方法用static修饰,锁的是什么?第一个if去掉可以吗?第二个if去掉可以吗?为什么要用volatile修饰单例变量? 「百度」 22. 【单元测试Mock】单元测试中的mock是怎么实现的? 「字节跳动」 23. 【左值右值】介绍左值、右值、万能引用和完美转发。 「百度」 24. 【异常安全】业务异常导致remove未执行,怎么确保业务抛异常不会阻止remove?如果业务逻辑抛出异常,会不会导致最后的remove没有执行? 「京东」 25. 【智能指针】智能指针:1. shared_ptr引用计数用什么数据结构实现?可以用static变量吗?可以用int类型吗?shared_ptr何时析构?2. 智能指针是否是线程安全的?vector原理?3. 智能指针有哪些?shared_ptr和unique_ptr使用场景,如何避免循环引用(weak_ptr作用),weak_ptr中如何调用shared_ptr?两个指针引用计数永不下降为0的情况叫什么?4. shared_ptr引用计数可以用int类型吗? 「字节跳动、百度、腾讯」 26. 【编程语言选择】你认为公司或者一个项目会出于什么考虑去选择编程语言? 「京东」 27. 【编译优化】编译期优化的一些方法? 「阿里巴巴」 28. 【虚函数表】虚函数表:1. 如何确定目标虚函数在虚表中的位置?2. 虚函数表存放在哪里,怎么管理,每个类一个吗?多继承情况下的虚函数表是怎样的?3. 解释virtual的原理。 「字节跳动、百度、腾讯」 29. 【迭代器失效】容器内部删除一个元素,erase迭代器失效问题。 「百度」 **L4 优化与诊断** 1. 【C++内存操作风险】成员函数里memset(this, 0, sizeof(*this))会发生什么? 「百度」 2. 【GC排查】GC严重需要如何排查? 「阿里巴巴」 3. 【Java并发】从hashmap问到concurrentHashmap问到红黑树问到锁,问到CAS问到volatile问到内存屏障。 「百度」 4. 【Python GIL】讲一下Python的GIL机制,在I/O密集和CPU密集的大模型任务里分别会有什么影响? 「字节跳动」 5. 【垃圾回收器】你如何理解垃圾回收器的选择对性能的影响?比如在什么情况下会选择使用 G1 收集器而不是 CMS 收集器? 「美团」 ## 其他后端基础 **L1 基础认知** 1. 【运维经验】有运维的经验吗? 「阿里巴巴」 **L2 原理理解** 1. 【API兼容性】API兼容性? 「阿里巴巴」 2. 【Docker Compose】docker-compose? 「阿里巴巴」 3. 【文档系统对比】为什么选notion呢?它和其他的文档系统比,你觉得好在哪里? 「蚂蚁集团」 **L3 实现与应用** 1. 【Docker与推送策略】1. Docker容器刷盘策略:请解释Docker容器的刷盘策略(如fsync、数据持久化、存储驱动对刷盘的影响等)。 2. 推送策略:在数据传输或日志推送中,是采用每字符推送还是分块推送?请比较两种方式的优缺点及适用场景。 「腾讯、阿里巴巴」 # 数学统计与逻辑 ## 概率论 **L1 基础认知** 1. 【概率分布与几何分布期望】1. 概率分布是什么?2. 一个硬币,摇到正面的期望次数是多少?(几何分布期望) 「字节跳动、拼多多」 **L2 原理理解** 1. 【二项分布与泊松分布】二项分布和泊松分布的关系。 「拼多多」 2. 【单位圆内距离期望】单位圆内随机点到圆心距离的期望计算。 「百度」 3. 【排列组合概率】一道排列组合的概率题。 「腾讯、腾讯混元」 4. 【掷骰子集齐六面期望】概率题:怎么扔骰子能扔出不同的六个面,求期望? 「美团」 5. 【条件概率与贝叶斯】一道条件概率计算。 「拼多多」 6. 【样本均值的方差】X1,X2,...,Xn是独立同分布的随机变量,服从正态分布,推导X均值的方差。 「字节Seed」 7. 【模型输出差异】差多少(0.5,随机猜测) 两个模型,一个是另一个输出的两倍,? 「百度」 8. 【熵与KL散度】请解释熵、交叉熵和KL散度的定义、联系与区别,并直观理解KL散度公式所衡量的差异,同时计算KL散度。 「京东、腾讯混元、阿里巴巴、阿里通义」 9. 【球与篮子分配】概率题:将6个不同的球放到5个不同的篮子里,每个篮子至少一个球,有几种放法? 「字节跳动」 10. 【硬币概率事件】一道概率题:给你一枚硬币,正面朝上概率为p,反面朝上概率为1-p;定义事件组:最终各个事件的发生概率为? 「阿里通义」 11. 【轮流抛硬币先手胜率】两个人轮流抛硬币,先抛到正面算赢。计算先手获胜的概率。 「百度」 12. 【连续两次正面期望】投硬币,连续两次为正的数学期望是多少? 「字节跳动、蚂蚁集团」 13. 【顺序统计量期望】A和B是独立同分布的[0,1]均匀分布,求max(A,B)期望值。 「字节Seed」 14. 【骰子点数分布】n个骰子的点数分布。 「百度」 15. 【高斯分布与零均值】为什么A高斯B零?能不能反过来A零B高斯? 「百度」 **L3 实现与应用** 1. 【不公平硬币公平抛】有一枚质量不均匀的硬币,抛出后正面概率为0.3,背面概率为0.7,如何让两个人通过抛硬币达成公平结果? 「字节跳动」 2. 【圆周三点锐角三角形概率】数学题: 圆周上随机取三点构成锐角三角形的概率推导。 「字节Seed」 3. 【奖励序列概率】M个行为N个奖励,都是概率。求一个指定奖励序列的概率。 「字节跳动」 4. 【条件概率与贝叶斯】概率题: 甲乙做题正确率分别为0.9和0.5,ABC三个选项,他们同时选了A,A是正确答案的概率是多少? 「腾讯」 5. 【连续两个6期望次数】概率题: 给一个骰子,连续投掷两个6为止停下,求投掷的次数期望。 「阿里巴巴」 6. 【重要性采样与拒绝采样】讲讲重要性采样和拒绝采样? 「阿里巴巴」 **L4 优化与诊断** 1. 【卡尔曼滤波】请简要推导卡尔曼滤波的五个公式,并说明在规划中如何利用它进行状态预测? 「腾讯」 2. 【差分隐私】请解释差分隐私(Differential Privacy)的基本概念和核心机制(如拉普拉斯噪声),并讨论其在金融数据建模中可能的应用。 「蚂蚁集团」 3. 【蒙特卡洛与TreeSHAP】蒙特卡洛算法、TreeSHAP。 「美团」 ## 数理统计 **L1 基础认知** 1. 【p值与置信区间定义】1. 什么是p值?2. 置信区间是什么? 「京东、拼多多」 **L2 原理理解** 1. 【p值与样本量关系】样本量增大p值一定更小吗? 「京东」 **L3 实现与应用** 1. 【双重差分法假设】DID需要满足什么假设? 「百度」 2. 【大样本抽样方法】当日志量比较大的情况下采取什么样的统计学方法能够以尽量少的样本使得不丢失过多信息? 「百度」 **L4 优化与诊断** 1. 【时间序列突变分析】时间序列不平稳时可能出现陡增突变,如何统计分析以区分机制性改变与偶然事件?请讨论检测方法(如CUSUM、贝叶斯变点检测)、假设检验、模型选择及后续建模策略。 「京东」 2. 【最小二乘与最大似然关系】最小二乘和最大似然的关系,为什么等价?请手推:在线性回归模型误差服从正态分布时,最小二乘估计等价于最大似然估计。 「字节Seed」 ## 线性代数 **L2 原理理解** 1. 【矩阵运算与特征值】矩阵计算:包括矩阵的秩计算、特征值计算。 「百度、阿里通义」 **L3 实现与应用** 1. 【线性代数综合】1. PCA和SVD的区别? 2. 求y=Wx+b梯度 「字节跳动、美团」 ## 微积分 **L3 实现与应用** **微积分** 1. 无穷级数?原记录未说明具体问题。 「腾讯」 2. 计算自然对数e。 「阿里巴巴」 3. 请推导笛卡尔坐标系下的量转换到Frenet坐标系下的量(如横向误差、横向变化率)的数学关系。 「腾讯」 4. 轨迹插值如何保证转向角是连续的? 「美团」 5. 边界条件怎么处理?原记录未说明具体场景。 「美团」 ## 优化理论 **L3 实现与应用** 1. 【优化理论】优化理论综合:包括Max_x对结果的影响、scaling和Hessian矩阵原理、五次多项式拟合选择原因、OSQP求解非线性优化、最小二乘拟合三次曲线、约束条件和目标函数、线搜索与信赖域区别联系、轨迹优化函数推导、运筹学、贝叶斯优化、非线性约束线性化(含KKT条件)。 「京东、百度、美团、腾讯、阿里巴巴、阿里通义」 ## 逻辑智力题 **L0 上下文不足(难度待定)** **上下文不足** 1. 5分钟3元 3公里经过3个红绿灯 ED段步行(5分钟) ED段骑行(2.5分钟) DB段乘88路(16分钟) 至组合方案中 「蚂蚁集团」 2. 手撕,考了一道智力题 「蚂蚁集团」 3. 智力题加手撕。 「阿里巴巴」 4. 请你猜出这a,b这两个数字。 「阿里巴巴」 **L2 原理理解** 1. 【取石子游戏】逻辑题:100个圆圈涂色,双方只能涂一个或者两个,谁能涂到最后一个? 「字节跳动」 2. 【天平找重球】九个球,其中一个重,其余相等,你有一个天平,问最少几次把最重的球称出来? 「字节跳动」 3. 【点与三角形位置】给定一个三角形,一个点,求解点是否在三角形外边? 「美团」 4. 【阶乘末尾零】数字1×2×3×...×100,其结果末尾有多少个零? 「京东」 **L3 实现与应用** 1. 【天平找异球】有12个外观相同的小球(或芯片),其中一个重量与其它不一样(但不知道是轻了还是重了),用天平最少称几次能找出那个不同重量的球? 「百度、阿里巴巴」 2. 【对称策略】圆形无网格、可自由落子棋盘,先手第一步适合下在哪里?后手采取怎样的落子策略,能保证自己一直有棋子可下?中心对称落子策略为什么能保证永远有棋可下? 「百度」 3. 【最小包络矩形】给定点以及航向,计算最小包络矩形 「美团」 4. 【毒药与老鼠】有十瓶药水,以及若干老鼠,喝了药水后24h死亡,问最少需要多少老鼠可以在24h内确定哪瓶药水有毒? 「百度」 5. 【水壶问题】思考题:三个水桶:3L7L10L,只有10L的水桶装满着水,如何在不浪费水的情况下生成一个5L的水? 「百度」 6. 【费米估算】还有个问题是如何估算一个房间能装多少高尔夫球,大概这类的。 「百度」 **L4 优化与诊断** 1. 【费米估算】请估算以下场景的数值,并说明估算逻辑:1. 京东每日AI推理请求量;2. 抖音每日产生的音视频数据量;3. 抖音直播的峰值流量;4. 抖音直播的带宽需求;5. 抖音直播的并发用户数;6. 抖音短视频的存储需求;7. 抖音短视频的日活用户数;8. 自动驾驶车辆在城市道路中需要多少测试里程才能达到足够的可靠性。 「京东、字节跳动」 2. 【运煤问题】煤老板需将3000吨煤运到1000公里外的市场,每辆火车最大载重1000吨,每公里耗煤1吨,如何运输能使最后到达的煤最多?能到达多少煤? 「腾讯」 ## 其他数学 **L3 实现与应用** 1. 【PID控制】PID里的PID分别是什么,调节的参数有哪些,怎么调? 「百度」 2. 【Shapley值】shaply值复杂度体现在哪,怎么计算高纬度特征? 「美团」 3. 【Sinkhorn算法】sinkhorn的原理? 「阿里巴巴」 4. 【帕累托最优】介绍一下帕累托? 「字节跳动」 5. 【数学解释与等价性】你能从数学角度简要解释一下吗?公式了解多少?数学上等价吗? 「字节Seed、百度、阿里巴巴」 # 项目论文与经历 ## 项目介绍 **L0 上下文不足(难度待定)** **上下文不足** 1. 介绍一下,当时说了。 「腾讯混元」 2. 介绍一下,当时说了Qwen和。 「腾讯」 3. 你的agent项目涉及到很多东西,比如mcp啊,skil啊。然后过年的时候小 「京东」 4. 如何理解两者的gap? 「字节跳动」 5. 讲一下你的理解 「美团」 **L1 基础认知** **项目介绍** 1. 请介绍你的实习项目,包括:项目背景、数据格式、业务场景、团队规模与分工、个人贡献与参与方式、项目来源与协作方式、使用的模型与AI工具(如编程语言、代码量、常用模型、AI辅助开发工具及使用感受)、研究方向与工作内容(如实验室方向、代码与AI比例)、竞赛贡献、量化方法学习途径、个人背景与项目匹配(如基础架构或模型压缩方向)、相关工作了解(如小米的work)、项目展示(如PPT)。 「字节Seed、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 2. 请介绍你的项目经历(挑一个),说明你承担的角色(例如在Agent协作平台中你是主导吗?)、个人职责(负责的部分、工作内容、边界、角色和工作占比)、团队分工及依据、项目团队规模(两个项目各有多少人参与?)、项目基础(base在哪里?)、项目概述(大概说下,不要说细节)、主要业务(做什么业务)、业务任务举例、主要模型/使用模型、微调经验(你之前的经历中有做过微调吗?)、技术方向熟悉度(CV/LLM/多模态哪个更熟?)、Python技能(精通么?)、未做原因(为什么你没做?)、项目贡献和成果、项目收获、综合经历与绩效(QA及其他在校经历,现在的绩效职级等)、自我介绍与简历(介绍自己并聊简历)、PPT+论文几个介绍。 「京东、字节Seed、字节跳动、拼多多、百度、腾讯、蚂蚁集团、阿里巴巴」 3. 请介绍你的项目经历,重点包括:1. 自我介绍,重点介绍Agent相关项目经历。2. 做了什么工作?3. 讲一下做了哪些内容,穿插提问。4. 先用一两句话讲清楚这个项目解决什么问题。5. 具体介绍项目,项目规模,是否上线,具体应用?6. 具体作用是什么?7. 具体分哪些步骤?8. 具体是怎么用的?9. 关于这些都怎么做的?10. 分析自己的简历。11. 八股简历深挖。12. 做这个项目有对标产品吗?13. 做过工程向的项目有哪些?14. 讲一下包含哪些模块?15. 包括但不限于,使用的数据集,是在什么情景下?16. 刚才听到你最开始说上下文存在噪声,对吧?17. 前端做起来有没有什么收获?18. 剩下的10%哪来的?19. 做日志或者审计了吗?20. 入职后工作内容,for数据or训练or评测。 「京东、字节Seed、字节跳动、百度、美团、腾讯、蚂蚁集团、阿里巴巴」 4. 项目介绍综合题:请介绍你最喜欢/最有成就感的项目,包括项目背景与动机、团队人数与个人角色(是否有带队经验)、工作量与个人贡献、是否落地、预训练经验等。 「字节跳动、百度、美团、蚂蚁集团」 1. 【Agent项目来源】你做的这个agent项目是基于开源项目二次开发的吗? 「京东」 2. 【AI产品开发经验】你参与或者独立开发过AI产品或功能吗? 「美团」 3. 【AI使用方式】你让AI怎么做? 「阿里巴巴」 4. 【AI编程】有没有过ai coding过? 「阿里巴巴」 5. 【AI编程使用经验】你平时学习或者做简历上这些项目的时候用过ai编程吗? 「京东」 6. 【AI编程感想】询问 AI coding 的感想 「蚂蚁集团」 7. 【与KSM的关系】和KSM的关系? 「阿里巴巴」 8. 【业务介绍】组内主要业务/工作是什么? 「百度、腾讯」 9. 【个人背景询问】日常询问,学校、论文。 「美团」 10. 【代码文档】有没有必要的注释/文档? 「阿里巴巴」 11. 【任务输出描述】在校项目任务的输出可以简单描述并举例吗? 「百度」 12. 【优化方向偏好】更倾向于做哪方面的优化? 「阿里巴巴」 13. 【关键算法了解程度】你简历里提到了好几个方向的关键算法,这些你都了解吗? 「京东」 14. 【其他项目工作】在我的另一个项目中,我做了哪些工作? 「蚂蚁集团」 15. 【团队分工与协作】方向有几个人在做?模型组和策略组的关系? 「腾讯」 16. 【团队变动】后面客户负责这个的团队裁了? 「阿里巴巴」 17. 【团队规模与分工】你所在的团队规模和分工是怎样的? 「字节跳动」 18. 【在校经历】在校经历,成绩、竞赛、科研等 「阿里巴巴」 19. 【基座模型选择】基座用没用大模型? 「百度」 20. 【基线工作】在oppo的话主要是做些基线的工作吗? 「腾讯」 21. 【多智能体数量】实习中多智能体系统包含几个智能体? 「百度」 22. 【大模型实践】大模型的实践还做过什么实践嘛? 「字节跳动」 23. 【大模型经历】有没有大模型经历 「拼多多」 24. 【大模型运行经验】你提到的这些大模型你自己跑过哪些? 「美团」 25. 【学术背景】询问学校专业方向、讲学校课题 「百度」 26. 【实习工作】讲一下实习期间做的工作。 「腾讯」 27. 【实习职责】实习生的职责和任务。 「百度」 28. 【实施环节】在哪个环节做的? 「百度」 29. 【实验室项目】你们实验室做过哪些横向项目?具体有没有做过目录解析? 「美团」 30. 【客户业务】你过往合作客户的业务是什么? 「美团」 31. 【导师职责】你几个导师都是干嘛的? 「蚂蚁集团」 32. 【岗位匹配度】请结合你的学术背景和研究经历,谈谈你为什么认为自己适合蚂蚁集团基础算法研究员这个岗位? 「蚂蚁集团」 33. 【应用场景】使用场景分别是什么? 「京东」 34. 【开源贡献】有没有开源社区主要贡献?讲一下你给contribution给nips哪个仓库是什么? 「腾讯、阿里巴巴」 35. 【技术方案成就感】请描述你做过的最有成就感的技术方案。 「蚂蚁集团」 36. 【技术栈】使用哪种编程语言?涉及到的技术栈大概有哪些? 「百度、腾讯」 37. 【数据类型】实习处理文本数据还是数值型数据? 「百度」 38. 【最了解/最佳模型】你对哪个模型最了解?你平常做的项目中,你觉得哪个模型最好? 「字节跳动、阿里巴巴」 39. 【最大收获】在上一段实习/项目经历中,最大的收获是什么。 「蚂蚁集团」 40. 【最有应用价值的项目】你大学期间做过最有实际应用价值的算法项目是什么? 「美团」 41. 【最有收获的项目】哪一段项目经历最有收获? 「阿里通义」 42. 【模型参数量】实习中Qwen3VL模型是多少B的? 「百度」 43. 【模型架构】训练的模型是什么? 「字节跳动」 44. 【模型调研】调研过哪些模型? 「美团」 45. 【模型调试经验】你有调试模型的经验吗? 「字节跳动」 46. 【研究方向】研究方向?研究方向大致介绍一下; 「字节跳动、阿里巴巴」 47. 【研究生经历】研究生期间经历 「阿里巴巴」 48. 【科研项目概述】科研项目概诉。 「腾讯」 49. 【简历介绍】简历介绍(30分钟)。讲一下简历里的经历。 「京东、腾讯」 50. 【简历叙述框架】浅挖简历。用“自己承担的角色-做了什么-取得的成果”来叙述?请用STAR法则介绍项目经历。 「字节Seed、百度」 51. 【系统署名】这系统里咋还有你名字呢 「百度」 52. 【职业方向】简历里都是推荐的内容,想做搜索吗? 「美团」 53. 【自我介绍】自我介绍,重点介绍技术栈、大模型相关项目、实习经历、核心产出与落地成果,可准备PPT展示。需涵盖论文和近期工作,挑选一个做得较好的论文或实习详细讲解,并深度考察项目细节(包括上线情况、数据、优化点、评估及相关八股),无八股无coding。同时说明看机会原因,简历深挖,项目问得很细,时间约5-35分钟。 「京东、字节Seed、字节跳动、拼多多、腾讯、腾讯混元、蚂蚁集团、阿里通义」 54. 【训练基座】训练基座有的是什么? 「蚂蚁集团」 55. 【训练时长】训练时长多久? 「美团」 56. 【训练框架】你训练用的什么框架? 「蚂蚁集团」 57. 【跨部门合作】参与了哪些部门之间的合作? 「字节跳动」 58. 【转行动机】科研经历离落地比较远,数学专业为什么做AI? 「百度」 59. 【输入特征】输入特征包含什么? 「腾讯」 60. 【迭代周期】多长时间一次迭代? 「拼多多」 61. 【逻辑清晰度】逻辑是否聚焦、易理解? 「阿里巴巴」 62. 【面试考察重点】整体更看重思维和基础,没有考察什么八股? 「腾讯、腾讯混元」 63. 【项目Owner】有没有明确owner方向? 「腾讯」 64. 【项目亮点】你做的项目有什么亮点?你觉得还有其他亮点可以说说吗? 「蚂蚁集团、阿里巴巴」 65. 【项目分工】在离线多智能体这个项目中,项目的背景是什么?大家是如何分工的,包括自己负责的部分以及其他模块负责什么? 「百度」 66. 【项目反思】跑下来你自己有什么感受和想法? 「美团」 67. 【项目意义】这个项目的意义? 「字节Seed」 68. 【项目或实习】讲一个项目或一段实习;讲实习,讲论文,讲科研项目;讲讲你的研究生毕业设计? 「京东、字节跳动、蚂蚁集团、阿里巴巴」 69. 【项目熟悉程度】你对自己简历上的项目能倒背如流吗? 「拼多多」 70. 【项目特点】详细说说它的特点 「字节跳动」 71. 【项目目标与改进】你这个具体是希望做什么改进? 「百度」 72. 【项目类型】这两个项目都是从0到1的项目?有没有做过能迭代的项目? 「阿里巴巴」 73. 【项目选择与详述】可以挑一个你觉得最有意思的实习、论文或者科研项目详细讲讲。 「阿里巴巴」 **L2 原理理解** **项目介绍** 1. 介绍项目。介绍项目,我先介绍小红书的业务基模的数据相关工作,被问到做ppl过滤的时候是否有测试不同阈值的效果?优化方案的框架、逻辑以及贡献价值动作是什么?你之前做的智驾相关项目,核心解决什么问题?你之前的项目,和百度 Apollo 的智驾业务有什么关联?你写过比较复杂的、给别人用的Skill吗?你写过的最复杂的Skill流程是什么?你在学校做过什么和运筹优化、强化学习相关的项目?你在支持Skill机制这方面具体做了哪些开发工作?介绍一下你当时做的业务。你当时有没有考虑pipeline?你搭过哪些Infra?你有写道解决了30+的bug具体是哪些问题?介绍一下你的第一个项目,具体做了什么工作?你的算法改进的背景是什么?介绍一下你的背景和项目经历,重点说说你在在大模型应用方向做了哪些事。你的项目中如何解决?你简历里"某历史影像项目处理效率提升99%"是怎么做的?你自己做过哪些优化?你认为项目未来价值是什么?你说的高频和低频为什么要弄这两个?你过往的项目经验,能给百度Apollo带来什么价值? 「京东、字节跳动、拼多多、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 2. 挑一个你觉得做得比较好的、最有代表性的或有趣的项目讲一下,包括做了什么、怎么做的、最后结果是什么。 「京东、拼多多、百度、阿里巴巴」 3. 简历上的项目都讲了一遍。简历上这个大模型推理优化的项目,负责哪部分工作? 简历提问:实习,搜推项目,强化学习项目。简历提问:强化学习项目。简历提问:搜推项目。讲论文项目,拷打简历。详细介绍实习项目整体背景与目的。该项目偏向研究还是落地,落地场景有什么限制?算力/数据量规模?编程能力怎么样,有没有工程项目?能给一两个 case 吗? 自己生成的,还是人工强行配的?补齐README.md文档中要求的所有交付物,并将项目所需的所有文档放在docs文件夹下。介绍一下计算方式。讨论之前的ai coding题,这个ai(longcat)写代码好用吗。训练会关注哪些重要参数和指标?训练前后区别在哪?举一个具体的例子。讲一个轨迹优化项目。讲讲你简历中什么是“感知、规划、执行、反思”?讲讲讲,每个模块都怎么实现的? 「京东、字节Seed、字节跳动、百度、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 4. 请介绍你的代表性工作,包括项目背景、动机、目标、为什么做?它主要解决了什么问题?它是怎么起作用的?怎么编辑的?怎么评估输入和输出的?成本和耗时大概多少?平均处理一张的耗时?怎么得到的这个向量?训练数据怎么来的?最终几个评测集怎么用?训练用的什么卡?用了多少张卡?训练数据集规模?训练了多少个Epoch?训练了多长时间?扮演的角色,最具挑战性的环节,企业实习和自己做科研感受的区别。你的小车项目和组里做的落地相差大吗?我看你是分开的为什么分开?我看你简历上没写RLHF,平常有用过RLHF吗?平常有尝试过训练过大模型吗,规模小一点的也没关系?对大模型的应用情况?如何将理论知识应用到实际项目中?如果项目提到某些名词会追问一下概念理解。就是你讲到什么,他就继续问什么。我看你在oppo有做过一些独立的模型的训练,当时是属于自己主动做一些调研并尝试不同模型的工作吗?当时是什么驱动你主动去调研这些不同的模型? 「字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 5. 请介绍你的项目整体架构设计、迭代过程、全栈流程设计、具体实现方案、训练方式(分开还是联合)、特定模块的作用及原因、创新点及来源、单智能体可行性、参数配置对比、路径点距离(参考线上和插值后)、方案可行性(反过来行不行)、后续优化思路、Vibe编码注意事项、部署方式、实验验证情况、对话数据增强原因、车端选型依据、大模型/小模型训练经验、仿真场景库、决策依据及效果。 「京东、字节跳动、快手、拼多多、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 6. 请介绍你的项目/研究经历,包括:模型应用场景与研发进展;模型如何训练、升级迭代、是否基于开源模型;每一步的出发点和落脚点;毕设项目的意义和应用场景;是否使用过Qwen及经验;当前研究;生成完成后是否直接上线;使用的backbone、方法、数据量;完成过的任务类型(如预训练、微调);模型介绍;百度特殊实践;未来计划;项目终止原因(如Agent设施工程);研究背景;项目输出;实习经历及另一段大模型经历。 「京东、字节跳动、百度、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 7. 请介绍你的项目经历,包括:1. 项目背景、场景、数据集如何构建?2. 模型架构如何设置?3. 模块为什么这样设计?4. 真值系统介绍。5. 元素定位Agent是什么及用途?6. 方法动机是什么?7. 多域建模前是否有探索性数据分析?8. 项目任务类型(如指代分割等)。9. 遇到过什么问题(如上线导致的问题)?10. 用了多少AI coding,如何提问(直接提问还是先写需求文档)?11. LLM用在哪?12. 工作内容是否涉及训练大模型?13. 这段经历与投递TET方向的能力匹配点。14. 追问之前一段研究经历。15. 针对PPT提问。16. 针对项目细节提问。17. 实习项目怎么做的,数据啥样,怎么设计?18. 实习公司团队和项目背景,细问其中几个项目。 「京东、字节跳动、百度、百度文心、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 8. 请介绍你的项目经历,包括但不限于以下方面: - Agent协作平台项目:背景、是否基于开源二次开发、追问细节。 - AICoding项目:使用的模型及对比、简单展开。 - Base模型、Benchmark与训练模型。 - DeepLocals创业项目:背景、解决的用户问题。 - GitHub上贡献的开源项目介绍。 - MMOE项目:来源、动机与实现细节。 - NLP相关模型经验。 - RAG项目亮点。 - Rewrite模型:具体输入输出。 - 前沿技术了解:是否看过技术报告。 - 下游额外处理。 - 不同板块的区别。 - 不同方向模型的区别。 - 预训练数据工作:兴趣和迁移基础。 - 项目异同点。 「京东、字节跳动、百度、百度文心、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 9. 项目背景、实际落地、主要功能、团队规模、开发周期、基于规则、设备信息;项目落地实施的具体做法;项目中迁移学习的具体应用。 「字节跳动、百度、蚂蚁集团」 1. 【FSM模块组成】整个FSM通过几个模块来完成? 「字节跳动」 2. 【关键差异对比】有哪些关键差异? 「腾讯」 3. 【换道模型与学校工作联系】换道模型和学校工作的联系是什么? 「百度」 4. 【数据集介绍】介绍一下你的数据集,是否使用过工业数据集? 「腾讯」 5. 【文本分析竞赛】文本分析竞赛经历。 「百度」 6. 【最终数据量】最终数据是多少? 「百度」 7. 【核心功能实现】核心功能如何实现? 「字节跳动」 8. 【核心变量】核心变量是什么? 「京东」 9. 【模型原理】模型原理方面的内容。 「美团」 10. 【自适应机制】有没有自适应机制? 「字节跳动」 11. 【近期工作】最近在做什么工作?介绍最近在做的研究工作。 「腾讯、蚂蚁集团」 12. 【音视频数据增强】请描述一个你曾经处理过的音视频数据增强案例。 「字节跳动」 13. 【项目介绍与反思】介绍你的项目经历(包括实验室项目、小论文项目、实习项目、快手实习、推荐系统相关项目、Agent相关经历等),说明项目动机、主要工作、做法原因、处理方式原因、项目必要性、收获、评价反馈,以及为什么选择强化学习作为研究方向。同时,回顾之前aicoding笔试,指出改进点。介绍组内情况。 「京东、字节跳动、快手、拼多多、百度、百度文心、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 14. 【项目优化经验】有做过优化吗? 「拼多多」 15. 【项目模型使用】整个项目用了哪些模型? 「腾讯」 16. 【项目流程】整个项目的流程是怎样的? 「百度」 17. 【项目背景与SFT动机】整体项目背景,其中第一个SFT工作的motivation、目标要求。 「腾讯混元」 **L3 实现与应用** 1. 【5G项目】解释一下5G项目? 「阿里巴巴」 2. 【Agent效果评测】项目里agent效果评测 「蚂蚁集团」 3. 【Agent设计与创新】问之前实习的Agent的设计逻辑,问创新方法的实现。 「阿里巴巴」 4. 【Chatbot评估】如何评估chatbot的效果(自己的项目)? 「字节跳动」 5. 【GMV优化】GMV优化如何做的,最终上线了哪个? 「美团」 6. 【ICP G-N解法】项目介绍,根据项目提问,“挑选一个你最熟悉的项目” 介绍的ICP的G-N解法。 「百度」 7. 【LoRA项目部署】LoRA项目有做过推流吗,什么容器? 「阿里通义」 8. 【Memory模块设计】Memory模块怎么设计的,为什么这样设计? 「腾讯混元」 9. 【ModalityAdapter设计】ModalityAdapter模态适配器这个模块你是怎么设计的? 「腾讯混元」 10. 【PD解耦分离实现】之前实习做的PD解耦分离是怎么实现的? 「阿里巴巴」 11. 【Pipeline设计】Pipeline怎么设计的? 「美团」 12. 【RAG应用】项目你负责的是哪一部分,为什么要用RAG(或为什么训练后要用RAG)? 「百度」 13. 【RAG项目与核心思想】介绍第一个项目,我的是一个rag的项目,先介绍了大概思路,然后问我rag的核心思想是什么 「百度」 14. 【ROS开发经验】除了用ROS自带的,还实现了哪些功能?在ROS开发中学到了哪些? 「百度」 15. 【Router介绍】介绍你的 router。 「字节Seed」 16. 【RSS模型】采用RSS模型的初衷、实现过程。 「百度」 17. 【ViT多阶段训练】改了一个ViT,你如何多阶段训练?用了多少数据? 「字节跳动」 18. 【下游任务效果提升】下游任务介绍,效果为什么会有提升? 「京东」 19. 【业务pipeline与训练阶段】问之前的业务,整体的pipeline,cpt和sft有什么不同,然后问知识蒸馏一般是在哪个阶段做。 「字节跳动」 20. 【代码实现与职业规划】手撕代码和个人规划。 「字节跳动」 21. 【代码展示】看了我平时项目的一些代码,并且让我现场展示了一个项目。 「百度」 22. 【任务拆解】如果交给你,你来如何拆解? 「蚂蚁集团」 23. 【分阶段原因】为什么需要分阶段? 「腾讯」 24. 【图像视频生成与AIGC】项目,然后说主要还是think with image相关的工作,了解图像、视频生成模型吗,有无AIGC经验? 「阿里通义」 25. 【基座模型数学能力提升】为什么你只对基座模型的数学能力做提升? 「腾讯」 26. 【多传感器融合测试】请分享一个你在测试中使用的多传感器融合测试方法。 「京东」 27. 【多模态框架】项目中多模态框架具体是怎么做的? 「百度」 28. 【多模态算法优化案例】描述一个你曾经优化过的多模态算法案例,具体采取了哪些技术手段? 「字节跳动」 29. 【大规模AI项目】详细描述你参与过的大规模AI训练或推理项目(用STAR法则)。 「百度、腾讯」 30. 【字节项目介绍】直接聊字节项目:简单介绍字节实习,业务背景,业务指标,介绍独立模型的搭建。 「字节跳动」 31. 【学术与实习经历】介绍一下本科毕设、硕士的研究课题和之前的一段实习,然后追问一些细节。 「美团」 32. 【完整训练流程】描述它的完整训练流程 「字节跳动」 33. 【实习经历挖掘】简历挖掘:过往实习经历(讲了项目背景、卡点&解决、以及反思还有待提升的地方) 「京东」 34. 【实习项目与业务理解】介绍实习中项目,体现业务理解。 「百度」 35. 【实习项目与基础知识】讲实习项目,创新点、数据挖掘、应用场景,auc怎么算,了解哪些分类模型和回归模型? 「百度」 36. 【实习项目介绍与拷问】挑一个项目讲,选择了实习的项目,拷打了实习的项目。 「字节Seed」 37. 【实习项目全流程】详细介绍实习项目,问其中每个阶段具体的工作内容,项目的应用场景,每一步的原因和应用,成果,是否有上线。 「腾讯混元」 38. 【实习项目引申提问】介绍实习和项目,问的东西都基本引申于项目。 「百度」 39. 【实用技巧】有哪些实用trick/技巧? 「阿里巴巴」 40. 【对比学习应用】个人项目中如何使用对比学习? 「百度」 41. 【工作串联】结合工作路线把自己的工作串起来讲一下。 「美团」 42. 【意图识别】科研项目中的意图识别是怎么做的? 「腾讯」 43. 【打分模型选择】为什么你用72b模型单独训打分模型? 「字节跳动」 44. 【技术原理】背后的技术原理是什么? 「百度」 45. 【探索方向与问题】主要用了什么方向的探索,解决什么探索? 「腾讯」 46. 【推荐项目改进】详细介绍下推荐项目,自己主要做了什么,如何改进? 「字节跳动」 47. 【数据与评测设计】详细拷打项目,数据是怎么生成,怎么配比,评测方案为什么这样设计。 「百度」 48. 【数据分析优化模型案例】描述一个你通过数据分析优化模型性能的案例。 「蚂蚁集团」 49. 【数据集构建与业务】讲一下项目,其中一个项目涉及到了数据集构建,结合他们那边的具体业务抛出相关的问题,并提问有没有可行的解决方案。 「阿里巴巴」 50. 【文心项目贡献】介绍一下文心项目,你在其中的具体贡献是什么? 「百度文心」 51. 【新想法与替代方法】最近有尝试什么新想法吗?有什么别的方法? 「美团、腾讯」 52. 【新特征获取方法】新加的特征具体是怎么得到的? 「字节跳动」 53. 【智能NPC模型影响】问我实习相关的,我实习是一个智能npc相关的,然后介绍了一下背景,他问哪些对模型影响比较大。 「百度」 54. 【智能体筛选与轨迹打分】重要智能体筛选、轨迹特征打分是什么? 「百度」 55. 【最熟悉项目介绍】介绍你自己最熟悉的一项工作/项目(涉及到以下八股),项目中做了什么? 「字节Seed、百度」 56. 【最终结构与scaling】最后采用的结构是怎么样的,如何scaling的? 「腾讯」 57. 【有效性判断实现】有效性判断怎么实现的? 「字节跳动」 58. 【有限状态机】有限状态机的完善过程是什么样的? 「字节跳动」 59. 【模型对比原因】项目中为什么对比随机森林和U-net模型? 「百度」 60. 【模型架构与指标】模型架构详细介绍,结果的输出,指标。 「腾讯混元」 61. 【模型设计与训练】有没有自己从头设计和训练过一个模型?调超参数的经验?训练集和测试集怎么划分? 「百度」 62. 【模型部署】模型在车上的工作模式? 「字节跳动」 63. 【模型部署与场景适配】如何将训练的模型接入仿真平台、如何只适配换道场景? 「美团」 64. 【比赛项目与算法】了解比赛项目,问强化学习和xgboost。 「百度」 65. 【比赛/项目内容与结果】介绍之前比赛或项目的具体工作内容和结果? 「京东」 66. 【沙尘模拟】沙尘模拟具体是怎么实现的? 「字节跳动」 67. 【消费侧策略】第二个项目的消费侧策略的主要做法是什么? 「字节跳动」 68. 【物流优化项目】XX物流优化项目,你是从哪几个环节做降本提效的? 「京东」 69. 【特征构建逻辑】个特征的构建逻辑是什么? 「美团」 70. 【独立模型工作】独立模型做了什么工作:样本、特征、label? 「腾讯」 71. 【独立精排模型】为什么要建立一个独立精排模型,样本占比多少? 「字节跳动」 72. 【离线强化学习项目】问国家级离线强化学习项目。 「百度」 73. 【端到端换道模型】端到端换道模型:模型的出发点、输入输出、结构概述 「百度」 74. 【第一个项目细节追问】介绍第一个项目,打断问一些细节 「蚂蚁集团」 75. 【算法与网络结构】介绍一下算法和网络结构。 「百度」 76. 【算法支撑业务】基础算法研究如何支撑蚂蚁集团的各项业务(如支付、风控、信贷、理财)?请举例说明。 「蚂蚁集团」 77. 【算法选择理由】XXX实习里面某个部分为什么要选这个算法,它有什么优点,怎么解决这个问题的? 「京东」 78. 【系统架构】系统整体架构是什么? 「腾讯」 79. 【脑机接口实现】介绍脑机接口具体是如何做的。 「蚂蚁集团」 80. 【自动化评分项目】介绍一下自动化评分的背景、所用手段、解决的问题以及达到的效果。 「腾讯」 81. 【视频时间点输出】问项目,视频如何处理能输出准确时间点? 「腾讯」 82. 【计算方式解释】为什么是这样算的? 「腾讯」 83. 【训练方法选择】打算用有监督还是无监督?具体打算怎么训练? 「京东」 84. 【训练流程】训练流程是什么?不是只问它们分别是什么,还会问整个训练流程是怎么样的。 「字节跳动、美团」 85. 【训练设计】练在其中如何设计? 「蚂蚁集团」 86. 【训练配置与学习率选择】什么平台上训练的?训练多久?学习率多少?为什么是这个学习率? 「京东」 87. 【论文与视频切割方法】介绍论文,期间有问数据处理过程,涉及到将长视频切割成短视频的过程,用什么方法切割的。 「腾讯混元」 88. 【设计理由与计算方式】为什么这么设计?(包括具体的计算方式) 「字节Seed、百度、腾讯」 89. 【调度策略统计】有做调度策略的实际到达情况、中途接单情况的统计吗? 「百度」 90. 【轨迹构造】自己做的项目:trajectory如何构造 「美团」 91. 【迭代点与效果提升】主要迭代了哪几个点,哪些点对效果提升比较明显? 「字节跳动」 92. 【非命中问题】针对项目一,为什么要掺杂非命中问题? 「腾讯」 93. 【音视频超分优化】请分享一个你在音视频超分辨率中的优化案例? 「字节跳动」 94. 【项目与工业界对比】项目和工业界相比少了哪些环节? 「百度」 95. 【项目介绍】实习项目详述:完整构建流程是什么?实习中使用的范式相比之前的有什么优点?实习中涉及到的束搜索。实习经历:请你说说你在这个项目中是怎么做的?遇到问题如何解决。实习项目上的motivation,以及数据如何构造,能否涵盖一些场景。实习项目,如何选型,自己参与了哪个部分,如何评价做的系统有没有用,如何跟需求方对接的?实习项目问的很细,数据构造,微调参数等。对于你的洞察,你们相对于别人的优势在哪里?展开说说:实习做的工作;为什么要这么做;支持什么样的业务或项目。当改写需要用户补充信息时,你是怎么设计交互和技术实现的?怎么优化?怎么做的任务分发?怎么处理这么庞大的数据集的?怎么实现效果?介绍一下我做的改进;问论文视觉是用的什么?我那个项目分阶段奖励机制的探讨。 「字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团」 96. 【项目优化方向】项目还可以怎么优化? 「阿里巴巴」 97. 【项目基线论文与贡献】介绍一下自己做过的项目(baseline论文是什么,贡献点) 「百度」 98. 【项目拷打】针对项目拷打了几个问题。 「京东」 99. 【项目算法】介绍一下项目里的算法。 「京东」 100. 【项目细节深挖】深挖简历里的项目内容(细节到为什么选择这个模型、用了哪个框架、做了哪些创新点、发论文了吗、发哪个刊、目前进展是怎么样) 「京东」 101. 【项目细节追问】举例,根据例子进行拷打。 「百度」 102. 【项目经历】结合你的经历,说明你参与的自动驾驶算法相关项目(如校园科研项目、自动驾驶算法竞赛、相关实习项目),重点说明你的角色、负责模块及项目成果(如算法性能提升数据、项目获奖情况、技术方案落地效果等)? 「京东」 103. 【项目经历与深挖】介绍一下你的实习/项目经历。然后针对项目中的核心难点、解决思路以及最终的业务指标进行深挖提问。 「美团」 104. 【项目结构设计】每个项目结构是怎么设计的,为什么这么设计,依据指标是什么? 「字节跳动」 105. 【项目网络结构手写】手写项目网络。 「京东」 106. 【项目迭代思路对比】两个项目的迭代思路有什么不一样? 「腾讯」 107. 【项目迭代规划】项目迭代规划:如果接着做,你有什么规划?如果让你继续迭代,还想如何迭代?如果让你还想提高发起,你还打算怎么做,大的工作还有哪些? 「字节跳动、腾讯」 **L4 优化与诊断** 1. 【技术壁垒与算法论证】技术壁垒与解决方案是什么?与同类的差别是什么?算法合理性的论证是怎样的? 「字节Seed」 2. 【推理框架优化】实习里面写的推理框架优化的背景和方案能不能详细介绍一下? 「腾讯混元」 3. 【新领域学习与推进】当你需要接触一个全新的自动驾驶算法领域(如端到端自动驾驶、自动驾驶仿真测试算法、多智能体协同算法)、或推进一项不熟悉的工作(如算法工程化落地、实车测试数据解读、复杂场景算法适配)时,你会如何开展工作?请结合过往类似经历说明? 「京东」 4. 【项目深度剖析】挑选最核心的RAG/Agent/大模型微调/多模态/碰撞预测项目,详细讲解:业务痛点、技术选型理由、核心难点、个人独立贡献、迭代优化思路、最终落地效果。从背景、动机、做法和结果等方面都问得非常细。针对其中一个项目的猛挖,讲意义,然后结合一个可能的最复杂需求,讲一讲整个项目的链路,然后又是针对链路上的每一个节点猛挖。算法方面如何建模?怎么保证解耦次优的效果?启发式算法?Python不同实现方法的复杂度?Java和Python的区别?并行编程?类、继承?性格面?一道笔试编程题。 「字节跳动、百度、百度文心、腾讯、蚂蚁集团、阿里通义」 5. 【项目规划】如果你需要在一个月内完成一个高难度的AI平台开发任务,你会如何规划? 「京东」 6. 【项目重构】如果现在用大模型让你重新做一遍你的项目(Agent项目/大模型重构项目),你会怎么做,整个过程?具体优化哪些地方?详细讲一讲。 「字节跳动、美团、腾讯」 ## 项目难点与创新 **L0 上下文不足(难度待定)** **上下文不足** 1. 跳不出去怎么办? 「美团」 2. 还有什么办法吗? 「美团」 3. 链:共享比例怎么定? 「百度」 **L2 原理理解** 1. 【项目难点与创新】请结合你的项目经历,回答以下问题(可合并回答): 1. 项目难点:任务复杂度如何?发现了什么核心业务问题?各有什么问题?它解决了什么核心问题?无法解决用户问题具体是哪些问题无法解决?是为了解决什么具体问题?用的什么verifier?问到过滤花了多久?项目难点是什么? 2. 困难与解决:遇到什么问题?如何解决的? 3. 项目改进:后续做了哪些改进动作? 4. 项目收获:哪些核心设计对你有启发?有什么心得?给你的经历带来了哪些帮助或变化? 5. 个人贡献边界:最大的贡献是什么? 6. 创新点:有什么创新?说一下其中的创新点主要体现在哪? 7. 项目亮点:有什么积累的亮点没有向他展示的?这个项目对你而言特别有代表性/有意思的点在哪?项目进行过程中印象最深的是什么? 「京东、字节Seed、字节跳动、百度、美团、腾讯、蚂蚁集团、阿里巴巴」 **L3 实现与应用** **AI问题调试** 1. 它的一个流量是多少呢?举个一到两个你印象比较深刻的线上问题的排查。 「百度」 2. 是由什么原因导致的? 「字节Seed」 3. 本质问题是什么? 「字节跳动」 **项目难点** 1. 不会写算子是出于什么考量? 「百度」 2. 会有什么问题? 「阿里巴巴」 3. 你觉得基建这一块,会对你自己的idea有压力吗? 「美团」 4. 共享比例怎么定的? 「百度」 5. 到我的项目里安全吗? 「阿里巴巴」 6. 在流量项目/项目中遇到过哪些实际问题?有什么解决经验?落地时遇到什么问题? 「美团、蚂蚁集团、阿里巴巴」 7. 如何做仿真验证的? 「字节跳动」 8. 如果不这样做会发生什么?本会造成什么问题? 「字节跳动、腾讯」 9. 实习场景提到的数据处理场景有没有做限流、拒绝或者降级之类的机制? 「百度」 10. 技术上你觉得比较深入的点是什么? 「字节跳动」 11. 拷打实习经历-冷热分离 「百度」 12. 方法在哪些场景会失败? 「字节Seed」 13. 更重要的是你能不能解释:为什么是这样? 「字节跳动」 14. 核心壁垒是什么?核心痛点是什么? 「京东、蚂蚁集团」 15. 模型是冷启动还是热启动,为什么要这样?冷启动多久能收敛? 「腾讯」 16. 痛点2:在基于垂直领域表现不佳。 「腾讯混元」 17. 痛点3:langchain内置问答分句效果不佳问题。 「腾讯混元」 18. 讲一下,怎么避免? 「京东」 19. 请分享一个你在测试中使用的创新方法或工具。 「京东」 20. 项目为什么涉及高并发?项目可能瓶颈在哪? 「腾讯」 1. 【业务对齐与推进】你是怎么对齐推进的? 「京东」 2. 【个人贡献边界】项目里负责的边界是什么?哪些内容是亲手实现/验证的? 「拼多多」 3. 【优化思路】请结合具体案例,说明在项目或论文中从哪些方面进行优化(如数据、模型结构、训练策略、算法改进等),包括针对难case、baseline的具体方案和版本调优过程。当模型分类不准或准确率低时,分析原因并说明优化措施(数据增强、算法改进、模型结构、训练策略等)。描述一个通过算法优化提升性能的案例。算法的流程和耗时如何?有哪些方法可以缩短耗时或提升效率?请描述具体的优化方法。 「京东、字节Seed、字节跳动、百度、美团、蚂蚁集团、阿里通义」 4. 【创新点】介绍创新点。 「阿里巴巴」 5. 【困难与解决】请介绍你的项目/研究/实习经历,重点描述其中遇到的最大技术挑战或困难(如模型效果上不去、过拟合、训练问题、卡点等),说明背景、具体问题、解决思路、最终解决方案以及效果评估,并谈谈你从中学到了什么。 变体:项目里最大的一次失败是什么? 「京东、字节Seed、字节跳动、拼多多、百度、百度文心、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 6. 【实验设计】请介绍你做过哪些实验(包括消融实验、噪声影响实验等),实验的具体设计(如参数量、数据量、消融方向、模块消融方式),是否遇到困难(如方法在部分数据集可行但扩展到更多数据集后效果不佳),以及实验结果是直接达到SOTA还是经一系列调整后实现,效果如何? 「百度、腾讯、阿里巴巴」 7. 【方案设计】其他方案有考虑吗?有没有更优方案?设计过程中应该注意哪些问题?项目细节询问(数据构造细节、为啥要用DPO);讲一下动机是什么,为什么用当前的方案? 「字节跳动、百度、腾讯、腾讯混元、蚂蚁集团」 8. 【项目亮点】如何从项目背景中引出并聚焦到结构重参数化这一亮点?请结合你过去做过的最有影响力的一件事,具体说明推动了什么变化。 「拼多多、腾讯混元」 9. 【项目介绍】介绍第一个项目,包括亮点、遇到的问题及解决方法,并说明如何训练模型学会论文翻译的风格(从数据集构建角度回答)。 「腾讯、蚂蚁集团、阿里巴巴」 10. 【项目反思】讨论项目不合理地方,包括是否过度设计,以及从你的视角看有哪些问题? 「百度、百度文心、美团」 11. 【项目收获】收获了什么(详细讨论,包括损失函数设计、输入输出)? 「阿里通义」 12. 【项目改进】项目改进:为什么做这个改进?关键改进点有哪些?具体做了哪些改进?算法上的改进?模型层面有什么改进?后续改进方向。 「百度、百度文心、美团、腾讯、蚂蚁集团、阿里巴巴」 **L4 优化与诊断** 1. 【AI问题调试】请分享一个你在测试中发现并解决了一个隐藏很深的bug的经历。在风控或AI项目中,当模型效果不如预期或过程正确但结果错误时,请详细描述一次最难调试的问题,包括根因分析、排查流程(如何判断哪一步出错)、最终解决方案和优化复盘。实习中如果遇到Agent线上偶现异常,你的排查思路是什么?根因节点怎么推出来的? 「京东、百度、美团、腾讯混元、蚂蚁集团、阿里通义」 2. 【业务对齐与推进】作为项目负责人,你怎么制定里程碑、推进跨角色协作、处理项目中的阻塞问题?你提到梳理了业务口径不一致的问题,具体是怎么拆解全链路逻辑的?你提到跟业务会进行对齐,那有遇到业务对你提出的方案产生质疑的情况吗?你们是怎么说服他们使用你们的方案的? 「京东、字节跳动、腾讯」 3. 【优化思路】请分享你项目中优化思路的改进与创新,包括但不限于:1)视觉依赖、逻辑依赖两个指标的改进思路是什么?2)论文审稿项目还可以怎么优化?3)通过细致的观察、深入的思考或主动的调研,发现算法优化空间、规避潜在技术风险,并成功提升算法性能、优化技术方案或助力团队目标达成的经历?4)详细描述项目中的优化思路:加速怎么来的?每个优化trick都往下问几个为什么。深挖项目,比如reward怎么设计的,后续有什么改进思路。 「京东、字节跳动、蚂蚁集团」 4. 【创新点】当时方法的创新点是什么,放到现在又该如何去思考。请描述一次你通过深入研究,对一个复杂问题提出了新颖且有效解决方案的经历。 「美团、蚂蚁集团」 5. 【困难与解决】请举例说明你曾解决的自动驾驶算法相关技术难点(如模型精度提升、实时性优化、数据处理瓶颈、复杂场景适配、大模型训练困难、不熟悉的新领域问题等),说明问题排查过程、解决方案及最终成效。另外,你认为校招自动驾驶算法工程师在工作中最容易遇到的挑战是什么?(如算法理论与工程实践脱节、复杂场景算法适配难、数据处理效率低、跨团队协作衔接难、技术难题突破慢等)你会如何应对?工作最大的挑战是什么?为什么提升AUC对业务的帮助不重要?通过解决这个问题,你对产品有什么建议?请描述你在自动驾驶算法测试中遇到的最具挑战性的问题,以及你是如何解决的?请详细描述你做过的一个规划决策项目,遇到了什么具体的Corner Case(边缘场景),你是怎么解决的? 「京东、字节跳动、百度文心、美团、腾讯」 6. 【方案设计】从你的项目背景下,为什么这么构造?利弊分析,如何改进?如果不这么做会怎么样?如何权衡?具体到论文中,为什么用图神经网络和多智能体强化学习,如何设计的框架来做负载均衡和决策加速? 「蚂蚁集团、阿里巴巴」 7. 【项目介绍】介绍另一个项目,还有围绕该项目的深挖,比如多个大模型的统一适配是怎么做的? 「字节跳动」 8. 【项目反思】1. Qwen之前也做过类似的,你认为为什么在你这里结论有区别? 2. 如果让你重新做一遍那个项目,你会在哪些地方重新设计?请指出最“屎山”或最不合理的环节。当你负责的自动驾驶算法相关工作未达预期(如算法性能未达标、项目进度滞后、技术方案未通过评审、测试验证问题较多等)时,你会如何进行复盘反思、调整思路并优化策略?请结合具体案例说明? 「京东、字节跳动、腾讯」 9. 【项目改进】以你现在的视角来看,当时的项目还有什么可以改进的地方?理论依据是什么?之后的迭代思路是什么?有没有新的想法,未来打算怎么做? 「字节跳动、美团、蚂蚁集团、阿里巴巴」 10. 【项目难点】项目难点与创新:1. MoE路由机制、训练验证数据集、SFT方法、难点;2. 为什么work?3. 添加模块是否破坏预训练效果及避免方法;4. 最有深度的点或难点;5. 方法在更大模型上的泛化性;6. 冷启动区别及预训练必要性;7. 协同控制算法对比框架的难点;8. 技术债和资源不足的处理;9. UniAD/VAD实际部署槽点、仿真与实车gap;10. 供应链实习中库存波动/订单爆单的应对。 「京东、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里通义」 11. 【项目难点与创新点】项目难点与创新点综合:1. 评估标准(余弦相似度、人工评注)矛盾情况如何处理?2. 生成反事实数据的质量评估、过滤机制。3. 项目成本被质疑时如何拆解?4. 项目是否有动态容错机制?5. 创新点代码实现细节、消融实验方法。6. 项目深挖:数据来源、主要价值点、遇到的问题及思考、数据pipeline扩展到更大规模时的瓶颈和优化思路。 「字节Seed、字节跳动、百度文心、腾讯」 **L5 综合与前沿** 1. 【项目难点与创新】1. 为什么这样设计,哪里会失败,怎么落地,怎么评测? 2. 如果上级要求你在一个月内,将一个开源基础模型通过后训练快速适配到一个全新的、缺乏历史数据的业务场景,你会如何规划技术路线和评估风险? 3. 讲讲MARL里面具体的设计。如果要把你论文里的TE路由调度策略移植到现有的万卡集群训推里面,应该怎么做修改和适配? 「字节Seed、蚂蚁集团、阿里巴巴」 ## 论文与科研 **L0 上下文不足(难度待定)** 1. 【上下文不足】手撕无八股 前20min对论文进行全面彻底的提问。接下来50min围绕论文展开N(大于 「蚂蚁集团」 **L1 基础认知** 1. 【论文与科研综合】请简要自我介绍,并说明三篇论文的核心工作。你的主要研究方向是什么?论文idea是自己想到的吗?该篇论文项目里你的主要负责工作有哪些?印象最深的是哪一篇?是否发了paper?哪些论文是在目前的公司发的?有没有发论文计划?问论文为什么没投顶会?平时会做论文阅读和分享吗?有没有看论文的习惯?是否支持开源/论文/技术报告? 「京东、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里通义」 **L2 原理理解** 1. 【研究方向与科研管理】1. 为什么博士有两个方向?介绍科研方向。 2. 科研时间的分配与规划方式,实验与论文是否同步进行,以及各科研项目中idea和实验是否独立完成。 「百度、腾讯、蚂蚁集团」 2. 【论文介绍与细节】1. 写这个论文初衷是什么? 2. 原论文有没有提到其他组织方式? 3. 发的论文在业界有没有应用场景? 4. 是否方便展开聊一下之前看过的蚂蚁相关论文? 5. 讲两篇文章。 6. 论文的东西有没有落地的? 7. 论文针对什么问题做的算法设计? 8. 这个生成的方法是你现有的开源方法吗? 9. 讲一下这篇论文的intro。 「京东、百度、腾讯、蚂蚁集团」 3. 【论文阅读与技术资料筛选】1. 会看哪些书或论文,如何筛选高质量的技术资料避免信息噪音? 2. 你有读过什么AI论文/技术报告两次以上,对你工作的帮助是什么? 3. 是否研读过DeepSeek、Qwen等最新的技术报告? 4. 最近在看什么论文?请介绍生成式推荐领域最熟悉的模型,并说明如何跟进最新研究(如注意力机制改进、长文本处理),以及视觉论文领域精读的一篇论文和模型最新进展。 「京东、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 **L3 实现与应用** 1. 【最新论文与技术动态】讲一下你最近看了哪些大模型相关的论文或技术报告?包括你这个方向国内外大厂的最新进展、技术点和成果,以及大家都是怎么做的? 「京东、字节跳动、美团、蚂蚁集团」 2. 【论文介绍】介绍论文(包括但不限于:RiskQ、Diff-IGM、SP、AAAI论文、NLP方向论文等)。具体要求:1)介绍论文名称、发表/在投状态、顶会/期刊;2)论文动机:解决了什么问题,怎么发现的问题,如何解决的问题,效果如何;3)论文细节:输入输出是什么,举例说明;知识准确性(是模型没学到还是本身不准确);如何融入训练;MDP定义;创新点;测评方式;团队合作公司;实际落地情况;基座模型;4)若涉及共享屏幕,需展示论文内容;5)若涉及共情对话任务,需说明具体任务;6)介绍熵崩溃现象;7)解释为什么叫agent。 「字节Seed、字节跳动、百度、美团、腾讯、阿里通义」 3. 【论文介绍与细节】请详细介绍你的论文(包括最近一篇、NIPS论文、硕士研究课题、论文A等),涵盖以下方面: 1. 论文整体介绍(做了什么、流程、每个模块细节)。 2. 冷启动和RL之间的阶段是什么? 3. 与GPT-4.5对比的具体方法。 4. FastText是否参考DeepSeekMath,是否进行二次迭代? 5. 正负样本定义及负样本过多如何处理? 6. 之前关于数据配比的论文的实验/理论依据。 7. 论文具体改进了什么,相较于已有方案提升在哪,解决了哪类badcase? 8. 挑一个做得最好的论文或实习详细讲。 9. 论文中CoT的具体设计细节。 10. 给一个现实例子,论文如何套用? 11. 为什么场景定义为非结构化场景,主要因素有哪些? 12. 对论文和项目实现细节的提问。 「京东、字节Seed、字节跳动、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里通义」 4. 【论文动机】以前做的论文,问一下论文解决了什么问题,怎么发现的问题,如何解决的问题,效果如何等等。 「百度」 5. 【论文细节】介绍论文C:让我详细介绍下是怎么采样的。 「百度」 6. 【论文细节与答辩】请介绍你的论文,包括:1)论文的pipeline,在哪部分用到了排序机制;2)聚类是怎么做的;3)评测指标,消融实验和可视化方法;4)审稿人提过哪些刁钻问题,如何解决;5)后续研究方案。 「京东、字节跳动、百度、美团、腾讯」 **L4 优化与诊断** 1. 【论文介绍与细节】介绍你的论文:从场景需求到核心工作,包括任务形式、模型架构、数据集构建配比与开源数据集内容、基座模型、微调方法(超参数和原理,如LoRA中AB矩阵初始化方式)、训练参数与训练方式、方案设计动机与目的、不同方案优缺点、指标、baseline、setup、核心组件作用等。若涉及多模态表征、跨模态检索或多模态大模型与强化学习,请详细说明。同时,需回答论文细节:用了多少张卡,为什么batch size要设置为1。 「字节跳动、腾讯、腾讯混元、阿里巴巴」 ## 实习经历 **L1 基础认知** 1. 【垂类预训练经验】很惊讶说你没有垂类预训练的经验怎么给你offer的某手? 「腾讯」 2. 【实习经历】请介绍你的实习经历,包括:1)快手推荐实习主要做的什么?2)研一来实习,怎么恰好做了比较火的生成式推荐?3)有实习过吗?4)第一段实习的内容是啥,有什么样的成长?5)美团实习主要工作介绍。6)自我介绍,实习,问负责的部分。7)讲一讲日常实习的工作。8)详细先问我学业/实习时长/课程/论文的问题。 「京东、字节跳动、百度、美团、腾讯、阿里巴巴」 3. 【实习经历介绍】介绍实习经历,包括但不限于:实习时间段、公司、业务背景、具体负责的工作内容、项目(如大模型微调、推荐系统、视频生成模型等)、产出与贡献、模型结构/业务指标/模型效果/上线情况、遇到的挑战与解决方案、使用的工具与模型、数据分析工具、团队合作与快速上手经验、收获与感受、与实验室的差异、如何突破。追问:实习相关细节(如RSS模型细节、美团业务与B/A区别、配送小车舒适度与安全要求等)。 「京东、字节Seed、字节跳动、拼多多、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里通义」 4. 【实习选择动机】实习选择动机:包括但不限于以下要求: - 不同实习的选择原因,为什么这么选? - 为什么两段实习方向不一样? - 为什么对AI Infrastructure感兴趣? - 为什么选择加入初创公司实习? - 之前的实习/项目为什么现在不做了? - 会如何权衡和选择,两边实习内容有什么不同? 「京东、腾讯、蚂蚁集团」 5. 【竞赛与项目经历】你有过参加AI竞赛的经历吗?你有过团队协作开发多模态项目的经历吗? 「京东」 **L2 原理理解** 1. 【实习经历综合介绍】请详细介绍你的三段实习经历(百度、滴滴等),包括:业务逻辑、技术细节(如SDK混淆)、遇到的挑战/困难、个人理解、需要改进的点、收获总结。具体问题:1. 讲一下实习干了些啥,业务逻辑,技术(问到SDK的混淆,没听说过)。2. 滴滴实习遇到的挑战。3. 百度实习工作过程中最大的困难。4. 第二段实习的内容是啥,对项目有什么自己的理解?5. 细说之前在百度的实习。6. 自己认为滴滴实习里需要进步的点。7. 要求详细介绍第一段实习。8. 要求详细介绍第三段实习。9. 要求详细介绍第二段实习。10. 详细问我上段实习经历。11. 这么多段实习,我到底获得了什么? 「字节跳动、百度、美团、腾讯」 **L3 实现与应用** 1. 【长短期记忆网络实现】实习里的长短期记忆是怎么实现的? 「京东」 **L4 优化与诊断** 1. 【实习经历深度拷打】深度拷打过往AI实习经历:负责的模块、遇到的线上问题、优化方案、量化提升数据。重点问到一个算子要不要优化,如何判断,以及如果决定优化,具体怎么做。结合学习经历、校园科研/实践项目、自动驾驶相关实习经历,说明哪些内容与自动驾驶算法工程师核心能力(如机器学习、深度学习、感知/决策/规划算法设计、数据处理分析等)相关,对适配本次校招岗位有何核心价值。讲第一段实习,项目背景、数据处理、特征工程、模型处理、评价指标、最终效果,其间夹杂机器学习八股和场景思考(如出现某种情况怎么办)。 「京东、蚂蚁集团、阿里通义」 ## 技术选型 **L1 基础认知** 1. 【技术选型与工具使用】1. 主流解决方案?2. 你们自己会做模型训练吗?3. 你使用过cursor/windsurf等AI编程工具吗?请分享你的使用经历。4. 开源框架了解过哪些?5. 算法题还要不要刷? 「字节Seed、美团、腾讯、蚂蚁集团、阿里巴巴」 **L2 原理理解** 1. 【AI编程工具使用】AI编程工具使用:包括在Agent系统开发中用了多少AI coding及使用方式、日常是否用Claude/Codex及注意事项和常用skill、最常用的工具、最近使用或了解哪些AI编程工具、好用的AI coding技巧、是否在实际开发或业务中使用、使用心得、用什么工具。请列举具体工具名称及使用场景。 「京东、字节Seed、字节跳动、美团、腾讯、蚂蚁集团、阿里巴巴」 2. 【开源项目】开源项目:包括值得复现的开源项目或实践项目、是否读过相关开源项目源码/设计文档。 「腾讯、蚂蚁集团」 3. 【技术方案评估与选型】技术方案评估与选型:包括baseline制定、设计原因、工程角度实现细节、模块划分、其他方案考虑、横向比较外部做法、基座模型与业务偏好、为什么不对比XGBoost等模型、为什么不用时序预测模型、为什么做GMV预测而非需求预测。 「京东、字节Seed、百度、腾讯、蚂蚁集团、阿里巴巴」 **L3 实现与应用** **技术选型** 1. 为什么选择当前方案而非其他?为什么该方案有效?其他方案有考虑吗? 为什么选择当前模型/架构/技术方案?请结合项目背景说明选型原因,包括模型参数量选择、算力与数据量、后训练方法、数据来源等核心思路。 你的选型考量? 整个RAG系统都是自己写的吗?文档解析为什么选择 MinerU 和 PaddleOCR-VL? 除了用这些模型,会去关注他的文章或者技术吗?除了简历上的项目,你近期花时间比较多、自己比较感兴趣的前沿技术有哪些?项目中使用的Embedding模型、重排模型、向量数据库,选型依据是什么?对比过哪些方案?项目中如何选取模型,实际效果如何?项目为什么不考虑端到端方案? 「京东、字节Seed、字节跳动、拼多多、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 2. 项目用Golang了吗? 「腾讯」 1. 【业界调研与跟踪】有没有做过业界的调研,跟踪主流大厂模型的技术思路与报告? 「腾讯、蚂蚁集团」 2. 【仿真平台测试】请分享一个你在测试中使用的仿真平台及其优势。 「京东」 3. 【优化技巧与手段】在项目中你会做哪些优化?有哪些trick、优化点、具体的技术手段或特别的优化策略? 「京东、百度、蚂蚁集团」 4. 【传统与学习结合】传统和learning的结合体现在哪里? 「百度」 5. 【基座模型选择】为什么要用OneRec的基座? 「字节跳动」 6. 【大模型适用性】是否全都需要用大模型做? 「腾讯」 7. 【实时数据采集工具】请分享一个你在测试中使用的实时数据采集工具。 「京东」 8. 【技术实现细节】各种技术,做一个demo出来,你会分怎么执行?技术上怎么实现?追问:那你们是怎么做这个文件的拼接的,调的哪个接口? 「京东、字节跳动、百度」 9. 【技术方案评估】你怎么筛选AI的方案?以及在你看来,如何评估一个技术方案的成功与否? 「字节跳动、阿里巴巴」 10. 【技术方案选择】为什么当时会选择那个技术方案 「字节跳动」 11. 【技术趋势】为什么在字节内部逐渐成为主流? 「字节跳动」 12. 【新技术学习路径】你是怎么去接触一门新技术的,以MUSA开发或RDMA调优为例讲讲学习路径。 「腾讯混元」 13. 【方案优缺点对比】各自的优缺点、取舍点是什么?与其他方案相比如何?对比原生skil工具链,本平台的差异化优势是什么? 「美团、腾讯、蚂蚁集团」 14. 【权重设置】如何设置的权重,为什么这么设置? 「蚂蚁集团」 15. 【架构选型】为什么要选项目使用的这个架构(整体是master+sub Agent还是workflow形式),而不是市面上一些更成熟的? 「字节跳动、蚂蚁集团」 16. 【样本对比机制】为什么要引入这种样本对比机制? 「字节跳动」 17. 【框架选型】框架选型理由? 「蚂蚁集团」 18. 【模型蒸馏】你为什么paper不采用模型蒸馏? 「腾讯」 19. 【模型迭代策略】迭代新模型时,是直接选定backbone,还是先评估任务适配性? 「字节跳动」 20. 【深度学习模型测试工具】请分享一个你在测试中使用的深度学习模型测试工具。 「京东」 21. 【独立模型 vs 统一模型】为什么要做一个独立模型,而不是使用主模型的结构? 为什么要做统一模型? 「字节跳动、腾讯、腾讯混元」 22. 【策略 vs 模型修改】实习中某个项目选择改策略而不是改模型的考量? 「阿里巴巴」 23. 【自动化测试工具与框架】请分享一个你在测试中使用的自动化工具或框架及其优势。 「京东」 24. 【训练框架与库】训练是怎么做的,是用的开源框架还是自己写的训练代码?主要用的什么库? 「蚂蚁集团」 25. 【调参策略】调参具体是怎么做的,调了哪些,为什么这么调? 「腾讯」 26. 【重构方案】你会怎么重构? 「字节跳动」 27. 【预测算法选择】实习里的某个预测,为什么不选其他的时序算法,或者决策树,或者神经网络啥的,要选用XXX? 「京东」 **L4 优化与诊断** 1. 【AI基础设施优化案例】请分享一个你使用开源工具(如Kubeflow、MLflow)优化AI工作流的案例。 变体1:通过自动化工具提升AI基础设施运维效率的案例。 变体2:通过技术创新显著提升AI基础设施效率的案例。 「京东」 2. 【技术选型与方案评估】技术选型与方案评估: 1. 如何评估一个新兴的AI框架是否适合团队使用? 2. 如果框架性能未达预期,如何调整? 3. 为什么选择某个方案/方向而非替代方案?为什么work?其他方案考虑过吗? 4. 技术选型方法论:面对新技术和稳定旧技术如何决策? 5. 描述一次技术决策及思考过程。 6. 放在今年,你会用什么技术路线重做这个项目? 7. 有没有对比过其他同规模模型?对比传统方法(如VectorNet)的优势? 8. 有没有普适性更好的方法? 9. 轨迹打分的目的是什么,如何打分,与搜索得到轨迹打分的区别? 10. 针对项目二,当时大家都在做RL,为什么还在SFT?为什么不直接用RAG? 11. 有没有不改变模型架构的方式来达到论文中的效果? 12. 是否把AI串到CI/CD等完整流程? 13. 数据驱动+级连模型的发展路线。 14. 与前端、后端团队配合,如何对齐技术方案与业务目标? 「京东、字节跳动、百度、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 ## 效果与落地 **L1 基础认知** 1. 【项目落地与价值】项目是否落地?上线了吗?有多少用户?解决了什么实际问题? 「百度、美团、腾讯、蚂蚁集团」 **L2 原理理解** 1. 【个人亮点】觉得自己做得最好的点是什么? 「京东」 2. 【成果与效果评估】介绍产品及取得的成果。你个人直接贡献了多少占比?你如何评估自己的贡献?是否有实际的数据或成果来支持?请分享一个你在AI项目中通过数据驱动决策或技术创新解决业务痛点的案例。只说“性能提升了多少”一般不够。实习的项目有多少人用,多少并发,一天数据量有多少?对指标的影响?对标到什么水平?对模型性能有什么影响吗?指标和榜单有吗?描述一下效果。效果怎么样?最后取得了一个什么效果?最后模型落地了吗?最后的收益指标是多少?最终ROI是多少?最终单客获客成本是多少?最终提升了多少?最终数据变化是多少?最终的量化结果是什么? 「京东、拼多多、百度、美团、腾讯、蚂蚁集团、阿里通义」 3. 【用户反馈优化】针对用户反馈,你们有没有具体的优化动作或计划? 「腾讯」 4. 【落地验证与案例】有没有落地验证?用在业务上吗?能否举个业务中实际落地的例子?论文里的方法是否真正落地过? 「京东、百度、美团、腾讯」 5. 【迭代效果分析】迭代的提升效果哪个最大? 「腾讯」 6. 【量化数据与指标】最终量化数据是多少?能说一些具体数字吗?(追问)在实际项目中优化效果如何?具体指标? 问技术创新与指标量化。项目真实落地场景、内测数据、效果指标。 「京东、字节Seed、快手、蚂蚁集团」 7. 【项目使用与用户体验改进】项目完成后对方的使用情况怎么样,有没有针对性的改进用户体验之类的? 「蚂蚁集团」 8. 【项目效果与模型稳定性】项目深挖 效果怎么样,模型稳定不稳定? 「京东」 9. 【项目瓶颈】项目运行几年之后到瓶颈了吗? 「腾讯」 **L3 实现与应用** 1. 【效果与落地】介绍业务指标收益具体是如何从模型得到的?模型的base基线以及迭代步骤,主要收益来源于是什么?优化方案是否落地?线上与线下测试差异?优化过程中有什么经验和思考?你在该模型的应用中,是否对其性能进行了评估?使用过程中主要遇到哪些挑战?你的项目做了哪些性能优化、稳定性优化、效果优化?你说通过XX动作提升了销量,具体转化链路是怎么跑通的?后训练的最终效果如何,业务收益是多少?和项目指标提升还不错,为什么不考虑上线使用?哪一项提升对模型的帮助最大?如何判断这个想法是有收益的?如何验证是否起作用的?对比baseline提升挺多的,这个提升你认为是怎么来的?对这个策略的有效性验证怎么样?收益到底来自哪里?收益拆分?数据和模型优化是否形成闭环?是不是可以减少后面人力的投入?是否完成线上部署?QPS、延迟、准确率等核心指标如何?有没有落地到真实业务场景?是否有实验验证两者联合使用的合理性? 「京东、字节Seed、字节跳动、拼多多、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 2. 【项目效果与落地】1. 有没有应用到困难任务的前景? 2. 有没有评估过具体是哪些优化点导致转人工率下降? 3. 线上怎么落地? 4. 项目:假如有70%的样本表现非常好,但是剩下30%左右的样本表现不好,那么模型下一步迭代的方向应该是怎样的? 「京东、字节Seed、美团」 **L4 优化与诊断** 1. 【效果与落地综合】1. DPO在其他指标优化时漏检率上升,如何调整并落地? 2. 为啥没有效果? 3. 优化前后效果、极限大概在哪、为什么这么估? 4. 你做的方法的性能上界在哪里? 5. 假如项目大规模使用了,如何解决这个问题? 6. 其他独立模型细节提问:上线可以撼动核心收益嘛? 7. 在模型迭代过程中,你如何平衡效果的稳定性? 8. 换到真实业务里,成本和收益是否仍然成立? 9. 换模型、换硬件还能成立吗? 「字节Seed、拼多多、腾讯、蚂蚁集团、阿里巴巴」 ## 复盘与改进 **L2 原理理解** 1. 【项目复盘与改进】请复盘你的项目经历,回答以下问题: 1. 哪个项目最想迭代改善?为什么? 2. 做完项目最大的复盘收获是什么? 3. 分享一个你在团队中推动测试流程优化的案例。 4. 有没有进行过复盘?具体如何做的? 5. 这段经历里有没有出现过判断失误?请举例。 6. 项目流程中有没有出现失败情况?如何应对的? 「京东、字节Seed、美团」 ## 其他经历 **L0 上下文不足(难度待定)** 1. 【论文要求】复是其实论文不是必备要求,不是说一定要有A会什么的。(就算是算法岗)最重要的是看你和? 「腾讯」 **L1 基础认知** 1. 【保研经历】介绍保研相关经历。 「阿里巴巴」 2. 【学术界与业界对比】对学术界和业界的看法。 「京东」 3. 【师兄师姐去向】实验室/课题组之前的师兄师姐的去向。 「字节跳动」 4. 【开源贡献】你还做了哪些开源贡献? 「腾讯」 5. 【技术兴趣】其他的技术感兴趣的方向? 「阿里巴巴」 6. 【新技术方向】最近在学习或关注哪些新的技术方向? 「蚂蚁集团」 7. 【求职进展】别的公司有没有在进行的流程? 「腾讯」 8. 【知识补充方式】计算机专业的知识是怎么补的? 「阿里巴巴」 9. 【研究生学习方式】在研究生阶段相关内容是怎么学习的? 「阿里巴巴」 10. 【竞赛经历】有没有竞赛获奖?请介绍本科竞赛经历,包括任务分配和队友合作情况。 「阿里巴巴」 11. 【课程帮助】本科学习的计算机课程中,哪些比较有帮助?这些课程在实际开发中起了什么作用? 「字节Seed、阿里巴巴」 # 业务场景与产品 ## 业务理解 **L0 上下文不足(难度待定)** **上下文不足** 1. 是否满足业务场景? 「阿里巴巴」 2. %的比例是怎么确定的? 「腾讯」 3. 站在老板视角,还有哪些能做的? 「阿里巴巴」 4. 责任、敏感指的是什么? 「百度」 **L1 基础认知** 1. 【业务场景与产品】请介绍公司业务、部门业务、团队当前业务、组核心业务、团队主要工作、团队规模、岗位业务内容、业务方向、业务方向选择、低端机定义、岗位工程算法偏向、面试考察侧重、AI工具使用情况。具体包括:1. 公司业务介绍;2. 部门业务介绍(如百度文库、网盘的多模态理解与生成);3. 团队当前业务;4. 组核心业务;5. 团队主要工作;6. 团队规模(多少人负责);7. 岗位业务了解(对所招聘岗位的了解);8. 业务方向有哪些;9. 业务方向选择(如三个业务方向选哪个);10. 低端机定义;11. 岗位更偏工程还是算法;12. 面试考察侧重(算法题比例降低后侧重哪些方面);13. 工作中是否使用AI工具辅助。 「京东、字节跳动、快手、百度、腾讯、阿里巴巴」 **L2 原理理解** 1. 【AI应用时机】什么时候开始用 AI? 「美团」 2. 【B端C端区别】你一直做to B,你觉得to B和to C 的区别是什么? 「阿里巴巴」 3. 【B端项目耗时关注】你们这种toB项目关注耗时吗? 「阿里巴巴」 4. 【GMV与ROI举例】前面说了关注GMV和ROI,举个具体例子来说明。 「京东」 5. 【UGC业务场景】ugc业务理解及场景 「字节跳动」 6. 【Web搜索成本】web search成本多高? 「阿里巴巴」 7. 【业务与研究选择】做业务还是研究 「百度」 8. 【业务场景与产品理解】1. 在什么场景下使用,支持什么样的业务? 2. 如何理解解决方案工程师岗位和职责? 3. 对“轮岗学习帮助LLM算法和多模态算法适配业务场景”的价值理解是什么? 4. 平台核心解决什么行业痛点? 5. 文心一言是ToB还是ToC多,为什么? 6. 是长期技术建设,还是临时项目交付? 7. 智驾系统中感知、预测、规划、控制四大模块的核心作用? 8. 介绍一下模型的业务场景。 9. 请用三个词概括你对AI Infra岗位的理解,并结合京东TET管培生项目说明。 10. 美团主要做的搜索,当时为什么考虑做搜索? 11. 而且这样的话,为什么不精准匹配才约面而是有点匹配就约? 12. 计划做什么业务? 13. 谈谈你对京东电商的理解? 14. 部署私有云有什么好处? 15. 除了电商还想做什么场景? 「京东、字节跳动、快手、百度、美团、腾讯、蚂蚁集团」 9. 【业务营收逻辑】业务逻辑、业务营收计算逻辑是什么? 「美团」 10. 【产品对比方法】不同产品之间如何做的对比? 「字节跳动」 11. 【京东电商优势】京东电商做得好的地方 「京东」 12. 【优先考虑因素】优先考虑哪些因素? 「字节跳动」 13. 【兴趣电商与直播电商区别】兴趣电商和直播电商有什么区别?在用户转化和销售上有什么不同? 「京东」 14. 【品类关注点】3C品类你关注什么?手机会注重什么功能和体验? 「京东」 15. 【团队后续规划】团队后续规划相关? 「腾讯」 16. 【团队技术规划】团队未来的技术规划? 「腾讯」 17. 【岗位核心问题】你觉得这个岗位会接触哪些核心问题? 「快手」 18. 【搜广推工作乐趣与案例分析】你觉得搜广推的工作有意思嘛,乐趣在哪里?平时生活遇到case,会和算法联系起来,分析具体的原因嘛? 「字节跳动」 19. 【算法工程师业务价值】你怎么理解算法工程师在业务中的价值? 「阿里巴巴」 20. 【自动驾驶岗位职责】你对京东算法工程师—自动驾驶岗位的核心职责有哪些理解? 「京东」 21. 【配送调度选择原因】你为什么选择做配送调度? 「美团」 **L3 实现与应用** 1. 【AI适用场景边界】AI的边界在哪一一什么场景好用、什么场景容易翻车。 「阿里巴巴」 2. 【专业领域大模型需求】各个专业领域是否需要各自的大模型来服务? 「腾讯混元」 3. 【业务场景权衡】讨论具体业务场景有没有跷跷板? 「字节跳动」 4. 【业务大局讨论】聊一些偏业务的东西,包括业务的更大局相关的点。 「字节跳动」 5. 【业务开展思路】你来的话,怎么做好这类业务? 「字节Seed」 6. 【业务技术规划】下个Q的业务重点发展方向、技术上规划如何? 「腾讯」 7. 【业务方向想法】结合业务方向你有什么想法。 「腾讯混元」 8. 【业务线协同】各业务线之间如何协同? 「腾讯」 9. 【产品演进与技术结合】当前产品如何演进并如何与最新技术结合? 「腾讯」 10. 【分析方法论】讨论是用结果反推原因吗? 「字节跳动」 11. 【动态定价与骑手收入】动态定价会不会影响骑手的收入预期? 「美团」 12. 【商家反馈解释】jd零售如何解释现象并回复商家:转化率高的商家说他流量少,转化低的商家说给他推的质量低? 「京东」 13. 【多业务场景视觉需求理解】如何快速理解并适应京东多业务场景的视觉需求,包括零售的虚拟试衣和商品货架识别、健康的远程问诊图像分析和医学影像诊断、科技的工业质检? 「京东」 14. 【多模态算法与业务指标结合】你认为多模态算法与业务指标的结合点是什么? 「京东」 15. 【工业界与学术界区别】在工业界(尤其是金融场景)进行算法研究,与学术界的研究有哪些主要区别?你如何适应这种转变? 「蚂蚁集团」 16. 【手机出货量预测】如何预测今年手机规模?具体方法是什么?影响PC/手机出货量的因素有哪些? 「百度」 17. 【技术创新与产品需求平衡】在你看来,如何平衡技术创新与产品需求? 「字节跳动」 18. 【技术解释沟通】你如何向一个不懂技术的业务方解释一个复杂风控模型的原理? 「蚂蚁集团」 19. 【数据结论冲突处理】你之前的实习,有没有因为数据结论得罪过业务方?怎么处理的? 「蚂蚁集团」 20. 【数据闭环概念与区别】什么是数据闭环?百度Apollo的数据闭环和其他公司有什么区别? 「百度」 21. 【新业务问题分析】遇到一个之前没接触过的业务问题,你会怎么开始分析? 「阿里巴巴」 22. 【智驾PM技术常识】你认为智驾PM需要具备哪些技术常识? 「百度」 23. 【智驾PRD特点】智驾PRD和普通互联网产品PRD的核心区别? 「百度」 24. 【智驾业务理解】你怎么理解百度 Apollo 的 L4 萝卜快跑和车载智驾业务? 「百度」 25. 【智驾未来判断】你对百度 Apollo 智驾业务的未来发展有什么判断? 「百度」 26. 【智驾核心痛点】你认为百度Apollo智驾产品目前的核心痛点是什么? 「百度」 27. 【智驾用户需求调研】如何做智驾功能的用户需求调研?核心难点是什么? 「百度」 28. 【模型上线指标监控】模型上线有观察大盘里一些播放、点击行为的大盘指标变化嘛? 「腾讯」 29. 【独立模型原因】介绍业务场景以及为什么要做独立模型? 「腾讯」 30. 【用户需求调研验证】XX产品项目的用户需求,你是怎么调研和验证的? 「京东」 31. 【私有化大模型原因】在线教育行业为什么部署私有化大模型? 「百度」 32. 【美团LongCat大模型场景】说说你对美团LongCat大模型业务落地场景的了解 「美团」 33. 【萝卜快跑运营模式】百度Apollo萝卜快跑的运营模式,你有什么看法? 「百度」 34. 【蚂蚁大模型应用场景】蚂蚁集团在大模型应用落地方面有哪些独特的场景和需求? 「蚂蚁集团」 35. 【计算机视觉业务价值】对“计算机视觉在京东零售/健康/科技业务中的核心价值”有什么理解? 「京东」 36. 【车路协同战略理解】你对百度Apollo“车路协同”战略的理解? 「百度」 37. 【选品核心标准】在选品或品类运营中,你判断一款品能不能做的核心标准是什么?最看重什么? 「京东」 38. 【风控模型迭代效率提升】你用过哪些工具或方法来提升风控模型的迭代效率? 「蚂蚁集团」 **L4 优化与诊断** 1. 【GMV下滑分析】如果直播间GMV下滑20%,同时我们的竞对也下滑20%,可以如何分析? 「字节跳动」 2. 【业务不达预期应对】如果按照你的洞察,业务最初不达预期,该如何解释&采取什么样的行动? 「字节跳动」 3. 【大模型API定价设计】大模型服务API定价问题:不同服务方案下,1K Token、32K上下文、128K上下文的输入输出定价如何设计? 「腾讯」 4. 【智驾商业化变现】百度Apollo的智驾产品,商业化变现路径有哪些?你有什么建议? 「百度」 5. 【短视频指标权衡】短视频信息流:完播率 / 互动率 / 留存,三者矛盾时怎么取舍? 「字节跳动」 6. 【自动驾驶战略与算法价值】1. 你如何平衡智驾产品的短期落地和长期战略布局?2. 你如何看待算法研究的“长期价值”与业务部门“短期需求”之间的矛盾?研究员应如何应对?3. 你对“算法创新是自动驾驶技术突破的核心动力,优秀的校招算法人才是京东自动驾驶业务发展的重要储备力量”这句话怎么理解?结合京东的业务定位与2026年自动驾驶发展战略,说明该岗位的核心价值?4. 自动驾驶算法工程师的核心目标有哪些?(如提升算法精度与实时性、保障系统安全性与可靠性、适配复杂业务场景、降低技术落地成本等)结合京东自动驾驶业务特点,谈谈如何通过算法工作助力达成这些目标?5. 项目如何活下去、怎么和别人竞争? 「京东、百度、蚂蚁集团」 7. 【蚂蚁算法痛点】请简述一个你认为在蚂蚁业务场景下,亟待通过基础算法突破来解决的痛点问题。 「蚂蚁集团」 8. 【调度算法问题排查】如果你的调度算法在实际运营中导致骑手投诉增加,你怎么排查? 「美团」 9. 【风控策略与需求优先级】1. 如果你的风控策略被业务方质疑,认为太严格影响了业务,你会怎么办?2. 当多个业务方的风控需求在资源上产生冲突时,你如何确定优先级? 「蚂蚁集团」 ## 场景方案设计 **L0 上下文不足(难度待定)** **上下文不足** 1. 手撕: 业务场景题。 「阿里巴巴」 2. 有哪些具体场景? 「京东」 **L2 原理理解** 1. 【场景方案设计】请结合AI工作流搭建、AI工具辅助问题解决、产品核心指标与功能、平台用户与核心问题等角度,回答以下问题:1. 平时怎么使用AI搭建自己的workflow?2. 主动提供AI工具看他能否迅速得到答案?3. 你觉得这个产品需要重点保证哪些核心指标或功能?4. 平台面向什么用户、解决什么核心问题? 「字节跳动、百度、腾讯、蚂蚁集团」 **L3 实现与应用** **场景方案设计** 1. 场景方案设计综合题:包括以下变体:1. 如何识别支付订单是否异常?2. 现场口述PRD,针对“为用户安排健身计划”问题,包括现有缺点、优化方向、以及如何与研发沟通总结。3. 用大模型搭建一个电商购物助手,你有什么思路?4. 用户反馈“百度Apollo智驾变道不流畅”,你如何拆解这个需求?5. 百度Apollo在和车企合作过程中,可能遇到哪些问题?如何解决?6. 百度Apollo的智驾芯片选型逻辑是什么?7. 纯聊天高德(poi)。8. 结合京东自动驾驶业务场景(如仓储物流自动驾驶、干线物流自动驾驶、末端配送自动驾驶等)、技术研发需求、跨团队协作要求,说明该岗位需适配的核心工作场景与能力要求。 「京东、百度、美团、腾讯」 2. 给你500万预算和一队人马,你要怎么从0-1搭建一套端到端的量产方案? 「字节跳动」 3. 美团的配送系统在暴雨天气下,订单超时率从5%飙升到25%。你怎么动态调整调度策略? 「美团」 4. 让你做一个骑手路径规划的实时优化方案,考虑等餐时间、交通状况、订单时序约束。 「美团」 5. 让你设计一个动态定价算法,在供需失衡时调整配送费。怎么平衡用户体验和运力调度? 「美团」 6. 设计美团本地生活用户导购Agent的完整技术架构,要求支持多轮对话、工具调用、RAG问答、任务自动终止、异常兜底。 「美团」 7. 资源有限(算力/人力/时间)时,优先做数据质量、SFT、对齐、推理成本、还是产品策略?给出排序与理由。 「拼多多」 8. 通用场景方案设计题:包括以下变体:1. 这段用户拉新项目,你怎么验证不同渠道的效果?2. 这问题就是故意不给细节,核心考察: 在信息不足的情况下,做出 reasonable 的假设和拆解?重,用户投诉很多,你打算怎么做。3. 需要考虑哪些成本和效果之间的平衡?4. 需要人工驾驶车辆哪些数据?5. 面对车企客户的定制化需求,你如何平衡标准化和个性化? 「京东、字节跳动、百度、阿里巴巴」 1. 【AI大模型应用场景判断】如何判断在线教育和金融行业的所有AI大模型应用场景? 「百度」 2. 【AI方案筛选】怎么筛选AI的方案? 「阿里巴巴」 3. 【AI编码产品模型规模选择】如果做一个AI coding类产品,你会如何选择模型规模? 「字节跳动」 4. 【LLM电商业务应用】场景题:假设我们是做电商的,你觉得可以怎么用大语言模型来解决我们的一些实际业务问题? 「字节跳动、阿里巴巴」 5. 【MVP优先级决策】如果一周内要上线一个MVP,哪些“最确定能提升体验”的点先做?哪些点先不做? 「拼多多」 6. 【低价商品销量提升】怎么提升一款低价商品的销量? 「拼多多」 7. 【功能落地APP适配】如果把这个功能落地到京东APP场景里,你会做哪些适配调整? 「京东」 8. 【商品详情页优化】如何优化商品的详情页,突出产品功能对比? 「京东」 9. 【图片问题解决方案设计】场景:给予用户给的图片解决某某问题,你怎么设计方案? 「阿里通义」 10. 【多传感器融合方案】多传感器融合的核心逻辑,百度Apollo采用的是什么方案? 「百度」 11. 【多模态大模型业务落地】你认为京东哪些业务最适合落地多模态大模型? 「京东」 12. 【大模型腾讯业务应用】场景应用:如何将大模型应用于腾讯业务(如微信、游戏、智能客服、内容生成)? 「腾讯混元」 13. 【大模型赋能游戏开发】对大模型如何赋能游戏开发有什么想法。 「腾讯混元」 14. 【大模型金融条款摘要】今年校招我们特别看重AI协同能力。假如给你一个任务,用大模型给花呗用户做额度感知摘要 (把复杂的金融条款翻译成大白话),你拿到这个需求的第一步是什么? 「蚂蚁集团」 15. 【库存保障策略】怎么样保障库存? 「京东」 16. 【异构数据库处理】内部数据库的格式不一样怎么处理?产品思维? 「百度」 17. 【指标优化设计】未来让你来优化这些指标你会怎么设计? 「字节跳动」 18. 【数据与模型优先级】先买数据还是先搭模型? 「字节跳动」 19. 【新技术业务重构注意事项】你觉得用新技术去重构或者改变原有的业务,在使用过程中需要注意哪些? 「京东」 20. 【无人网约车派单调度】无人网约车与传统网约车在派单调度方面的区别。 「百度」 21. 【春季商品推广活动规划】如果负责一个春季商品推广活动,怎么规划? 「京东」 22. 【智驾功能测试环节】智驾功能上线前,需要完成哪些核心测试环节? 「百度」 23. 【智驾需求落地推动】智驾PM和研发团队沟通时,如何推动需求落地? 「百度」 24. 【模型与工具选择决策】怎么根据用户实际场景,决定使用什么模型、接入什么工具的? 「字节Seed」 25. 【模型选择与适配】在业务上怎么判断用哪个模型?请结合京东业务场景说明如何选择适配的模型。 「京东、美团」 26. 【自动驾驶决策规划】自动驾驶决策规划场景题:包括以下变体:1. 车辆在实车路测中出现“画龙”(左右摆动的现象),你觉得是控制的问题还是规划的问题?如何定位?2. 面对拥堵路段的加塞场景,决策规划算法应该如何设计?是坚决不让(Conservative)还是稍微礼让(Aggressive)?3. 高速场景下不考虑动力学模型会有什么风险?4. 车辆由匝道汇入高速主路时,如何求解安全的汇入Gap?如果主路车辆不让行,车辆的极限决策是什么?5. 车辆在无保护左转(无专用左转灯,需让行直行车)时,决策规划模块需要处理哪些难点? 「腾讯」 27. 【自动驾驶安全模型与场景生成】RSS模型、协同控制、场景生成正常提问 「百度」 28. 【费用降低策略】有没有想过怎么去降低这个费用? 「美团」 29. 【预测不准的兜底策略】如果预测不准,规划如何兜底? 「腾讯」 30. 【风控方案设计】风控规则与特征设计:包括以下变体:1. 如何从零开始构建一个风控规则或特征?如何利用非传统数据源提升风控精准度?分享一个处理过的大规模数据(千万级以上)风控问题。分享一个通过规则和模型结合提升风控效果的案例。2. 针对实时交易反欺诈,如何设计一个低延迟、高可用的风控决策引擎? 「蚂蚁集团」 **L4 优化与诊断** 1. 【代码审查系统设计】动机:你的团队收到外包交付的代码,质量良莠不齐,leader要求整一个代码审查系统,任务给到你,3天后要报告。 「蚂蚁集团」 2. 【仿真到实车迁移问题诊断】你的模型在仿真里跑得好好的,一上车就“画龙”或者急刹,排查下来你觉得最可能的原因是什么? 「字节跳动」 3. 【信贷系统训练】如何训练一个信贷系统,输入个人信息,可以输出意见和额度? 「蚂蚁集团」 4. 【商品仓库分配建模】建模题:大意是好多商品+好多仓库,这些商品需求基本上很少,每天的销量不稳定,考虑送货和存储成本,问商品应该怎么分配到这些仓库里,以及每个仓库应该覆盖那些区域。 「京东」 5. 【城市NOA迭代规划】你如何规划百度Apollo城市NOA的下一轮迭代? 「百度」 6. 【推荐系统故障应急】大促期间AI推荐系统突然崩溃,你的第一反应是什么? 「京东」 7. 【新闻推送系统设计】在设计一个新闻推送系统时,如何实现新闻的分类、推荐及实时推送? 「美团」 8. 【智驾产品迭代优先级】如果你负责百度Apollo某一款智驾产品的迭代,你会优先做什么? 「百度」 9. 【智驾功能量产评估】你如何判断一个智驾功能是否具备量产落地条件?如何评估其落地可行性? 「百度」 10. 【智驾安全与用户体验平衡】你做过的项目中,如何平衡智驾功能的安全性和用户体验? 「百度」 11. 【本地生活智能Agent技术难点】本地生活场景下,智能导购/商家Agent的核心技术难点是什么? 「美团」 12. 【极端路况稳定性应急】如果世界末日让你完成京东自动驾驶算法测试开发工程师岗关键任务——立刻保证自动驾驶系统在极端路况下的稳定性,你的第一反应是什么? 「京东」 13. 【流量生成与实时检测策略】为什么第一个做大规模的流量生成?第二个不继续用他的流量?反而去做实时流量的检测? 「阿里巴巴」 14. 【电商大模型项目规划】如果三个月内交付一个电商大模型应用,里程碑如何拆分?每个阶段如何验收? 「拼多多」 15. 【算法性能与工程化落地平衡】你如何看待“算法性能”与“工程化落地”的关系?在京东自动驾驶系统研发、场景适配优化、安全性验证等场景中,如何平衡算法精度要求与实际业务落地可行性的关系? 「京东」 16. 【系统运转闭环设计】整个系统的运转闭环怎么做? 「蚂蚁集团」 17. 【自动驾驶博弈与路权】博弈中是否考虑路权优先级?是否考虑区域内多辆车的博弈? 「百度」 18. 【自动驾驶算法问题定位与改进】如果你发现一个自动驾驶算法在特定场景下表现不佳,你会如何定位问题并提出改进方案? 「京东」 **L5 综合与前沿** 1. 【多模态企业级解决方案设计】设计一个多模态企业级解决方案,提升企业级文档理解或智能客服体验,结合现有技术栈和业务痛点说明。 变体: - 场景:末端配送自动驾驶算法优化方案,梳理核心痛点、提出算法优化方向与具体方案、分析技术可行性,向导师汇报核心要点(痛点分析、优化建议、落地可行性、预期效果)。 「京东、腾讯」 ## 产品与用户 **L1 基础认知** 1. 【AI产品使用体验】你个人平常使用比较多的AI产品有哪些?具体是怎么使用这些AI产品的? 「字节Seed」 2. 【AI付费行为】你为AI基座模型付过费吗? 「美团」 3. 【AI消费电子功能】AI给消费电子产品带来了哪些新功能,举例? 「百度」 4. 【产品大模型应用】你们产品里真的用大模型了吗? 「美团」 5. 【工具使用方式】用户是怎么用你们的工具的? 「京东」 6. 【拼多多APP认知】你真的了解PDD这个APP吗? 「拼多多」 **L2 原理理解** 1. 【产品端与商业化】这个产品是电脑端还是手机端,用户量和商业化情况怎么样? 「字节跳动」 2. 【产品经理能力】你觉得产品经理需要什么样的能力?既有业务理解,能够洞察和分析用户需求,解决用户痛点,又需要懂一定的技术原理。 「百度」 3. 【产品缺点分析】你认为你设计的这个产品有什么缺点吗? 「腾讯」 4. 【技术方案沟通】向非技术背景的产品经理解释视觉技术方案时,如何简化专业术语? 「京东」 5. 【文心一言评价】对文心一言这个产品了解吗,有哪些优点和值得改进的点? 「百度」 6. 【文生图图生图产品】讲一下平时怎么使用文生图,图生图的产品,以及对这种市场的理解。 「百度」 7. 【用户调研需求】你给用户调研团队提需求,你会怎么提? 「字节Seed」 8. 【豆包产品问题】开放题:用过豆包吗,觉得目前豆包还存在什么问题? 「字节跳动」 **L3 实现与应用** 1. 【产品与用户】1. 你认为“客户为先”在多模态算法中如何体现? 2. 如何定义一个“好的智驾功能”?核心评价指标有哪些? 「京东、百度」 ## 风险与安全 **L0 上下文不足(难度待定)** **上下文不足** 1. 会有什么样的安全风险呢? 「腾讯」 2. 如何控制风险? 「美团」 3. 怎么防止Hacking? 「字节Seed」 4. 系统安全怎么保证的? 「腾讯」 5. 防刷? 「腾讯」 **L2 原理理解** 1. 【风控业务理解】讲一下自己对风控业务的理解。 「腾讯」 **L3 实现与应用** 1. 【价格歧视规避】怎么避免“杀熟”投诉? 「美团」 2. 【数据安全方案】有没有去调研过一些现成的数据安全方案? 「腾讯混元」 3. 【游戏外挂识别】你一般lol是怎么识别外挂的? 「腾讯」 4. 【用户隐私数据使用考量】有没有用到用户的隐私数据或者说对于用户的隐私数据怎么考量 「百度」 5. 【高风险操作二次确认】错误查询和高风险操作如何二次确认? 「腾讯」 **L4 优化与诊断** 1. 【AI生成内容伦理】你如何看待AI在音视频内容生成中的伦理问题? 「字节跳动」 2. 【团伙欺诈风控策略】在支付或信贷场景下,如何设计一个识别团伙欺诈的风控策略? 「蚂蚁集团」 3. 【图神经网络反团伙欺诈】描述一下你对图神经网络在反团伙欺诈中应用的理解和实践经验。 「蚂蚁集团」 4. 【大模型后训练伦理合规】你认为在金融、支付等强监管领域,大模型后训练需要特别注意哪些伦理和合规问题? 「蚂蚁集团」 5. 【数据隐私保护方案】如何设计数据隐私保护方案? 「腾讯」 6. 【新型欺诈防御策略】当面对一种新型的、没有历史样本的欺诈模式时,你会从哪些方面入手构建防御策略? 「蚂蚁集团」 7. 【智驾数据安全】百度Apollo在智驾数据安全方面,需要注意哪些问题? 「百度」 8. 【测试伦理问题】请分享一个你在测试中遇到的伦理问题及其解决方案。 「京东」 9. 【混合风控体系构建】如何构建一个既能快速响应(规则)又能深度挖掘(模型)的混合风控体系? 「蚂蚁集团」 10. 【线上风险发现与解决】请分享一个你主动发现并解决线上业务风险点的经历。 「蚂蚁集团」 11. 【自动驾驶法规与影响】你对自动驾驶行业相关法律法规、技术标准(如自动驾驶功能分级标准、数据安全相关法规、道路测试管理办法等)有哪些了解?谈谈这些政策法规对京东自动驾驶算法研发与落地的核心影响? 「京东」 12. 【自动驾驶算法研发风险防范】自动驾驶算法研发过程中常见的风险点有哪些?(如算法泛化能力不足、复杂场景适配失败、实时性不达标、数据标注错误、模型过拟合/欠拟合等)结合校招算法工程师岗位职责,谈谈如何防范这些风险? 「京东」 13. 【视觉数据隐私合规】计算机视觉应用中涉及用户图像/视频数据,如何确保数据处理符合隐私合规要求? 「京东」 14. 【责任敏感安全模型】什么是责任敏感安全模型?如何利用RSS来证明自动驾驶的事故责任不在于本车? 「腾讯」 15. 【隐私合规下的风控建模】在保障用户数据隐私(如满足合规要求)的前提下,如何进行有效的风控建模? 「蚂蚁集团」 16. 【风控准确率与覆盖率平衡】如何平衡风控的准确率和覆盖率?有没有实际的经验可以分享? 「蚂蚁集团」 17. 【风控模型稳定性与可解释性】你如何确保自己构建的风控模型是稳定且可解释的? 「蚂蚁集团」 18. 【风控系统性能优化】当业务快速增长,风控系统面临巨大的流量和计算压力时,你会从哪些方面进行优化? 「蚂蚁集团」 19. 【风控规则误杀优化】当你发现一个风控规则在线上误杀率很高时,你会怎么分析和优化它? 「蚂蚁集团」 20. 【黑产攻防案例】描述一个你处理过的、与黑产攻防对抗相关的具体案例。 「蚂蚁集团」 **L5 综合与前沿** 1. 【模型上线决策与跨团队冲突协调】1. 假设你负责一个关键金融产品的客服助手后训练项目,在临近上线时,测试发现模型在极少数情况下会对敏感金融操作给出模糊建议。此时业务方希望按时上线,你作为技术负责人该如何决策和应对? 2. 在跨团队合作中,如果业务部门提出的后训练目标(如极致流畅的对话体验)与安全团队提出的要求(如严格的内容过滤)存在直接冲突,你如何协调并制定可行的技术方案? 「蚂蚁集团」 ## 行业认知 **L0 上下文不足(难度待定)** **上下文不足** 1. 你觉得这呈现出什么趋势? 「蚂蚁集团」 2. 对行业的看法以及未来如何改进? 「阿里通义」 **L1 基础认知** 1. 【FPS游戏经验】还玩过哪些FPS游戏吗? 「腾讯」 2. 【产业动态跟踪渠道】你通过哪些渠道跟踪计算机视觉产业动态? 「京东」 3. 【商业落地案例】最近关注的一个商业落地案例是什么? 「京东」 4. 【电商品类与标品非标品】电商分为哪些品类?标品和非标品有什么区别?你对哪个品类最感兴趣? 「京东」 5. 【菜鸟网络了解】对菜鸟的了解。 「阿里巴巴」 **L2 原理理解** 1. 【Agent时代候选人期望】在当下Agent迅猛发展的环境下,对候选人的期望? 「腾讯」 2. 【AI医学价值】医学方面ai的技术价值和利润价值 「拼多多」 3. 【AI大模型商业模式与市场】AI大模型行业的营收模式?对AI大模型行业的了解:市场规模、竞争格局、可应用于哪些行业? 「百度」 4. 【AI对研发的影响】在AI加持下,研发跟之前有什么区别?什么东西在AI时代更重要? 「美团」 5. 【AI浪潮看法】你对现在这个AI的这个浪潮如何看待? 「百度」 6. 【Claude Code应用】国外用Claude Code在做什么? 「美团」 7. 【专业领域大模型需求】各个专业领域是否需要各自的大模型来服务? 「百度」 8. 【云计算趋势】对云计算怎么看,整体趋势怎么理解? 「腾讯」 9. 【产业互联网概念】如何理解产业互联网? 「百度」 10. 【京东技术布局启发】对京东技术布局有何启发? 「京东」 11. 【京东计算机视觉竞争力】你认为京东在计算机视觉领域的核心竞争力是什么? 「京东」 12. 【岗位与行业理解】有没有接触过这个岗位?谈谈对这个岗位乃至整个行业的理解。 「美团」 13. 【强脑科技评价】让我评价强脑科技? 「蚂蚁集团」 14. 【技术发展趋势】对自动驾驶技术发展的看法? 当前技术发展趋势的看法? 「百度、腾讯」 15. 【拼多多评价】评价一下拼多多。 「拼多多」 16. 【文心一言评价】对文心一言的了解:优点&可以改进的地方 「百度文心」 17. 【概念热度看法】龙虾也很火,你怎么看待或者理解这么多概念? 「京东」 18. 【电商运营差异】你觉得PDD和淘宝/京东最大的运营差异是什么? 「拼多多」 19. 【竞品市场流行原因】说说某个主流竞品为什么在当地市场流行? 「字节跳动」 20. 【自动驾驶与具身智能前景】也聊了下自动驾驶和机器人/具身智能的前景;你对智驾行业的商业化前景有什么看法? 「百度」 21. 【自动驾驶分级差异】L2和L4的区别:少了人类的兜底逻辑很多产品的设计出发点就变了 「百度」 22. 【菲律宾市场了解】谈谈对菲律宾市场的了解? 「字节跳动」 23. 【音视频应用前景】你如何看待音视频技术与元宇宙的结合?你如何看待音视频技术在以下领域的应用前景?医疗、教育、自动驾驶、虚拟现实(原记录分别提问)。 「字节跳动」 24. 【音视频算法工程师素质】在你看来,一个优秀的音视频算法工程师应具备哪些素质? 「字节跳动」 **L3 实现与应用** 1. 【应用场景云AI算力重要性】如何看待应用场景、云、AI算力,三者谁更重要? 「百度」 2. 【智驾产品经理能力需求】你认为智驾PM未来1-3年的核心能力需求会发生什么变化? 「百度」 3. 【游戏AI应用场景判断】如何判断一家游戏公司的AI应用场景,公司要不要进入? 「百度」 4. 【百度Apollo智驾技术与竞争分析】1. 如何向非技术背景的车企客户解释百度Apollo的智驾技术优势?2. 智驾行业目前面临的核心痛点是什么?百度Apollo该如何应对?3. 百度Apollo和小鹏XNGP、华为ADS的智驾功能,竞品差异是什么?4. 城市NOA和高速NOA的技术差异,百度Apollo的优势在哪? 「百度」 5. 【竞品分析豆包不足】如果要做竞品分析,指出豆包的不足并引起重视,要怎么做? 「字节Seed」 6. 【自动驾驶决策规划瓶颈】你认为当前自动驾驶决策规划最大的瓶颈在哪里?是数据量不够、算力不足,还是算法理论(如因果推断)尚未突破? 「腾讯」 7. 【自动驾驶竞争力与京东优势】1. 你认为京东自动驾驶算法工程师的核心竞争力是什么?请分析当前自动驾驶算法领域的竞争格局,谈谈京东在业务场景覆盖、数据资源储备、技术研发实力等方面的核心优势?2. 面对智驾行业的技术迭代和市场竞争,你会如何保持自身竞争力? 「京东、百度」 8. 【自动驾驶端到端技术路线】1. L4会上端到端吗?观点:不会,因为安全性无比重要,只可能给个别模块上数据驱动。2. 如何评价楼教主关于端到端和L4的观点? 「百度」 9. 【自研底座模型差异】你怎么看"有自研底座模型"和"没有底座模型"的公司的区别? 「阿里巴巴」 10. 【配送调度差异化】美团的配送调度要和饿了么竞争,你怎么做差异化? 「美团」 **L4 优化与诊断** 1. 【前沿方向业务投入判断】怎么看待前沿方向(Long Context、Test-time Scaling等):如何判断值不值得投入到业务里? 「拼多多」 2. 【大模型技术演进与应用挑战】行业趋势开放讨论:针对当前大模型的技术演进(如参数规模、多模态能力、对齐效率)、应用落地挑战(如伦理风险、算力成本)等方向发表个人观点,考察技术敏感度与行业认知。 「腾讯混元」 3. 【自动驾驶行业与京东优势】你对当前自动驾驶行业的发展现状与技术趋势有哪些深入理解?请说明京东在仓储物流自动驾驶、干线物流自动驾驶等领域的核心技术优势,谈谈你如何助力公司相关算法战略落地? 「京东」 # 行为面试与HR ## 自我介绍 **L1 基础认知** **自我介绍** 1. 请做自我介绍。变体:1. 然后挑一个项目。2. 然后挑一段经历展开。3. 然后说他一会儿敲键盘是记录面试情况。4. 然后进行项目拷打。5. 然后问为什么要面百度。6. 由于没有互联网实习,为了表现优势,强调是大模型资深用户。7. 简历项目提问,是否了解推荐算法?8. 简洁突出核心竞争力和适配性。9. 重点突出项目成果和产品能力。10. 项目询问。11. 师傅你是做什么工作的?12. 请快速吟唱自我介绍。13. 请用中文做自我介绍。 「字节跳动、百度、美团、阿里巴巴」 2. 请做自我介绍。变体包括:1. 介绍性格、MBTI、毕业时间、实习时长等。2. 介绍所学技术、学习方法、是否有博客。3. 时长要求:2分钟、3分钟、5分钟、15分钟(含项目介绍)、简短。4. 重点内容:智驾相关经历、背景与实习项目、个人及部门业务、核心优势、小红书实习经历、base地、离职原因、看机会原因、大模型相关经历、RLHF相关工作、论文在投/发表、多模态推理中的RL部分、实习项目及多模态/视觉八股、实习工作场景。5. 形式:可用英文、需总结核心优势、结合简历、简短、部分场次要求熟练、不用开摄像头。6. 其他:日常被问专业跨度大、根据JD微调细节、然后他也会。 「京东、字节Seed、字节跳动、百度、美团、腾讯、蚂蚁集团、阿里巴巴」 **L3 实现与应用** 1. 【自我介绍】请做自我介绍。变体:1. 重点分享与多模态大模型相关的经历(如跨模态项目、图像/语音算法开发、开源项目贡献)。2. 重点分享与大语言模型相关的经历(如LLM微调项目、论文研究、开源项目贡献)。3. 包括个人背景、大学经历或实习经历;同时说明AI大模型这类新工具如何融入学习和实践。4. 突出与计算机视觉相关的优势。5. 询问学校专业、是否保研、研究方向(与深度学习/机器学习的关系)。 「京东、字节Seed、字节跳动、快手、拼多多、百度、百度文心、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 ## 求职动机 **L1 基础认知** 1. 【offer选择与权衡】目前有没有其他offer?为什么优先考虑百度Apollo? 「百度」 2. 【专业背景与方向选择】本科硕士都不是cs,为什么选推荐不选大模型,agent? 「字节跳动」 3. 【业务与技术关系】如何看待业务和技术? 「美团」 4. 【个人方法论】你过往的个人方法论是什么? 「美团」 5. 【个人贡献】如果拿到Offer,你能为团队做出什么贡献? 「百度、百度文心」 6. 【主动学习经历】请分享一次你为了学习一项新技术或新算法,而主动投入大量时间和精力的经历。 「蚂蚁集团」 7. 【企业文化了解】你对百度Apollo的企业文化有什么了解? 「百度」 8. 【企业特质与个人契合】你认为京东的实体经济根基、自动驾驶业务布局优势、完善的校招培养体系、“以信赖为基础,以客户为中心的价值创造”的企业使命等特质,哪些契合你的职业发展需求? 「京东」 9. 【入职初期贡献】如果我有幸加入,在初的3-6个月,您希望我优先在哪个方面为团队创造价值? 「阿里通义」 10. 【公司意向】后续秋招考虑字节的意向大不大?对字节的看法? 「字节跳动」 11. 【其他岗位投递情况】除京东外,你还投递了哪些计算机视觉岗位? 「京东」 12. 【其他求职进展】最近有无其他投递的公司?面试进展如何? 「字节跳动」 13. 【内在驱动力】在整个人生中,什么驱动着你,因素是什么,动力来源是什么? 「百度」 14. 【前沿跟踪途径】跟踪领域前沿是研究员的必备技能。你通常通过哪些途径保持对基础算法领域最新进展的敏感度? 「蚂蚁集团」 15. 【匹配度考量】如果可以培养,那为什么在面试完筛选阶段如此考虑match程度? 「腾讯」 16. 【反问环节】你有什么想问我们的? 「京东、美团」 17. 【团队招聘期望】这个团队希望招到什么样的人? 「字节跳动」 18. 【学习与信息获取】你平时怎么学习新的算法和技术,通过哪些渠道获取技术信息,如何保持技术敏感度?最近在学什么? 「腾讯、阿里巴巴」 19. 【学习方法】你平时如何学习AI知识,包括LLM算法和多模态算法? 「京东、字节Seed、阿里巴巴」 20. 【学习方法与平衡】学习成绩这么好有什么方法吗,研究生是怎么平衡学业和科研的? 「字节Seed」 21. 【学校课题情况】问学校那边的情况,在学校做的课题是什么等等 「百度」 22. 【实习动机】出来实习为了什么? 「京东」 23. 【实习研究方向】实习期间希望研究的方向 「百度」 24. 【实习经历解释】前两段实习较短原因。 「阿里通义」 25. 【实习获取途径】实习都是自己找的吗,还是导师推荐? 「字节Seed」 26. 【岗位了解】在之前两轮面试后,对于我们部门和岗位的了解是什么? 「字节跳动」 27. 【岗位优势】有什么好处? 「腾讯」 28. 【岗位意向】你对这个岗位的意向如何? 「腾讯」 29. 【岗位技术方向】这个岗位未来是更偏 Agent 系统研发,还是大模型底层调优? 「百度」 30. 【岗位方向询问】提问:岗位的具体方向 「美团」 31. 【岗位期待与目标】你对这个岗位有什么期待、想做的事情或目标?如果未来来这里工作,你对工作有什么展望或期待? 「字节跳动、腾讯、蚂蚁集团、阿里巴巴」 32. 【岗位职责与能力要求】如果我有幸加入,我主要负责方向,以及您觉得胜任本岗位需要哪些方面的能力? 「腾讯」 33. 【岗位职责理解】请谈谈你对蚂蚁集团基础算法研究员岗位核心职责的理解。 「蚂蚁集团」 34. 【岗位选择动机】动机问题很多:为什么是tiktok shop? 「字节跳动」 35. 【工作偏好】喜欢研究还是应用还是业务? 「蚂蚁集团」 36. 【工作内容接受度】如果入职后让你做一些纯Agent链路开发,或者纯Prompt调优的工作(不怎么涉及大模型本身的训练),你能接受吗? 「字节跳动」 37. 【工作方式偏好】假设后面来这边实习,面对工作安排,你会选择直接独立去做一个项目,还是前期先做一些基础性的工作? 「腾讯」 38. 【技术方向差异】安全技术和技术研究、应用研究有什么差别吗? 「腾讯」 39. 【技术栈了解】你有什么问题想了解关于京东多模态团队的技术栈(如模型架构、落地场景)? 「京东」 40. 【技术栈优势】最擅长的技术栈是什么? 「拼多多」 41. 【抗压能力】你能接受11-11-6的工作强度和高压力的算法迭代吗? 「京东、拼多多」 42. 【提前入职意愿】高兴提前来我们这边一起做点好玩的东西吗? 「蚂蚁集团」 43. 【新人培养机制】这边对新人的培养机制是怎样的? 「腾讯」 44. 【方向选择困惑】在华为实习的时候我问我的mt,是否该选择自己目前做的这个方向,总觉得工作的时候不做这个可惜了。 「腾讯」 45. 【核心竞争力】你认为的核心竞争力在哪? 「腾讯」 46. 【求职动机】你现在主要看机会的原因是什么? 「字节Seed」 47. 【求职动机与岗位匹配】1. 对新人(非科班转码、有经验差异者)的期待与建议?2. 对游戏的热爱(举例说明游戏优点、NPC等)。3. 对美团了解(如美团打车)?4. 将来研究方向是否明确?5. 岗位业务职责与协作情况?6. 岗位是否匹配?7. 工作体验、如何landing、有无老师带及后续流程?8. 工程性和理论性对实习生哪个更重要?9. 希望实习生具体参与哪块工作或方向?10. 希望工作环境?11. 希望通过实习提升哪些能力?12. 平常刷力扣到什么程度?13. 平时用AI编程工具吗?具体用什么?14. 面试官对候选人的定位?15. 想去做工程还是research(倾向搭开源框架还是做research,来这里做科研还是业务,组内业务还是research)?16. 未来职业方向/领域倾向?17. 找工作比较在意的点(除薪资外)?18. 技术上哪个了解最多?哪些与申请实习相关性最高? 「京东、字节Seed、字节跳动、拼多多、百度、百度文心、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴、阿里通义」 48. 【求职意向】你的未来求职意向是什么?你想找什么样的工作? 「百度、蚂蚁集团」 49. 【研究方向匹配】你的研究方向和团队是否匹配? 「字节Seed」 50. 【秋招进度与城市偏好】目前还在推荐的秋招进度、比较倾向的城市。 「百度」 51. 【竞品投递与选择理由】除了京东,你还投递了哪些企业的自动驾驶算法相关校招岗位?为什么最终更倾向于加入京东自动驾驶算法工程师团队? 「京东」 52. 【综合问题】其他:包括未来的职业规划和求学规划。用三个词介绍自己的优点。手头有没有别的offer,如何权衡?可实习时长、到岗时间。 「字节跳动」 53. 【职业规划与大厂意向】你未来规划,对大厂的意向。 「阿里巴巴」 54. 【能力提升可能性】能不能往上提到他们要求的程度? 「阿里巴巴」 55. 【自学方法】你现在是自学推荐系统吗,有去找网上对应的一些资料或者说视频来看吗? 「腾讯」 56. 【自我介绍与求职动机】简单介绍一下自己,以及为什么想做智驾PM、想加入百度Apollo? 「百度」 57. 【角色认知与行业趋势】你认为校招算法工程师在京东推进自动驾驶技术研发落地、提升自动驾驶系统安全性与可靠性、实现2026年自动驾驶业务战略目标过程中扮演什么角色?结合当前自动驾驶行业算法工程师发展趋势,谈谈你的看法? 「京东」 58. 【课程与大模型关联】本专业的课程涉及大模型方面吗? 「京东」 59. 【跳槽动机与合理性】看机会的原因?你觉得经常跳槽合理吗? 「蚂蚁集团」 60. 【转正意向】有没有考虑在现实习单位转正? 「京东」 61. 【转行动机】动机考察:之前都是战略相关,为什么想来做电商策略?/依旧为什么要从战略转电商业务? 「字节跳动」 62. 【适应与学习能力】你如何快速适应京东的技术研发氛围、熟悉自动驾驶业务场景、掌握新技术/新业务的经历? 「京东」 **L2 原理理解** 1. 【专业选择与转行动机】为什么本科选择当前专业?为什么研究生改变了专业?为什么本硕期间有间断?为什么没保研?为什么要读研而不是本科就业?为什么专业不相关却想做算法?为什么想转行? 「京东、字节跳动、百度、美团、阿里通义」 2. 【个人背景与岗位匹配】请介绍你的专业、研究方向、技术背景,并阐述为什么你认为自己适合蚂蚁集团大模型后训练算法工程师这个岗位?同时,请明确你的岗位定位是开发还是算法? 「字节跳动、腾讯、蚂蚁集团」 3. 【公司选择与方向动机】为什么要来腾讯,为什么想做大模型 「腾讯混元」 4. 【公司选择动机】为什么选择我们公司/岗位?请结合具体公司特点和个人职业规划回答。 变体: - 字节跳动:为什么想来字节,最吸引你的点是什么?为什么对字节和这个岗位感兴趣? - 京东:为什么选择京东?为什么选择京东而不是纯AI大模型初创公司?为什么选择京东金融? - 实习:为什么选择去这个实习?为什么选择我们这里? - 百度Apollo:为什么选择百度Apollo,而不是其他智驾公司(Momenta、华为等)? - 蚂蚁集团:为什么选择蚂蚁集团? 「京东、字节Seed、字节跳动、百度、蚂蚁集团」 5. 【学业与职业选择思考】之前在学业工作上的一些选择,是怎么考虑的? 「字节跳动」 6. 【学习路径规划】你会从哪些基础课程入手? 「腾讯」 7. 【岗位申请动机】你为什么申请京东TET多模态大模型算法开发方向或大语言模型算法开发方向? 「京东」 8. 【岗位选择动机】为什么选择这个岗位?为什么匹配?为什么是策略运营岗?为什么要应聘那个岗位?为啥想来做算法?以后想要从事什么样的工作?你为什么想做这个岗位? 「字节跳动、百度」 9. 【工作价值观】你下一份工作最看重的是什么? 「字节跳动」 10. 【技术学习与竞争力保持】你如何保持对AI领域新技术的跟进,包括使用AI工具、关注新技术趋势以及学习一门新技术(如AI Infra前沿技术)?同时,如何在使用AI工具的情况下保持自身竞争力? 「百度、腾讯、蚂蚁集团」 11. 【推荐算法方向选择】为什么选择推荐算法方向?结合你的背景(如大模型、CV经历)说明动机,并解释为何从之前领域转向推荐(包括传统推荐与基于大模型的推荐)。 「百度、腾讯」 12. 【方向选择动机】你为什么选择多模态算法方向? 「京东」 13. 【校招培养体系了解】你了解的京东校招算法工程师培养体系有哪些?(如系统化岗前技术培训、资深导师带教机制、核心项目实战历练、跨团队技术交流、专业技能提升课程等)你对该体系有哪些期待? 「京东」 14. 【离职与实习变动原因】为什么不在当前公司留用?为什么不继续在原来的公司实习?为什么不继续干?为什么从滴滴离开或者说对下段实习的期待?为什么出来看机会?为什么想换实习?为什么想离职?为什么考虑离开当前公司?为什么过年了要出来实习?之前是在百度哪个部门啊,咋不继续去那边实习?之前那个组情况如何? 「京东、字节跳动、百度、美团、腾讯、阿里巴巴」 15. 【转行动机】你为什么想转行做智驾PM(若有转行经历)? 「百度」 **L3 实现与应用** 1. 【岗位选择与方向偏好】为什么申请京东计算机视觉/算法工程师(自动驾驶校招)岗位?请说明职业选择逻辑,以及对京东“以技术创新驱动自动驾驶落地,构建高效智能物流生态”战略的理解。京东自动驾驶算法工作涵盖感知、决策规划、控制、数据驱动算法优化、仿真测试等多个方向,你更倾向于哪个方向?为什么?请结合自身优势说明适配性。 「京东」 2. 【部门选择与业务理解】为什么选择腾讯CSIG而不是其他BG(如WXG、PCG)做多模态?你对我们部门在产业互联网中的技术定位和业务目标了解多少? 「腾讯」 ## 职业规划 **L3 实现与应用** **职业规划** 1. 个人未来规划。 「美团」 2. 为什么想来这个岗位实习,职业规划? 「字节跳动」 3. 之后会考虑读博吗? 「百度」 4. 之后是怎么规划的? 「字节跳动」 5. 介绍工作规划。 「百度」 6. 以后是想做产品经理还是走算法工程师路线? 「京东」 7. 你两段实习经历都偏视觉和当前大模型岗位好像不是很符合,你是怎么想的,对未来的职业规划是什么样的? 「京东」 8. 你对加入京东后的职业规划是什么?希望通过算法工程师一自动驾驶校招岗位,在专业能力(如核心算法设计能力、工程化落地能力、业务场景适配能力)、行业认知、技术视野上实现哪些突破? 「京东」 9. 你对自己的规划是怎么样的?后续想做哪些方向有想过吗? 「字节跳动」 10. 你未来3-5年的职业规划是怎样的? 「蚂蚁集团」 11. 你未来想往前端还是后端发展? 「腾讯」 12. 你现在是研一,那你后面打算考虑往哪方面发展?在研究和业务方面你更偏向于哪一块? 「腾讯」 13. 你的职业规划是什么? 「美团」 14. 你认为一名优秀的基础算法研究员,除了扎实的理论功底,还应具备哪些对岗位的认知? 「蚂蚁集团」 15. 后续打算做什么? 「字节Seed」 16. 在你未来的职业发展中,最希望实现的目标是什么? 「字节跳动」 17. 在你看来,如何保持技术的前沿性和创新性? 「字节跳动」 18. 在工作中,如何保持对自动驾驶技术趋势、算法创新方向、京东自动驾驶业务发展动态的敏感度?当长期面临重复的基础工作(如数据标注审核、模型调参、常规测试验证)时,你会如何调整? 「京东」 19. 更关注你想做什么、志趣方向到底在哪里? 「字节Seed」 20. 未来3-5年的职业规划是什么?和百度Apollo的发展匹配度如何?未来怎么提升自己?未来想做的方向(图像-文本、语音-文本还是视频-文本融合?)。未来的工作规划。最希望提升哪方面的能力?畅想五年后的你自己;希望是什么状态?简单阐述个人职业发展规划。组里晋升节奏?聊天,包括职业规划等等。职业发展与学习方式如何跟进AI前沿?后面想做什么方向的事情?职业规划中,计算机视觉经历能为你带来什么帮助?职业规划/工作方向。意向城市,毕业时间。第一份工作的考量因素/多段实习经历的整体感受。介绍一下自己的研究和未来规划。转向大模型/Agent,你是怎么思考与选择的? 「京东、字节Seed、字节跳动、拼多多、百度、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 21. 请描述你职业规划中与蚂蚁集团基础算法研究相关的部分,以及你希望在未来3-5年达成什么目标? 「蚂蚁集团」 ## 优缺点与性格 **L0 上下文不足(难度待定)** **上下文不足** 1. 前面是会做题考察你的稳定性和性格 「百度」 2. 我确实花了很长的时间去说服自己放下infra的执念,也许是导师告诉我师姐找的工作是怎样的,也许是看到了其实身边的人也有很多种工作的可能,甚至计算机专业为什么一定就要做计算机呢? 「腾讯」 3. 比如之前工作经历问的很细致,自身优缺点,是否升职,应该是多维度评估面试人。 「腾讯」 **L1 基础认知** 1. 【他人评价与改进建议】同事或导师通常用哪三个词评价你的计算机视觉能力?同学觉得自己在工作上还有哪些需要提升的吗?你的mt/导师有对你提过什么建议吗? 「京东、腾讯」 2. 【优缺点】你的优势是什么?你的优缺点各是什么?请分别说出至少一个优点和一个缺点。你认为自己最大的优点和缺点分别是什么?这些特质将如何影响你在本岗位的工作?另外,有什么劣势? 「京东、字节跳动、百度、腾讯、蚂蚁集团、阿里巴巴」 3. 【兴趣爱好】有什么兴趣爱好? 「字节跳动」 4. 【失败与放弃经历】请举例说明你主动放弃的一件事,以及如何从失败中学习,并分享一个从失败或挫折中学习的经历,它对你后续的工作产生了什么影响? 「蚂蚁集团、阿里巴巴」 5. 【对面试官的评价与建议】你觉得我还有哪些地方需要改进?对我个人评价? 「京东、百度、腾讯」 6. 【成就感来源】你认为自动驾驶算法工程师工作中最能让你产生成就感的部分是什么?(如通过算法优化提升自动驾驶系统性能、解决复杂场景技术难题、推动自动驾驶技术落地应用、助力业务效率提升等)请结合自身经历举例说明。另外,在实习中,哪项工作让你最有成就感?为什么? 「京东、腾讯」 7. 【技术热情与学习能力】你如何保持自己的技术热情和持续学习的能力?怎么证明你的自驱力和学习能力比较好?请分享一次你快速学习新技术的经历。 「字节跳动、蚂蚁集团」 8. 【擅长领域与短板弥补】更擅长哪一块:数据/训练/评测/工程/业务沟通?短板准备怎么补? 「拼多多」 9. 【文科背景的优势】本科学的是文科;这块知识让你受益的部分是什么? 「阿里巴巴」 10. 【最大成就】介绍一下你目前为止觉得最大的成就或最骄傲的一件事。 「京东」 11. 【班级水平】在班级的水平处于什么程度?身边同学的情况如何? 「蚂蚁集团」 12. 【算法工程师特质】你认为算法工程师(如京东自动驾驶、蚂蚁大模型后训练、基础算法研究等方向)需具备哪些核心素质或最重要的个人特质?请结合自身情况举例说明。 「京东、美团、蚂蚁集团」 13. 【自我评价与性格】请介绍你的性格,包括用三个词语形容你自己,以及如果分裂出另一个你来描述自己,哪些词比较贴切?同时请对自己的性格和家乡进行评价。另外,平常做决定的方式是怎样的? 「京东、阿里巴巴」 ## 团队协作与沟通 **L0 上下文不足(难度待定)** **上下文不足** 1. 后面就是ai数字人对你进行常规面试,不过会深挖一些业务场景,比如说如何达成业绩,如何和团队沟通 「百度」 2. 怎么聊了半小时大学生社团活动? 「百度」 **L1 基础认知** 1. 【上下级关系】介绍一下大老板和小老板 「字节Seed」 2. 【主动沟通达成事项】在过去的实习经历里边的话,有什么是你个人主动通过沟通就能达成的吗? 「腾讯」 3. 【价值观与行为事例】京东的核心价值观是‘客户为先’,分享一个你为满足他人需求牺牲个人利益的例子。 「京东」 4. 【合作看法】如何看待和他人合作完成一件工作? 「京东」 5. 【团队分工与协作】团队一般怎么分工协作?团队之间是怎么协作的? 「百度文心、腾讯」 6. 【团队合作关键要素】在你看来,团队合作中最重要的是什么? 「字节跳动」 7. 【团队奖励分配】组内奖励差异大吗? 「腾讯」 8. 【团队工作内容与业务】团队平时的工作内容和主要业务是什么? 「蚂蚁集团」 9. 【团队工作节奏与沟通方式】平时团队的工作节奏和沟通方式是怎样的? 「百度」 10. 【团队构成】团队构成是怎样的? 「蚂蚁集团」 11. 【团队氛围与工作强度】团队的工作氛围、工作强度及生活与工作的兼顾情况如何? 「蚂蚁集团」 12. 【实习交流与人际关系】实习中和其他人交流如何,和mentor/leader关系如何,和运营产品交流多吗,实验室人际关系如何 「美团」 13. 【实习生探索支持】能否支持实习生做一些探索? 「腾讯」 14. 【实验室分工】你跟实验室同学合作的时候,怎么分工的? 「百度」 15. 【期望团队角色】在团队中希望承担什么样的角色,为什么? 「美团」 16. 【经历感受与MBTI】问经历问感受,还有mbti 「腾讯」 17. 【自我评价沟通协作】你如何评价自己的沟通能力和协作精神? 「蚂蚁集团」 18. 【赛马机制与跨部门合作】会不会赛马,不同部门之间合作多吗? 「京东」 19. 【跨方向交流】实习过程与其他方向的有没有交流,如工程和产品? 「美团」 20. 【需求沟通矛盾】和开发/运营沟通需求时出现过矛盾吗? 「京东」 **L2 原理理解** 1. 【与产品经理沟通】你如何与产品经理有效沟通技术实现方案? 「蚂蚁集团」 2. 【与导师意见分歧处理】当你的想法和mentor不一致时,你会怎么处理?当你的研究思路或算法设计与团队主流意见或导师的建议相左时,你会如何处理? 「蚂蚁集团」 3. 【代码可读性与沟通】你写的代码如果同事看不懂,或者觉得逻辑太复杂,你会怎么处理? 「腾讯」 4. 【任务分工冲突处理】任务分工师弟不满意的时候,你怎么处理? 「字节跳动」 5. 【任务执行与框架学习】借助人工智能如何处理领导分配的任务,使用什么方法来确保自己一定能够去掌握相关的开源框架? 「腾讯」 6. 【优秀与出色同事的区别】您觉得在这个岗位上,做得好的同事和做得特别出色的同事,主要的区别是什么? 「阿里通义」 7. 【发现同事疏漏的处理】在团队合作中,如果你发现同事的工作存在疏漏(如算法逻辑有偏差、代码存在漏洞、数据处理不规范、测试验证不全面等),你会如何提醒和帮助对方?请结合过往案例说明。 「京东」 8. 【团队角色与价值创造】在团队合作中,你通常扮演什么角色?你认为在算法研究团队中,你的角色如何为团队创造价值? 「蚂蚁集团」 9. 【实习经历与离职原因】问实习相关,相处方式,离职原因 「阿里巴巴」 10. 【工作被误解处理】如果在团队中你的工作被其他成员误解,你会如何处理? 「字节跳动」 11. 【应对不情愿的任务】师兄/导师安排不想做的事情时,你怎么应对? 「字节跳动」 12. 【应对不熟悉业务需求】当面对不熟悉的业务需求时,你的应对策略是什么? 「蚂蚁集团」 13. 【意见分歧处理与推动共识】在团队讨论中,你如何表达不同意见?当和团队出现意见分歧时,你是怎么推动共识、落地执行的?在项目中遇到大家意见不合时候,如何去处理? 「京东、百度、蚂蚁集团」 14. 【意见分歧经历】有没有遇到意见不一致的情况? 「百度」 15. 【技术方案分歧与质疑应对】在团队合作开发一个模型时,你和同事对技术方案有分歧,通常怎么处理?如果方案与团队主流意见或上级决策不一致,你会如何处理?如果在团队中,你的技术方案被质疑,你会如何应对? 「京东、字节跳动、蚂蚁集团、阿里巴巴」 16. 【技术方案分歧达成共识】当团队成员对技术方案有分歧时,如何沟通并达成共识? 「腾讯」 17. 【测试结果分歧解决】如果你与开发团队在测试结果上存在分歧,你会如何解决? 「京东」 18. 【矛盾处理】工作中如果和同事、领导产生矛盾,你会怎么处理? 「百度」 19. 【组织与领导经历】你在大学期间是否组织过自动驾驶算法相关活动、技术分享会、算法竞赛等活动,或担任科研项目小组负责人、学生干部?请说明你在其中的角色、遇到的困难及解决措施? 「京东」 20. 【跨角色协作】怎么和工程方向的同事合作? 「百度」 21. 【跨角色协同与沟通】作为校招新人,如何高效开展跨角色协同工作(如对接工程、测试、业务、硬件团队)?在跨部门沟通中,如何确保信息准确传递? 「京东、蚂蚁集团」 **L3 实现与应用** 1. 【入职适应计划沟通】情景模拟:你刚加入京东自动驾驶算法工程师团队,需要快速熟悉团队技术栈、核心研发项目、业务场景需求及近期重点任务,你需要向导师汇报你的适应计划与学习安排,你会如何组织沟通内容? 「京东」 2. 【团队项目角色与贡献】请描述一次你带领团队或参与团队项目解决复杂技术问题的经历,你在其中扮演了什么角色? 「蚂蚁集团」 3. 【平衡短期与长期、个人与团队】你在过往的学习和科研/实习中,如何平衡“短期项目任务完成”与“长期技术能力提升”的关系?如何平衡“个人工作节奏”与“团队协作要求及项目进度压力”的关系?请结合具体案例说明你的做法与思考? 「京东」 4. 【技术债处理】如果你发现团队的技术栈存在严重技术债,你会如何处理? 「京东」 5. 【技术领导的人才需求】假如你作为一个技术领导,那你在团队发展过程中,你觉得需要什么样的人才来配合你? 「京东」 6. 【指导新同事技术入门】情景模拟:新加入实习团队的校招同事对自动驾驶算法研发流程、深度学习框架使用、数据处理方法不熟悉,向你请教相关问题,你需要结合自身经验为他详细解释并指导使用方法,你会如何沟通? 「京东」 7. 【指导校招同事成长】情景模拟:同为京东自动驾驶算法工程师的校招同事向你请教如何提升算法设计能力、如何快速理解业务场景需求及校招初期的职业成长建议,你会如何结合自身理解与经验为他提供指导? 「京东」 8. 【推动技术创新】在你看来,如何推动团队的技术创新? 「字节跳动」 9. 【推动技术升级】请分享一个你在团队中推动技术升级的经历。 「京东」 10. 【推动项目进展】请举例说明你在团队协作时如何推动项目进展? 「蚂蚁集团」 11. 【有效沟通解决协作问题】请分享一次你通过有效沟通解决复杂协作问题的经历(如与团队成员对齐算法设计方案、向导师/领导汇报项目进展、向工程团队讲解算法逻辑、向测试团队反馈技术要点),你运用了哪些沟通技巧?最终成效如何? 「京东」 12. 【算法方案分歧推动共识】当团队成员对某一算法方案(如模型选型、参数设置、算法优化方向、工程化落地路径)存在分歧时,你会如何基于技术可行性与业务需求推动达成共识?请结合过往团队协作案例说明你在其中的作用? 「京东」 13. 【解决团队冲突】请分享一个你在团队协作中解决冲突的经历? 「字节跳动」 14. 【说服上级采用技术路线】工作中如何说服上级采用自己的技术路线? 「蚂蚁集团」 15. 【说服他人经历】请分享一次你成功说服他人的经历。 「蚂蚁集团」 16. 【跨团队分歧解决】项目中如果和算法、测试团队有分歧,你会怎么解决? 「百度」 17. 【跨团队合作挑战】请描述一个你在跨团队合作中遇到的挑战,以及你是如何解决的? 「京东」 18. 【跨团队方案分歧沟通】在跨团队合作中,工程团队认为你的算法方案过于复杂,难以在现有系统上实现和维护,希望采用一个更简单但效果稍差的方法。你将如何沟通与推进? 「蚂蚁集团」 19. 【针对不同对象的沟通调整】在工作中,你需要向不同类型的对象(如向领导汇报算法研发规划、向团队成员同步技术难点、向工程同学讲解算法实现逻辑、向测试同学说明验证重点)进行沟通,你会如何调整沟通方式以适配不同对象的需求?请举例说明。 「京东」 **L4 优化与诊断** 1. 【多任务统筹与优先级管理】请分享一次你在学习、科研项目或实习中统筹多个自动驾驶算法相关任务(如同时推进模型训练与数据处理、兼顾算法设计与测试验证、配合团队完成项目攻坚、参与场景适配优化)的经历,你是如何合理安排时间、划分任务优先级、确保各项任务顺利完成的? 「京东」 2. 【技术选型分歧沟通】当团队成员对分布式存储选型(如JuiceFS vs Alluxio vs Lustre)意见不一致时如何沟通并说服举例? 「腾讯混元」 3. 【竞赛团队分歧协调】情景模拟:学校组织自动驾驶算法竞赛,你作为小组负责人需要带领团队完成一款自动驾驶车辆的核心算法设计,小组内成员对算法选型、模型设计、分工安排存在分歧,部分成员积极性不高,你需要组织小组讨论推进项目,你会如何沟通协调? 「京东」 4. 【算法方案争议沟通】情景模拟:团队讨论某干线自动驾驶决策规划算法方案时,你倾向于采用模型预测控制(MPC)提升路径跟踪精度,另一位同事倾向于采用PID控制降低工程实现难度,双方争议较大,你需要在团队会议上阐述自己的观点及理由,你会如何沟通? 「京东」 5. 【跨团队协作解决技术问题】请分享一个你通过跨团队协作解决复杂技术问题的经历。 「京东」 6. 【跨团队指标对齐沟通】情景模拟:你在算法测试中发现,业务团队提出的某算法性能指标要求与实际技术可行性存在偏差,若按此推进可能导致项目延期,需要进一步沟通确认并优化指标要求,你会如何与业务团队负责人对接沟通? 「京东」 7. 【面对专家质疑的沟通】在项目评审中,有资深专家强烈质疑你采用的某项后训练技术路线,认为其理论依据不足,而你基于实验数据坚信其有效性。你该如何进行沟通和推进? 「蚂蚁集团」 **L5 综合与前沿** 1. 【团队管理与技术路线权衡】怎么管理AI Infra团队成员及技术路线规划,如何权衡自研调度器与开源方案的债务? 「腾讯混元」 ## 压力冲突与领导力 **L2 原理理解** 1. 【团队文化适应】会不会很toxic? 「阿里通义」 2. 【对待基础性工作】你在日常实习期间有遇到过难以接受的工作吗(dirty work)? 「腾讯」 3. 【职业方向与自我认知】我不做infra了,那又怎么样呢,我的人生难道就完蛋了吗,我只是不擅长infra,但我知道我有很多擅长的领域,它们会带着我前行的。 「腾讯」 4. 【面试反馈与改进】我面试有什么要调整? 「腾讯」 **L3 实现与应用** 1. 【多任务优先级管理】你如何平衡多个项目的时间分配?请说明你评估工作优先级的方法,特别是在团队同时有多个高优先级的研究项目需要你参与、时间资源紧张的情况下,你将如何评估和分配自己的精力,确保整体产出最大化? 「蚂蚁集团」 2. 【应对方案被否定】如果在一次重要汇报中,你的技术方案被资深同事当场否定,你会怎么办? 「字节跳动」 3. 【应对质疑与自信表达】为什么你比面试官懂的多? 「百度」 4. 【持续努力实现目标】请分享一次你为实现某个自动驾驶算法相关目标(如完成核心算法研发项目、掌握关键算法技能、在算法竞赛中获奖、解决技术研发关键难点)而持续努力的经历,你是如何坚持下来的?最终结果如何? 「京东」 5. 【持续改进解决重复问题】请分享一个你通过持续改进过程来解决重复出现的问题的例子,具体情况是怎么样的?怎么解决的? 「美团」 6. 【挫折应对与成长反思】请分享一次你在学习、科研或实习中遇到的最大挫折(如算法项目失败、技术方案多次不通过、团队协作矛盾、核心技术难点突破不了等),你是如何克服的?这次经历让你有哪些成长与收获?另外,这种事会让你很挫败吗? 「京东、字节跳动、百度、蚂蚁集团、阿里巴巴」 7. 【时间紧与质量权衡】在时间紧张的情况下,你如何保证工作质量?特别是当项目时间很紧,但模型还需要进一步调优时,你会怎么做? 「蚂蚁集团」 8. 【进度落后应对】如果在团队中你的工作进度落后于计划,你会如何处理? 「字节跳动」 9. 【项目瓶颈与心态调整】在ieg实习的过程中,有遇到项目进展不太理想或者是遇到瓶颈的情况吗,当时是怎么调整心态的? 「腾讯」 10. 【预期不达标应对】预期不达标,你会怎么做? 「百度」 11. 【高压快速解决问题】请分享一个你在高压下快速解决问题的经历。 「京东」 12. 【高压环境自我管理】在快节奏、高压力、高强度、高密度的研究或研发环境中,你如何保持高效产出和心态平衡,并调整自己的状态? 「蚂蚁集团」 **L4 优化与诊断** 1. 【多任务优先级管理】压力测试: 你同时对接四项紧急任务,一是完成某自动驾驶感知算法的性能优化报告,二是处理一批实车测试数据并完成异常分析,三是协助撰写算法研发技术文档,四是准备项目技术评审会议的材料,且四项任务都要求今天内完成关键节点,你会如何协调推进? 「京东」 2. 【新领域快速调研】压力测试:导师交给你一个全新的任务,要求你在1周内完成对大模型在自动驾驶决策规划中应用的调研与分析,输出详细的调研简报,而你此前对大模型与自动驾驶融合了解较少,你会如何回应和开展工作? 「京东」 3. 【紧急Bug处理】如果在项目deadline临近时发现重大bug,你会怎么做? 「蚂蚁集团」 4. 【紧急性能优化】压力测试: 你负责协助的某自动驾驶感知算法在实车测试中发现,复杂天气(如雨天、雾天)场景下目标检测精度严重下降,距离下一轮测试仅剩3天,导师要求你紧急优化算法并完成验证,你会如何紧急应对? 「京东」 5. 【紧急项目推进】压力测试: 京东计划在3个月后完成某仓储自动驾驶车辆的感知算法迭代优化,你负责协助完成核心模型的训练与优化,而当前数据采集尚未完成,导师要求你在2周内完成数据预处理、模型初步训练并输出性能评估报告,你会如何紧急推进? 「京东」 6. 【能力提升与进度追赶】你在实习期间,因对自动驾驶业务场景理解不足、算法工程化经验欠缺,提交的算法优化方案多次未通过审核,被导师提醒需要加强专业能力和严谨性,同时项目进度也受到影响,你会如何制定应对策略,提升能力并赶上研发进度? 「京东」 7. 【跨团队协作分歧】压力测试: 你与工程开发团队对接某算法的工程化落地工作时,因双方对算法部署逻辑理解偏差,导致开发进度滞后,距离项目里程碑仅剩2周,导师要求你牵头对接解决协作分歧,确保按时推进,你会如何紧急协调? 「京东」 8. 【需求变更应对】当项目需求频繁变更时,你如何应对?变体1:你正在负责一个核心算法的研发,项目中期,业务方因市场变化突然提出重大需求变更,这可能导致算法架构重构和延期。作为负责人,你会如何应对?变体2:如果项目deadline很紧,但需求还在变动,你会怎么做? 「蚂蚁集团、阿里巴巴」 9. 【高压场景应对】当你面临算法性能不达标、项目进度紧急、复杂技术难题无法突破、跨团队协作受阻等高压场景时,你会如何进行压力调节与工作推进?请结合自身经历举例说明? 「京东」 10. 【高风险需求沟通】当业务提出一个紧急的风控需求,但你觉得现有方案风险很高,你会怎么沟通? 「蚂蚁集团」 **L5 综合与前沿** 1. 【紧急问题处理】压力测试: 你参与的自动驾驶算法研发项目在上线前1天,测试团队反馈仍有多个未解决的性能问题,且部分问题影响系统安全性,项目负责人要求你协助协调相关资源,确保按时上线,你会如何紧急处理? 「京东」 ## 到岗与实习安排 **L3 实现与应用** 1. 【到岗与实习安排】综合到岗与实习安排问题:1. 为什么做完项目/实习后离职?2. 毕业时间?3. 何时能到岗?能实习多久?base地偏好(北京/深圳/总部)?是否接受提前实习?实习时长、到岗时间、入职时间?4. 学校工作如何处理?导师是否同意?毕业要求(小论文、大论文)是否达成?能否快速到岗?是否需往返学校?5. 何时签三方?6. 能接受的加班强度?能否适应快节奏(如百度Apollo)?7. 入职后希望多久上手?8. 香港上学在深圳实习是否可行?9. 周末工作频率?正常下班时间?10. 团队方向?实习生工作内容?是否有其他实习生?tech report是否挂名?实习生权限?转正预期?后续流程?是否接受轮岗(如物流一线)?11. 实习薪资、餐补、加班费、房补? 「京东、字节跳动、拼多多、百度、百度文心、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 ## Offer与薪资 **L1 基础认知** 1. 【Offer与薪资综合】1. 你的薪资期望是多少?为什么会有这个期望?2. 你目前有哪些offer?是否还在看其他工作机会或正在面试其他公司?3. 如何看待美团、蚂蚁、腾讯、字节等公司的offer?如果同时收到这些offer,你会怎么选?请说明你的意向排序,并解释如何比较和选择这些公司。4. 已有的offer情况?对级别和薪资有什么想法?5. 请问是否愿意接受此offer?6. 面试结果大概多久反馈? 「京东、字节跳动、拼多多、百度、美团、腾讯、腾讯混元、蚂蚁集团、阿里巴巴」 **L3 实现与应用** 1. 【Offer与薪资】你目前有哪些offer?对这些offer如何排序?你是怎么考虑去哪里的?你的意向是什么?什么时候能入职? 「京东、百度、腾讯」 ## 地点家庭与个人情况 **L1 基础认知** 1. 【实习与学业情况】聊了一下之前实习时长为啥不长,以及学业/实习等问题。 「腾讯」 2. 【工作地点与家庭情况】1. 上课是在香港还是在深圳?我未来会在哪里办公? 2. 你家住哪?父母工作情况?爸妈同意你来上海吗? 3. 你的base地点意向是哪里?请说明个人目前所在地,以及是否接受北京、上海、杭州等城市?如果只能选一个,选哪里?另外,你能否接受京东的地点(离市区较远,需租房)?同时,请告知你意向的岗位。 「京东、字节跳动、拼多多、百度、美团、腾讯、蚂蚁集团、阿里巴巴、阿里通义」 ## 其他HR **L1 基础认知** 1. 【AI工具使用】平常用不用AI?用哪些AI工具?平时写代码、数据分析怎么用Claude?用过AI写代码吗,CodingAgent呢? 「美团、蚂蚁集团」 2. 【任务管理】有没有做过to do list? 「字节跳动」 3. 【博客与技术学习】你写个人博客的目的是什么?用什么写博客?学习技术的来源是什么?后面怎么写的频率越来越低了? 「京东、美团」 4. 【反问环节】你有什么想问的吗? 「京东、百度、腾讯」 5. 【团队介绍】聊人生介绍团队规模,上海整体更年轻,氛围也更好一些,工作时间 1095,年假入职10天介绍业务方向 「百度」 6. 【学习方法】进入一个新领域/新技术方向,你一般怎么学习、快速上手? 「蚂蚁集团」 7. 【学历确认】Q:是在上研吧 「百度」 8. 【工作生活平衡】你如何看待工作与生活的平衡? 「字节跳动、蚂蚁集团」 9. 【成就感来源】在你过往的工作中,什么样的事情最能让你产生成就感? 「字节跳动」 10. 【招聘标准】不希望招到什么样的人? 「字节跳动」 11. 【时间管理】怎么平衡课业和实习? 「字节跳动」 12. 【消费习惯】一天花多少钱、什么订阅? 「美团」 13. 【游戏经历】你的游戏经历是什么?具体包括:是否玩游戏?玩什么游戏(如LOL、王者荣耀等)?王者荣耀玩什么分路、什么英雄、什么段位?LOL什么段位? 「腾讯、腾讯混元」 14. 【科研经历来源】你是怎么找到这么多课外科研经历的? 「百度」 15. 【绩点询问】本科和研究生期间的绩点。 「百度」 16. 【编程语言背景】本科有没有学过C++? 「腾讯」 17. 【职级询问】你现在什么职级? 「腾讯」 18. 【诚信问题】手写了谁还在乎算法这首先是个诚信问题,不诚信的人你招进来敢用吗? 「字节跳动」 19. 【问题处理】迟到事件如何处理? 「字节跳动」 20. 【面试反馈】觉得前面几轮面试怎么样? 「字节跳动」 21. 【面试技巧】面试过程中要将为什么,而不是怎么做,尽量在面试中展示自己的理解与思考? 「字节Seed」 22. 【面试考察意义】有没有可能现在就没必要考察所谓的算法了,这是考察服从性吗? 「字节跳动」 23. 【面试表现】你是不是准备了一份讲稿?我感觉你是在读什么东西。 「百度」 24. 【面试评价】请您对本次面试进行评价 「百度」