Appearance
高性能算子 / CUDA 大厂面经(2023–2026,问题汇总)
仅保留问题;出处、文章时间和实际面试时间保留。
1. 美团:大模型推理引擎研发工程师(10 题)
- 出处:2025 春招实习面经汇总(牛客)
- 文章发布时间:2025-04-17 14:17。
- 实际面试时间:一面 2025-03-20;二面 2025-03-25。
- Attention 怎么算?
- FlashAttention 为什么快?
- CUDA 架构怎么讲?
- GMEM 和 SMEM 的差别?
- 如何优化算子?
- 怎么验证性能提升?
- 怎么排除换显卡/换精度造成的伪提升?
- 如何判断 memory-bound 还是 compute-bound?
- 手撕 MHA。
- online softmax 如何稳定?
2. 蚂蚁:大模型系统工程 / 基础平台 C++(10 题)
- 出处:2025 春招实习面经汇总(牛客)
- 文章发布时间:2025-04-17 14:17。
- 实际面试时间:2025-03-14、03-17、04-09、04-14。
- 量化算法怎么做?
- FP8 和 BF16 怎么选?
- TRT-LLM 和 vLLM 区别?
- Continuous batching 是什么?
- Prefix caching 怎么做?
- PagedAttention 解决什么问题?
- GPU 内存管理怎么设计?
- 矩阵乘怎么加速?
- vLLM 与 SGLang 怎么比较?
- 量化 kernel 怎么验证快且准?
3. 阿里国际:大模型平台研发(15 题)
- 出处:2025 春招实习面经汇总(牛客)
- 文章发布时间:2025-04-17 14:17。
- 实际面试时间:一面 2025-04-11;二面 2025-04-16。
- Memory coalescing 是什么?
- Bank conflict 是什么?
- CPU Cache 和 GPU Cache 为什么不同?
- 统一内存寻址是什么?
- 非对称量化有什么影响?
- Tensor Core 有哪些使用方式?
- WMMA 和 MMA 区别?
- FP32 转 BF16 有什么优势?
- 推理引擎瓶颈在哪里?
- 多卡 GEMM 哪些数据跨 GPU?
- NVLink 带宽怎么回答?
- CUDA 手撕二维 Softmax。
- 如何解决 Memory Bound?
- GPU 参数在软件层怎么传?
- Softmax 如何处理非整倍数列?
4. 快手:容器云 AI Infra(9 题)
- 出处:2025 春招实习面经汇总(牛客)
- 文章发布时间:2025-04-17 14:17。
- 实际面试时间:一面 2025-02-24;二面 2025-02-28。
- GPU 体系结构怎么理解?
- CUDA Core 和 Tensor Core 怎么选?
- TRT-LLM 优化效果如何量化?
- CUTLASS 优化思路?
- 针对特定 GPU 优化是否值得?
- Prefix KV Cache 如何压缩?
- 流量调度指标冲突怎么办?
- CUTLASS tile 太大有什么问题?
- 如何判断 Tensor Core 没吃满?
5. 淘天:深度学习引擎(5 题)
- 出处:2025 春招实习面经汇总(牛客)
- 文章发布时间:2025-04-17 14:17。
- 实际面试时间:一面 2025-03-28。
- 深挖一个算子加速项目。
- CUDA 相关问题怎么回答?
- 端侧大模型算子怎么优化?
- 算子融合什么时候变慢?
- 多 shape 怎么 dispatch?
6. 百度:大模型推理研发/昆仑芯(5 题)
- 出处:2025 春招实习面经汇总(牛客)
- 文章发布时间:2025-04-17 14:17。
- 实际面试时间:一面 2025-03-27;二面 2025-03-31。
- CUDA 手撕 All-Reduce。
- 矩阵乘基本思路?
- Attention 怎么实现?
- 昆仑芯适配算子要做什么?
- Ring 和 Tree All-Reduce 怎么选?
7. 猿辅导:大模型推理引擎(6 题)
- 出处:猿辅导大模型推理引擎开发实习生一二面(牛客)
- 文章发布时间:2025-03-13 22:21。
- 实际面试时间:原资料未披露。
- 手撕
reduce_sum。 - 手撕
conv2d。 - 讲一个写过的 kernel。
- CUDA 优化整体经历?
- Reduce 什么时候可以用
atomicAdd? - Conv2D 如何校验边界和精度?