Skip to content

高性能算子 / CUDA 大厂面经(2023–2026,问题汇总)

仅保留问题;出处、文章时间和实际面试时间保留。

1. 美团:大模型推理引擎研发工程师(10 题)

  1. Attention 怎么算?
  2. FlashAttention 为什么快?
  3. CUDA 架构怎么讲?
  4. GMEM 和 SMEM 的差别?
  5. 如何优化算子?
  6. 怎么验证性能提升?
  7. 怎么排除换显卡/换精度造成的伪提升?
  8. 如何判断 memory-bound 还是 compute-bound?
  9. 手撕 MHA。
  10. online softmax 如何稳定?

2. 蚂蚁:大模型系统工程 / 基础平台 C++(10 题)

  1. 量化算法怎么做?
  2. FP8 和 BF16 怎么选?
  3. TRT-LLM 和 vLLM 区别?
  4. Continuous batching 是什么?
  5. Prefix caching 怎么做?
  6. PagedAttention 解决什么问题?
  7. GPU 内存管理怎么设计?
  8. 矩阵乘怎么加速?
  9. vLLM 与 SGLang 怎么比较?
  10. 量化 kernel 怎么验证快且准?

3. 阿里国际:大模型平台研发(15 题)

  1. Memory coalescing 是什么?
  2. Bank conflict 是什么?
  3. CPU Cache 和 GPU Cache 为什么不同?
  4. 统一内存寻址是什么?
  5. 非对称量化有什么影响?
  6. Tensor Core 有哪些使用方式?
  7. WMMA 和 MMA 区别?
  8. FP32 转 BF16 有什么优势?
  9. 推理引擎瓶颈在哪里?
  10. 多卡 GEMM 哪些数据跨 GPU?
  11. NVLink 带宽怎么回答?
  12. CUDA 手撕二维 Softmax。
  13. 如何解决 Memory Bound?
  14. GPU 参数在软件层怎么传?
  15. Softmax 如何处理非整倍数列?

4. 快手:容器云 AI Infra(9 题)

  1. GPU 体系结构怎么理解?
  2. CUDA Core 和 Tensor Core 怎么选?
  3. TRT-LLM 优化效果如何量化?
  4. CUTLASS 优化思路?
  5. 针对特定 GPU 优化是否值得?
  6. Prefix KV Cache 如何压缩?
  7. 流量调度指标冲突怎么办?
  8. CUTLASS tile 太大有什么问题?
  9. 如何判断 Tensor Core 没吃满?

5. 淘天:深度学习引擎(5 题)

  1. 深挖一个算子加速项目。
  2. CUDA 相关问题怎么回答?
  3. 端侧大模型算子怎么优化?
  4. 算子融合什么时候变慢?
  5. 多 shape 怎么 dispatch?

6. 百度:大模型推理研发/昆仑芯(5 题)

  1. CUDA 手撕 All-Reduce。
  2. 矩阵乘基本思路?
  3. Attention 怎么实现?
  4. 昆仑芯适配算子要做什么?
  5. Ring 和 Tree All-Reduce 怎么选?

7. 猿辅导:大模型推理引擎(6 题)

  1. 手撕 reduce_sum
  2. 手撕 conv2d
  3. 讲一个写过的 kernel。
  4. CUDA 优化整体经历?
  5. Reduce 什么时候可以用 atomicAdd
  6. Conv2D 如何校验边界和精度?

学习、验证、修订,持续构建 AI Infra 知识地图。