Skip to content

推理框架面经

按公司和面试轮次整理推理框架、推理服务与部署相关问题。只保留真实面经中的题目。

美团:大模型推理引擎研发工程师

  • Attention 的逻辑是什么?
  • FlashAttention 做了什么?
  • 手撕 MHA。

蚂蚁:大模型系统工程 / 基础平台 C++

  • 量化是什么?
  • DeepSeek FP8 与 Qwen BF16 怎么比较?
  • TRT-LLM 和 vLLM 区别?
  • Continuous batching?
  • Prefix Caching?
  • PagedAttention?
  • GPU 内存管理怎么设计?
  • vLLM 和 SGLang 怎么比较?
  • 如何自顶向下优化 AI 对话平台?

快手:容器云 AI Infra

  • 推理部署流量怎么调度?
  • Prefix KV Cache?
  • KV Cache 如何压缩?
  • TRT-LLM 优化效果如何量化?
  • 流量调度指标对冲怎么办?

淘天:深度学习引擎

  • 端侧大模型算子怎么优化?
  • 多 shape 怎么 dispatch?
  • 如何做算子数值回归?

百度:大模型推理研发 / 昆仑芯

  • Attention 怎么实现?
  • 推理框架如何做 fallback?

猿辅导:大模型推理引擎实习生

  • 大模型推理与 vLLM。
  • 模型量化。

说明

训练流程、分布式训练和框架后端适配问题归入“训练框架”章节;CUDA kernel 与底层性能问题归入“高性能算子”章节。

学习、验证、修订,持续构建 AI Infra 知识地图。