Appearance
推理框架面经
按公司和面试轮次整理推理框架、推理服务与部署相关问题。只保留真实面经中的题目。
美团:大模型推理引擎研发工程师
- Attention 的逻辑是什么?
- FlashAttention 做了什么?
- 手撕 MHA。
蚂蚁:大模型系统工程 / 基础平台 C++
- 量化是什么?
- DeepSeek FP8 与 Qwen BF16 怎么比较?
- TRT-LLM 和 vLLM 区别?
- Continuous batching?
- Prefix Caching?
- PagedAttention?
- GPU 内存管理怎么设计?
- vLLM 和 SGLang 怎么比较?
- 如何自顶向下优化 AI 对话平台?
快手:容器云 AI Infra
- 推理部署流量怎么调度?
- Prefix KV Cache?
- KV Cache 如何压缩?
- TRT-LLM 优化效果如何量化?
- 流量调度指标对冲怎么办?
淘天:深度学习引擎
- 端侧大模型算子怎么优化?
- 多 shape 怎么 dispatch?
- 如何做算子数值回归?
百度:大模型推理研发 / 昆仑芯
- Attention 怎么实现?
- 推理框架如何做 fallback?
猿辅导:大模型推理引擎实习生
- 大模型推理与 vLLM。
- 模型量化。
说明
训练流程、分布式训练和框架后端适配问题归入“训练框架”章节;CUDA kernel 与底层性能问题归入“高性能算子”章节。