网易AI infra校招二面 1h
发发面经攒点人品,祝大家都能拿到满意的Offer!
1. 项目深挖
2. 算力决定因素(时钟频率/SM数/计算单元数/精度格式)
3. FP8格式差异(E4M3高精度窄范围 vs E5M2宽动态范围)
4. 矩阵乘算术强度:M×K×N 次乘加,访存 MK+KN+MN
5. 场景题;通信与计算优化:
uint数组通信压缩:uint32→uint16
6. 场景题:流水线重叠,计算总时间
7. 场景题:合并访存实践:32×32矩阵求和 → 按行访问(连续)优于按列(非连续)
8. 有哪些评估模型效果的指标:
延迟(TTFT/TPT)、吞吐量、GPU/内存利用率、失败率
9. Decoder-only架构
10. CUDA Core vs Tensor Core适用场景
11. 手撕:行TOP1 CUDA实现(shared memory归约 + 多行优化)
12. 给出一段代码找优化方法
1. 项目深挖
2. 算力决定因素(时钟频率/SM数/计算单元数/精度格式)
3. FP8格式差异(E4M3高精度窄范围 vs E5M2宽动态范围)
4. 矩阵乘算术强度:M×K×N 次乘加,访存 MK+KN+MN
5. 场景题;通信与计算优化:
uint数组通信压缩:uint32→uint16
6. 场景题:流水线重叠,计算总时间
7. 场景题:合并访存实践:32×32矩阵求和 → 按行访问(连续)优于按列(非连续)
8. 有哪些评估模型效果的指标:
延迟(TTFT/TPT)、吞吐量、GPU/内存利用率、失败率
9. Decoder-only架构
10. CUDA Core vs Tensor Core适用场景
11. 手撕:行TOP1 CUDA实现(shared memory归约 + 多行优化)
12. 给出一段代码找优化方法
全部评论
相关推荐
查看9道真题和解析