算法工程师精选面经合集
11家公司
44篇面经
最新 热门
阿里通义大模型算法二面已凉凉
1.实习介绍2. Lora 原理(核心是低秩分解:将原始权重更新近似为两个低秩矩阵乘积,减少参数量,保留主导方向,训练高效)3.了解 DeepSpeed 吗,ZeRO -1, ZeRO -2和 ZeRO3分别做了哪些优化(1优化优化器状态,2优化梯度,3切分参数,全面节省显存)4. Qwen的模型结构是怎么样的,相比于 LLaMA,DeepSeek 有什么区别(Qwen采用GQA+SwiGLU+RMSNorm,和LLaMA架构非常相似,差异在训练数据和tokenizer中文支持更好;DeepSeek只用MoE/MLA架构,Qwen系列主要是Dense模型)5.怎么缓解大模型的幻觉问题(RAG,RLHF对齐,事实监督)6.大模型的 MoE 结构相比于 Dense 结构训练的难点在什么地方,DeepSeekMoE为什么效果好,有什么值得我们借鉴创新点(MoE面临负载不均衡、训练不稳定问题;DeepSeekMoE通过细粒度专家和共享专家设计提升稳定性和效果)7.知道FP16和BF16有什么区别吗,包括FP32和INT8这些,在训练大模型的时候,应该怎么选择(FP16精度高但易溢出,BF16动态范围大;训练常用BF16混合精度,推理用INT8量化加速)8.讲-下 RLHF 的流程,写-下 PPO和 DPO的 Loss表达式(训练奖励模型后用PPO/DPO优化策略:PPO Loss: policy ratio + KL 约束/ DPO Loss: logit preference diff + sigmoid binary loss)9.对于超长上下文业界一般是怎么做的,你知道 Qwen是怎么做的吗(业界常用ROPE 变体/滑动窗口注意力/稀疏注意力等:Qwen使用YaRN和窗口注意力扩展上下文)10.开放题:你觉得目前大模型的上限在哪里(推理能力、长期记忆、具身交互和能耗效率,需要架构创新和多模态融合突破)11.代码:152.乘积最大子数组
查看9道真题和解析
点赞 评论 收藏
分享
/feed/main/detail/adf50b424ec4427ea66398a1d42eef3c/feed/main/detail/306288f82dc94a189fb962646c692119/feed/main/detail/5ea9080b3fa1482eb65b7de0b635984d/feed/main/detail/8c5d1056e4b64cc8add33acb82f9eb3a/feed/main/detail/25fbce8df95d4e0c867938997985baa3/feed/main/detail/12d1b435c8534f998ab693dfd3b7cd2f/feed/main/detail/c84584bce9ee45a38e4516b9e64cdc91/feed/main/detail/9f6ce919df1343cfab1abc20a55c6a6c/feed/main/detail/84955801aef24377abb69e0cf6bcf3c1/feed/main/detail/c251f1e735254dc88d329cc939a0303c/feed/main/detail/c134fcb748ff4d638a705a99305a857e/feed/main/detail/a1564e819452400dad744ed84b2441f9/feed/main/detail/07c9592860de40e4875dd8038805b8f3/feed/main/detail/629d65e4ec344e63b14b4187b98129b1/feed/main/detail/223e83034b354240bf56e46e68b48253/feed/main/detail/8bbcd60842af4f0c9b068b3a0f9f5e4d/feed/main/detail/ec8f8b919edd482cbaee1579bbaaffe5/discuss/820342415994138624/feed/main/detail/d16db389577245118def1a2ea8ea1de2/feed/main/detail/4251282229ec4eb7b238cca35c3050b0
玩命加载中
写面经
发动态
发动态
发帖子
写文章

全站热榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务