字节大模型算法实习面经 面没招了...
发一下问题给大家参考,攒攒人品!
1.项目拷打
2.介绍一下奖励函数的坍缩现象和问题
3.离线强化学习和在线强化学习了解么?你的项目里是哪种?
4.代码:onehot100的2d接雨水
5. GRPO 公式?为什么公式里面 clip 了外面还要计算一次 mean 呢?
6.讲讲qwen2.5vl, llama
7.多目标优化奖励函数冲突,
8.介绍一下 QKV 的计算?
9.手撕MHA
1.项目拷打
2.介绍一下奖励函数的坍缩现象和问题
3.离线强化学习和在线强化学习了解么?你的项目里是哪种?
4.代码:onehot100的2d接雨水
5. GRPO 公式?为什么公式里面 clip 了外面还要计算一次 mean 呢?
6.讲讲qwen2.5vl, llama
7.多目标优化奖励函数冲突,
8.介绍一下 QKV 的计算?
9.手撕MHA
全部评论
大佬,可以看看pdd有机会的,hc很多呢https://www.nowcoder.com/share/jump/2360415344005235563
相关推荐

查看9道真题和解析