字节大模型实习算法岗面经

1.介绍一下 DPO , PPO , GRPO 
2.介绍一下奖励函数的坍缩现象和问题
3.离线强化学习和在线强化学习了解么?你的项目里是哪种?
4.代码:onehot100的2d接雨水
5. GRPO 公式?为什么公式里面 clip 了外面还要计算一次 mean 呢?
6.讲讲qwen2.5vl, llama 
7.多目标优化奖励函数冲突,
8.介绍一下 QKV 的计算?
9.手撕MHA
📳对于想求职算法岗的同学,如果想参加高质量项目辅导,提升面试能力,欢迎后台联系。

全部评论

相关推荐

02-16 01:39
南昌大学 Java
坚持无悔意无休:xhs上集美最爱说谎博人眼球
点赞 评论 收藏
分享
评论
1
收藏
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务