蚂蚁大模型应用 一面

1. PPO的原理?从维护的四个model讲,再详细讲一下训练流程和损失函数各个参数含义?
2. 为什么有了reward model还需要critic model?critic model作用是什么?
3. 交叉熵和kl散度的联系和区别?PPO的kl散度可以改成交叉熵吗?分类任务可以用KL散度吗?
4. GRPO的kl散度和PPO的kl散度区别?K1 K2 K3估计区别?
5. rollout数量 batchsize数量和计算资源(卡的数量)有什么关系?线性?非线性?
6. 真实采样数量一定等于rollout数量吗?
7. 提到了拒绝采样,详细讲一下
8. vLLM框架是怎么做推理加速的?
全部评论
同学,瞅瞅我司,医疗独角兽,我的主页最新动态,绿灯直达,免笔试~
1 回复 分享
发布于 昨天 08:42 广东
佬bg啥样论文实习都有吗
点赞 回复 分享
发布于 今天 12:33 河北

相关推荐

10-10 01:10
已编辑
深圳大学 测试开发
牛客26692713...:项目经历写那么多没啥用吧,挑两个最好的,其实浓缩成一页会比较好吧,背景、实习、项目,要是还有空间就再加个专业技能
投了多少份简历才上岸
点赞 评论 收藏
分享
评论
点赞
收藏
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务