字节大模型面经合集(二)

1. 大模型相关经历深挖:你项目里最核心的贡献是什么,怎么验证有效
2. 对比学习 loss:负样本和正样本拉不开/太像了,你会怎么改损失或采样
3. FlashAttention 跟普通 attention 的差异?实现里 QK^T、softmax、PV 这几步怎么落
4. 3D 并行里 DP/DDP 你怎么理解;实际落地时通信瓶颈一般卡在哪些环节
5. 14B:FP16 权重大概多大;训练还要加哪些;INT8 大概能省多少
6. torch.contiguous() 干嘛的?推理为什么在意连续性
7. 代码:读 txt 井字棋(3×3),判断当前玩家是否获胜
8. 交叉熵损失:解释/怎么写
9. 线性回归用 SGD:更新公式怎么推/怎么写

⭕如果你现在:
- 春招/秋招没方向
- 简历没人看
- 面试总挂
- 不知道怎么准备
📳对于想求职算法岗的同学,如果想参加高质量项目辅导,提升面试能力,欢迎后台联系。
全部评论

相关推荐

发一下问题给大家参考,攒人品中。。。1.实习中多智能体系统包含几个智能体?它们之间如何交互?2.实习中意图识别模型需要识别多少个意图?3.750B模型用于什么场景?4.实习中Qwen3VL模型是多少B的?用于什么场景?5.在实习中,你主要的贡献是什么?6.检索环节做了哪些优化?7.答案生成环节做了哪些优化?8.是否做了SFT或强化学习相关工作?在哪个环节做的?9.SFT过程中是否对类别标签做了清洗或修正?10.强化学习的样本量是多少?11.基础模型经常分类分不准的案例有哪些?12.在校项目中,为什么用对话数据来增强数据集?13.在校项目任务的输出可以简单描述并举例吗?14.单智能体能否完成相在校项目关工作?为什么要智能体?15.LangGraph相对其他开源智能体编排工具的优点是什么?16.在现有场景中是否需要用到LangGraph的状态管理功能?17.如何理解Long-termMemory的实现方式?18.若将电商场景中用户的购买、点击、兴趣等信息设计为长期记忆,有什么想法?19.Context Window能否储存大量电商交互信息?如何解决存储问题?20.推理时若将大量Memory以Token形式给到大模型,Token长度过长该如何处理?21.强化学习有哪些常用技巧?22.若通过SFT进一步提升模型准确率,常用的手段有哪些?23.SFT的理想数据量是多少?如何确定?24.SFT数据分布一般怎么取?为什么选择该分布而非其他分布?
查看24道真题和解析
点赞 评论 收藏
分享
评论
2
2
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务