字节大模型

和各位佬讨论一下,lora的AB两个矩阵一个全零初始化,一个是高斯随机初始化,这俩初始化方法到底能不能互换?
我看网上有人说互换了训练会变慢或者停滞,有人说不会,这俩矩阵是对称的
#一人一道大厂面试题##我的秋招日记##字节#
全部评论
trick 可以全高斯随机初始化,只需让W_0 = (W-A_0*B*0)
点赞 回复 分享
发布于 2025-09-13 21:04 广东
我记得原文上说A高斯B零初始的效果最好,互换也可以训练倒是
点赞 回复 分享
发布于 2025-09-05 18:08 北京
不能
点赞 回复 分享
发布于 2025-09-05 00:31 北京

相关推荐

01-05 09:14
同济大学 Java
心碎一号线:我要是9✌🏻我就选保研,保研了大四再找实习,实习之后,如果觉得自己不适合互联网工作模式,还能有其他选择,如果实习后决定了走互联网,也能提升学历提高竞争力
点赞 评论 收藏
分享
评论
点赞
1
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务