字节一面
1h
1. 为什么要用dpo,什么任务要用dpo,不用可以吗,用了好处在哪,能优化哪里
2. dpo ppo异同,dpo详细原理,loss
3. 任务为什么不能只用sft
4. 现在的推理模型是怎么训出来的,重点你感觉是哪里,哪里是让这些模型获得推理能力的点
5. r1原理
6. prm 和orm讲一讲,什么情况prm 什么情况orm,哪种更好,重点讲prm的优缺点,为什么现在的推理模型没有用prm
手撕。一个字符串列表,一个长字符串,判断长字符串是否能用这个字符串列表里的词组成。
没做出来,寄寄寄


1. 为什么要用dpo,什么任务要用dpo,不用可以吗,用了好处在哪,能优化哪里
2. dpo ppo异同,dpo详细原理,loss
3. 任务为什么不能只用sft
4. 现在的推理模型是怎么训出来的,重点你感觉是哪里,哪里是让这些模型获得推理能力的点
5. r1原理
6. prm 和orm讲一讲,什么情况prm 什么情况orm,哪种更好,重点讲prm的优缺点,为什么现在的推理模型没有用prm
手撕。一个字符串列表,一个长字符串,判断长字符串是否能用这个字符串列表里的词组成。
没做出来,寄寄寄
全部评论

第六点讲不明白,感觉面试官不是很认可我的回答
,手撕也没做出来,很寄的感觉
相关推荐
点赞 评论 收藏
分享
点赞 评论 收藏
分享
点赞 评论 收藏
分享