腾讯数据工程 一面面经

时间:3月3日
1.自我介绍
2.说一下熟练到不熟练的技术栈(编程语言和框架)
3.spark和hadoop MR两者的区别 ,spark相比hadoop的缺点
4.spark内存有500G,数据量有一个T,那spark能不能处理这个数据
5.讲讲宽窄依赖、stage怎么划分的
6.常用的转换算子和action算子有哪些,reducebykey是action算子吗,和groupbykey有什么区别
7.解决数据倾斜的方式 加前缀怎么加
8.spark的OOM都是什么原因导致的
9.spark的executor内存分成哪几部分 spark.memory.fraction=0.6是控制什么的 
10.聊聊广播变量 什么时候广播
11.两个sql题,比较简单
反问

更新 3.7二面挂 
回答的不好
1.hive的元数据管理
2.怎么保证数据一致性
3.怎么做数据治理
4.怎么把天调度任务做到小时

更新 3.10 被捞  晚点更新面经
#数据开发工程师面经# #腾讯#
全部评论
m
点赞 回复 分享
发布于 03-07 15:29 重庆
请问是哪个group的呀
点赞 回复 分享
发布于 03-08 23:37 香港

相关推荐

1.  简单介绍一下项目2.  在中间层建设中遇到过什么问题3.  数仓中状态的更新是比较及时的,如何记录这些状态,最核心是关心最终的状态还是流转的状态4.  拉链表是什么,怎么实现的,执行过程中怎么解决效率的问题5.  用的什么计算引擎,sql在spark上怎么执行的6.  spark的提交流程7.  uv和pv的含义,计算uv在spark上的运行原理8.  MapReduce的原理,快排的目的是什么,有序的目的是什么,知道每个过程才能知道如何去调优9.  sql转ast是怎么转的10. ast做逻辑执行计划优化做了哪些11. 逻辑执行计划和物理执行计划大概有什么区别12. 写sql过程中有没有遇到过执行时间特别长的,引出数据倾斜相关内容(问的很细,基本所有的都问了)13. 不同数据类型join为什么导致数据倾斜14. mapjoin和正常join的区别,mapjoin原理是什么,怎么实现的15. 加随机数打散,两阶段聚合怎么做的16. new一个线程怎么做,thread和runnable的区别是什么17. java集合类用过哪些(说没怎么用过java,就没再问了)18. sql在不同执行引擎下有什么区别,答有些语法不通用,为什么不通用,如何造成这种问题的19. sql中所有关键字的执行顺序20. a join b where条件写在join里面和join外面 有什么区别21. 4道sql22. 一道mid算法做的是计算引擎调优,一直在问spark底层,顶不住顶不住。当晚挂...
查看20道真题和解析
点赞 评论 收藏
分享
评论
1
9
分享

创作者周榜

更多
牛客网
牛客企业服务