常见HQL面试题分享

疫情用户行为轨迹分析【美团、阿里】

问题描述

已知用户-核酸站点表t1和用户-商场扫码表t2,统计用户每天的行动轨迹。注意:商场扫码表中存在重复扫码的情况,取最新的数据。

-- t1
user_id    in_time                 out_time             stat_id
001        2022-05-20 15:31:21     null                 001
001        null                    2022-05-20 16:01:05  002
001        2022-05-20 18:02:21     null                 003
001        null                    2022-05-20 18:22:17  001
001        2022-05-20 20:39:27     null                 004
001        null                    2022-05-20 21:55:33  005
-- t2
user_id    market_id    scan_time
001        1001         2022-05-20 16:11:41
001        1001         2022-05-20 16:11:51
001        1001         2022-05-20 16:11:58
001        1002         2022-05-20 17:01:28
001        1003         2022-05-20 18:31:28
001        1003         2022-05-20 18:31:58

分析

经过对需求的分析,可以简化为 求每个用户每天去过哪些地方。其实就是按照用户和日期进行分组,然后合并用户去过的所有地即可(可能会重复)。

答案

select
  user_id,
  to_date(trace_time) as dt,
  concat_ws('->', collect_list(trace_id)) as trace
from
  (
    select
      user_id,
      trace_time,
      trace_id
    from
      (
        select
          user_id,
          in_time as trace_time,
          stat_id as trace_id
        from
          t1
        union all
        select
          user_id,
          out_time as trace_time,
          stat_id as trace_id
        from
          t1
        union all
        select
          user_id,
          max(scan_time) as trace_time,
          market_id as trace_id
        from
          t2
        group by user_id, market_id
      ) t
    order by
      trace_time
) t
where trace_time is not null
group by user_id, to_date(trace_time)

模拟连续随机数

问题描述

生成1-100的连续整数

分析

posexplode爆炸函数,不仅可以炸裂出数值,而且还附带索引

答案

select 
    id_start + pos as id
from (
    select 1 as id_start, 100 as id_end
) t
lateral view posexplode(split(id_end - id_start), ' ')) t as pos, val

两两相互认识的组合数【快手】

问题描述

已知用户-网吧表t,字段:网吧id、用户id、上线时间、下线时间

  • 规则1:如果有两个用户在一家网吧的前后上下线时间在10分钟以内,则两人可能认识
  • 规则2:如果这两个用户在三家以上网吧出现【规则1】的情况,则两人一定认识
wid  uid       ontime                    offtime
1    110001    2020-01-01 11:10:00       2020-01-01 11:15:00
1    110002    2020-01-01 12:10:00       2020-01-01 13:15:00
2    110001    2020-01-02 12:10:00       2020-01-02 12:30:00
2    110002    2020-01-02 12:52:00       2020-01-02 12:55:00
3    110001    2020-01-03 12:10:00       2020-01-03 12:30:00

分析

经过对需求的分析,就是要求两两相识的组合数。对于这种两两组合的题目一般需要先进行自关联,然后根据规则1和规则2对组合进行筛选即可

答案

select sum(flag) as cnt
from(
    select uuid, if(count(wid) >= 3, 1, 0) as flag
    from(
        select t0.wid as wid, concat_ws('', t0.uid, t1.uid) as uuid
        from t as t0     
        join t as t1 
        where 
            t0.wid = t1.wid 
            and t0.uid != t1.uid 
            and (abs(unix_timestamp(t0.ontime,'yyyy-MM-dd HH:mm:ss')-unix_timestamp(t1.ontime,'yyyy-MM-dd HH:mm:ss'))<600 or abs(unix_timestamp(t0.offtime,'yyyy-MM-dd HH:mm:ss')-unix_timestamp(t1.offtime,'yyyy-MM-dd HH:mm:ss'))<600)
    ) t
    group by uuid
) m
#数据人的面试交流地##大数据开发##sql##大数据#
大厂高频面试SQL题 文章被收录于专栏

收录字节、阿里、蚂蚁、美团、京东、百度、小红书、拼多多等大厂面试SQL题

全部评论

相关推荐

头像
10-13 18:10
已编辑
东南大学 C++
。收拾收拾心情下一家吧————————————————10.12更新上面不知道怎么的,每次在手机上编辑都会只有最后一行才会显示。原本不想写凉经的,太伤感情了,但过了一天想了想,凉经的拿起来好好整理,就像象棋一样,你进步最快的时候不是你赢棋的时候,而是在输棋的时候。那废话不多说,就做个复盘吧。一面:1,经典自我介绍2,项目盘问,没啥好说的,感觉问的不是很多3,八股问的比较奇怪,他会深挖性地问一些,比如,我知道MMU,那你知不知道QMMU(记得是这个,总之就是MMU前面加一个字母)4,知不知道slab内存分配器-&gt;这个我清楚5,知不知道排序算法,排序算法一般怎么用6,写一道力扣的,最长回文子串反问:1,工作内容2,工作强度3,关于友商的问题-&gt;后面这个问题问HR去了,和中兴有关,数通这个行业和友商相关的不要提,这个行业和别的行业不同,别的行业干同一行的都是竞争关系,数通这个行业的不同企业的关系比较微妙。特别细节的问题我确实不知道,但一面没挂我。接下来是我被挂的二面,先说说我挂在哪里,技术性问题我应该没啥问题,主要是一些解决问题思路上的回答,一方面是这方面我准备的不多,另一方面是这个面试写的是“专业面试二面”,但是感觉问的问题都是一些主管面/综合面才会问的问题,就是不问技术问方法论。我以前形成的思维定式就是专业面会就是会,不会就直说不会,但事实上如果问到方法论性质的问题的话得扯一下皮,不能按照上面这个模式。刚到位置上就看到面试官叹了一口气,有一些不详的预感。我是下午1点45左右面的。1,经典自我介绍2,你是怎么完成这个项目的,分成几个步骤。我大致说了一下。你有没有觉得你的步骤里面缺了一些什么,(这里已经在引导我往他想的那个方向走了),比如你一个人的能力永远是不够的,,,我们平时会有一些组内的会议来沟通我们的所思所想。。。。3,你在项目中遇到的最困难的地方在什么方面4,说一下你知道的TCP/IP协议网络模型中的网络层有关的协议......5,接着4问,你觉得现在的socket有什么样的缺点,有什么样的优化方向?6,中间手撕了一道很简单的快慢指针的问题。大概是在链表的倒数第N个位置插入一个节点。————————————————————————————————————10.13晚更新补充一下一面说的一些奇怪的概念:1,提到了RPC2,提到了fu(第四声)拷贝,我当时说我只知道零拷贝,知道mmap,然后他说mmap是其中的一种方式,然后他问我知不知道DPDK,我说不知道,他说这个是一个高性能的拷贝方式3,MMU这个前面加了一个什么字母我这里没记,别问我了4,后面还提到了LTU,VFIO,孩子真的不会。
走呀走:华子二面可能会有场景题的,是有些开放性的问题了
点赞 评论 收藏
分享
评论
4
20
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务