- 岗位职责
1、保障大数据&计算多个核心系统的可靠性与正常运行,同时关注系统容量与稳定性;
2、为大型系统构建自动化运营解决方案;
3、与系统开发团队合作,从系统设计到上线的整个生命周期内保障系统可靠性;
4、通过监控系统组件可用性、性能指标提升系统可见性,帮助系统开发以及团队快速定位故障;
5、推动提升服务的可靠性、可扩展性以及性能优化,保障系统 SLA;
6、参与设计、实现能够保障线上大规模集群快速迭代的自动化平台;
7、基于业务使用场景,深入优化提供最佳服务治理实践,包含不局限于关键链路性能瓶颈分析、业务问题定位排障、推进系统高可用架构改造升级等。
- 岗位要求
1、本科以上学历, 计算机相关专业, 并有两年以上相关领域工作经验;
2、扎实的计算机软件基础知识;
3、了解 Linux 操作系统、存储、网络 IO 等相关原理;
4、熟悉一种或多种编程语言,例如 Python/Go/Java/Shell/Ansible;
5、具备系统化解决问题的能力,良好的沟通技巧和主人翁责任感;
6、具有相关计算/分布式/大数据等系统经验优先。