职位描述:
1、负责线上海量服务器全生命周期运营运维管理和技术服务,面向业务提供和交付业界第一的服务器运营运维服务,促进和保障业务稳定发展;工作职责涵盖新产品运维引入、运维监管控等运营适配、线上运营管理、稳定性运营管理、数据中心服务器运维管理、维保维修、运营流程规范和平台系统规划建设等方向;
2、负责服务器新产品引入运营管理和适配体系化建设,包含制定服务器运维标准基线,规划设计、迭代优化新品可维护性、易维护性、稳定性方案,负责新品引入运营风险识别和评估评审、新产品运营运维方案建设适配等;
3、负责线上服务器基础运营服务,规划和建设稳定安全高效的基础运营服务架构和服务能力,包含固件升级、带外管理、开关机、重启、重装、搬迁等服务架构和能力;
4、负责线上服务器整体维保和技术支持服务交付,规划和建设稳定高效的维保和技术支持体系架构和运维能力,建设改配和利旧交付能力,打造稳定可靠低成本的维保和技术支持服务,保障业务连续性和持续发展;
5、负责线上服务器稳定性保障服务,规划和建设稳定性流程规范、平台系统、保障机制和能力,负责现网运营稳定性监控、稳定性风险识别、问题响应处理和保障措施,保障业务稳定健康运行;
6、负责数据中心IT运维服务,数据中心现场IT运营运维管理、园区物理管理和属地公共关系处理等工作,规划和建设标准化运维体系和能力,监控和防范数据中心IT运维风险,全方位保障数据中心稳定健康运行;
7、负责边缘机房物理资源软硬交付、线上网络服务器一体化运维服务,规划和建设边缘运营服务标准和能力,开展供应商及数据中心IT风险管理,协同商务以更优的服务和成本优势支持业务发展;
8、负责运营运维流程规划设计、管理和优化,平台系统方案规划和设计,通过系统化和自动化方案提升运营效率和质量。
职位要求:
1、有丰富的互联网大规模服务器运营运维经验,熟悉互联网运营运维流程体系,熟悉服务器全生命周期运营管理;具备服务拓展创新理念和运营服务拓展经验;
2、熟悉服务器硬件产品开发和交付流程,有0-1打造服务器硬件产品的经验;熟悉产品开发生命周期管理,包含产品线规划、产品阶段管理、产品文档管理;熟悉服务器运维场景,熟练掌握服务器可维护性、易维护性、稳定性风险识别能力,具备服务器新产品引入运营适配经验和能力;
3、熟悉服务器硬件架构及工作原理,精通主流服务器硬件架构(x86、ARM等)及其配套软件,具备大规模服务器运维管理,如固件升级管理、带外服务管理等经验,能够独立制定和落实服务器运维管理方案;
4、熟悉服务器故障模型、日志体系,熟悉服务器故障监控、日志分析、故障诊断;擅长问题分析和解决,能够独立完成服务器异常排查和优化,能独立处理复杂的系统级硬件故障,制定应急预案和长期解决方案;
5、熟悉服务器行业维保和技术服务交付流程和体系构成,具备成本意识,擅长结合海量运营,转化维保运营运维能力为成本优化项;
6、熟悉海量服务器运维稳定性保障流程规范、风险识别和监控、应急响应和保障措施,有海量服务器稳定性保障和处理经验,擅长和上下游及业务团队共同建设和运行稳定性规范;
7、有丰富的互联网或运营商大型数据中心规划、运营、资源管理相关经验;熟悉制定和建设数据中心IT运维管理流程规范、运维平台和标准化运维能力;熟悉数据中心IT运维风险、隐患点所在,擅长识别和排除隐患风险,保障安全稳定运营;
8、有海量服务器运营运维流程规范、运维架构规划设计经验,具备在海量运营中提炼共性事务,转化为规范约束和平台自动运维的能力;
9、熟练掌握Linux系统,擅长Linux系统下服务器硬件配置设置、故障排查;熟练掌握 Shell 脚本/Python/PHP/Perl/Lua 等常用计算机语言之一,可以通过语言工具工作中提升效率;
10、具备项目管理知识、良好的语言沟通能力、工作组织能力、推动能力和跨团队协作能力;
11、责任心强,工作细致认真,对工作充满热情;学习能力强,对新技术充满热情和好奇心,能引领团队持续学习和创新;抗压能力强,能承担较高的工作压力。
...