Senior Site Reliability Engineering Lead
Lead Platform Site Reliability Engineering and Cloud Operations for Huawei Mobile Services across Asia Pacific, Africa, Latin America, and Russia regions. Responsible for reliability engineering strategy, platform governance, cloud operations, infrastructure optimization, security compliance, business continuity, operational excellence, and leadership of geographically distributed engineering teams.
Key Responsibilities & Achievements
• Established and institutionalized Huawei's Platform SRE organization and reliability governance framework following the migration of operational ownership to Singapore.
• Built, mentored, and led a high-performing team of 15+ engineers across SRE, Platform Engineering, Cloud Operations, Security, and Compliance domains.
• Spearheaded cloud-native modernization initiatives, successfully migrating more than 200 services and approximately 15,000 virtual machines to Huawei Cloud Container Engine (CCE).
• Governed mission-critical cloud platforms and services including WiseEye, WiseCloud Console, WiseFunction Services, ERS, CCE, ELB, SLB, IAM, and enterprise security platforms.
• Led enterprise-wide AIOps transformation initiatives from AIOps 3.0 to AIOps 5.0 in collaboration with Huawei Headquarters and global engineering teams.
• Ensured reliability, scalability, and operational readiness of critical consumer platforms including PPS Advertisement Platform, Huawei Maps, Wearable Services, and Huawei Health Cloud.
• Drove observability, automation, incident response, disaster recovery, business continuity, and chaos engineering programs to improve service resilience.
• Reduced Mean Time to Recovery (MTTR) by 50%, improving operational response and service restoration capabilities.
• Delivered approximately 30% infrastructure cost savings through cloud optimization, Kubernetes governance, capacity planning, and resource efficiency initiatives.
• Led security and compliance programs covering vulnerability management, operating system lifecycle upgrades, middleware governance, certificate management, RASP compliance, and security hardening.
• Partner closely with global product, engineering, operations, and leadership teams to continuously improve platform reliability and customer experience.
Core Technologies: SRE, Platform Engineering, Kubernetes, Huawei Cloud, DevOps, AIOps, Cloud Operations, Automation, Security Compliance, Disaster Recovery, Business Continuity, Observability, Incident Management.
