Role Summary
As a Lead SRE Engineer, you will balance hands-on technical execution with engineering leadership to drive platform reliability, operational resilience, and automation.
You will design scalable system architectures, modernize deployment pipelines, and minimize operational friction across complex multi-cloud and hybrid environments.
Key Responsibilities
- System Reliability & Architecture: Lead performance engineering, incident response, and scalable system design across cloud and hybrid infrastructure.
- Automation & CI/CD Pipeline: Build, maintain, and optimize end-to-end continuous integration and delivery toolchains to ensure fast, secure releases.
- Observability & Diagnostics: Establish full-stack monitoring, telemetry, and synthetic testing standards to proactively detect and resolve outages.
- Infrastructure & Security Governance: Oversee network traffic management, load balancing, proxy configurations, and end-to-end SSL/TLS certificate lifecycles.
- Operational Leadership: Implement ITIL-aligned governance, drive root-cause analysis (RCA), and lead technical teams toward continuous operational improvement.
Core Technical Skills
- Programming & Scripting: Java, Python, Go, Shell Scripting, PowerShell, Groovy (Strong foundation in algorithms and data structures)
- Cloud & Infrastructure: PCF (Pivotal Cloud Foundry), VMware, AWS, Google Cloud Platform, Azure Fundamentals, Scalable System Design
- Database Systems: Postgres, Cassandra, Redis, Advanced SQL
- Observability & Monitoring: Splunk, Dynatrace, AppDynamics, BlazeMeter, ThousandEyes, BrowserStack
- CI/CD & Automation: Jenkins, XL Release (XLR), Habitat, Ansible, Chef Infra, Artifactory, SonarQube, SCM Branching Strategies
- Networking & Traffic Management: Wireshark, TCP/IP, F5 Load Balancers, Proxies, FTP/SFTP
- Certificate Management: Venafi, ECMS, OpenSSL
- ITSM & Compliance: ITIL Framework, Governance, Disaster Recovery Planning