We are hiring an experienced Site Reliability Engineer (SRE) with 15+ years of IT experience to drive enterprise observability, reliability engineering, and operational excellence for large-scale cloud and microservices environments.
Experience: 15+ Years
Key Responsibilities
- Assess application reliability, performance, telemetry coverage, and operational maturity.
- Design and implement observability solutions using APM, distributed tracing, structured logging, and telemetry pipelines.
- Define and optimize SLIs, SLOs, alerting strategies, and reliability metrics.
- Lead incident management, RCA, and operational governance initiatives.
- Develop executive dashboards, scorecards, and operational analytics.
- Integrate telemetry across monitoring and cloud platforms.
- Create monitoring standards, runbooks, and SRE best practices.
Required Skills
- Observability: Splunk, Dynatrace, Grafana, AppDynamics, OpenTelemetry, ServiceNow Performance Analytics
- Programming: Python, Java, .NET, REST APIs, Automation & Scripting
- Cloud: AWS, Google Cloud Platform, Kubernetes, Microservices, Container Platforms
- Analytics: Power BI, ETL/Data Integration, Dashboard Development, KPI & Scorecards
- SRE: Incident Management, RCA, Availability Engineering, Service Health Monitoring, Operational Governance
Ideal Candidate
- 15+ years of experience in Site Reliability Engineering, Observability Engineering, Infrastructure Operations, or Application Support.
- Strong experience implementing enterprise observability and telemetry solutions.
- Expertise in executive reporting, operational analytics, and reliability scorecards.
- Excellent stakeholder communication and leadership skills.