We're seeking a Principal AWS Resilience & Site Reliability Consultant to help shape and deliver cloud resilience, disaster recovery and service reliability capabilities across a large-scale multinational technology environment.
3-month contract initially
Working within a highly available AWS platform estate, you'll lead the design of recovery architectures, resilience frameworks and automated recovery capabilities, ensuring business-critical services remain secure, recoverable and available.
This role combines AWS architecture, disaster recovery, operational resilience, platform engineering and Site Reliability Engineering (SRE), making it ideal for a senior consultant who enjoys solving complex availability and recoverability challenges.
Responsibilities
- Design and implement AWS-native backup, disaster recovery and resilience solutions
- Define and govern recovery strategies, RTOs and RPOs for critical services
- Lead adoption of AWS Backup, AWS Elastic Disaster Recovery (DRS), AWS Resilience Hub and multi-region recovery patterns
- Develop backup & restore, pilot light, warm standby and active/active architectures
- Drive Terraform adoption and Infrastructure as Code standards
- Create automated recovery workflows, runbooks and operational playbooks
- Establish SRE practices including SLIs, SLOs, observability and service reliability metrics
- Lead disaster recovery testing, failover exercises and resilience assurance activities
- Partner with engineering, architecture and leadership teams to improve platform recoverability and operational readiness
- Provide technical leadership and strategic guidance across resilience initiatives
Essential Skills
- Extensive AWS architecture and cloud platform experience
- AWS Backup and AWS Elastic Disaster Recovery (DRS)
- Disaster Recovery and Business Continuity planning
- Terraform and Infrastructure as Code
- AWS multi-account environments
- Cross-region resilience and recovery architectures
- Recovery testing, failover and failback planning
- Strong understanding of Site Reliability Engineering principles
- Automation and platform engineering experience
- Excellent stakeholder management and consultancy skills
Desirable
- AWS Resilience Hub
- Cyber recovery and ransomware resilience
- Observability tooling such as Grafana, Datadog, Splunk or Elastic
- Experience supporting large-scale consumer-facing digital platforms
- Gaming, media, entertainment, SaaS or cloud-native technology environments
- AWS Solutions Architect Professional certification
Ideal Background
- AWS Resilience Architect
- AWS Disaster Recovery Architect
- Principal AWS Consultant
- Cloud Platform Architect
- Site Reliability Architect
- AWS Infrastructure Architect
- Cloud Recovery & Resilience Consultant
This is an opportunity to play a key role in improving the resilience, recoverability and reliability of a globally distributed AWS platform supporting critical customer-facing services.