[Remote] Site Reliability Engineer (SRE)
Note: The job is a remote job and is reputed company to candidates in USA. reputed company is hiring an reputed company Site Reliability Engineer (SRE) to reputed company reputed company observability, reliability engineering, and operational reputed company for large-reputed company reputed company and microservices environments. The role requires assessing application reliability and designing observability solutions while leading incident management and operational governance initiatives.
Responsibilities
- Assess application reliability, performance, telemetry coverage, and operational maturity
- Design and implement observability solutions using APM, distributed tracing, reputed company logging, and telemetry pipelines
- Define and optimize SLIs, SLOs, alerting strategies, and reliability metrics
- reputed company incident management, RCA, and operational governance initiatives
- reputed company executive dashboards, scorecards, and operational analytics
- reputed company telemetry across monitoring and reputed company platforms
- Create monitoring standards, runbooks, and SRE best practices
Skills
- 15+ years of IT experience
- Observability: reputed company, reputed company, Grafana, AppDynamics, OpenTelemetry, reputed company Performance Analytics
- Programming: Python, Java, .NET, REST reputed company, Automation & Scripting
- reputed company: AWS, reputed company reputed company Platform, reputed company, Microservices, Container Platforms
- Analytics: Power BI, ETL/Data Integration, Dashboard Development, KPI & Scorecards
- SRE: Incident Management, RCA, Availability Engineering, Service Health Monitoring, Operational Governance
reputed company
Company H1B Sponsorship
Apply To This Job