Live opening · Posted 20 hours ago

SRE

EX Squared · Costa Rica
Bamboohr Yes Full-Time
You are 20 hours behind. JobBeeper subscribers saw this role while it was still new.

At a glance

The key details from the original listing.

Posted 20 hours ago
CompanyEX Squared
LocationCosta Rica
Job typeFull-Time
Work modeYes
SkillsAWS, Docker, Kubernetes, Terraform
SourceBamboohr
Listed20 hours ago

Your early-applicant advantage

Live timing from JobBeeper.

Live data
16 min from Bamboohr publishing this role to us finding it
20 min median time from a role going live to a subscriber being told
6 hours subscribers had this role before this page existed
73,856 roles found in the last 24 hours — the newest are not on this site yet
Start your free trial →

About the role

Description supplied by the original job listing.

En EX Squared LATAM somos una empresa de transformación digital enfocada en desarrollar soluciones tecnológicas innovadoras y de alto impacto que generan valor real para el negocio. Trabajamos con clientes de primer nivel en mercados globales, regionales y locales, fomentando una cultura colaborativa, inclusiva e impulsada por la innovación, donde las ideas de cada persona realmente importan.
Buscamos un/a Site Reliability Engineer (SRE) con experiencia sólida en operación de servicios críticos y entornos productivos, que combine conocimientos de cloud, automatización, observabilidad y gestión de incidentes para contribuir a la construcción y evolución de plataformas tecnológicas confiables, resilientes y escalables.
La posición trabajará de manera cercana con equipos de desarrollo y plataforma, promoviendo prácticas de confiabilidad desde el diseño hasta la operación y equilibrando la estabilidad de los servicios con la velocidad de entrega de cambios.
Tipo de posición: Tiempo completo, long-term.
Responsabilidades
Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos.
Implementar y evolucionar prácticas de observabilidad, utilizando métricas, logs y trazas para entender el comportamiento de los servicios.
Definir y mantener SLIs y SLOs en conjunto con equipos de desarrollo y stakeholders del negocio.
Participar en la atención de incidentes y esquemas de on-call, realizando diagnóstico, contención y recuperación de servicios.
Liderar y documentar análisis post-incidente y Root Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas.
Promover el modelo “you build it, you run it”, incorporando prácticas de confiabilidad desde el desarrollo.
Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines de CI/CD.
Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración.
Evaluar y fortalecer la resiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios.
Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering.
Requisitos
Experiencia profesional en Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations.
Experiencia hands-on trabajando con servicios críticos y ambientes productivos.
Sólidos conocimientos de Linux y troubleshooting de infraestructura y aplicaciones.
Experiencia con plataformas de cloud computing.
Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento.
Experiencia atendiendo incidentes de producción, troubleshooting y Root Cause Analysis.
Conocimiento de conceptos de SLI, SLO y SLA y su aplicación en la gestión de confiabilidad.
Experiencia con automatización y scripting.
Conocimiento de CI/CD y procesos modernos de deployment.
Experiencia con Infrastructure as Code, idealmente Terraform.
Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad.
Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones.
Deseable
Experiencia con AWS y arquitecturas cloud-native.
Experiencia con Terraform y automatización de infraestructura.
Experiencia con Docker y Kubernetes.
Conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes.
Experiencia trabajando con estrategias de High Availability y Disaster Recovery.
Experiencia en análisis de capacidad, performance y escalabilidad.
Experiencia participando en esquemas de on-call y gestión de incidentes críticos.
Certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.
Beneficios
Seguro médico privado.
Asociación solidarista.
Vacaciones y feriados de acuerdo con la legislación de Costa Rica.
Oportunidades de aprendizaje y crecimiento profesional.
Participación en proyectos tecnológicos de alto impacto.
Nota de elegibilidad
Esta oportunidad está disponible únicamente para candidatos que residan actualmente en Costa Rica. Aplicaciones fuera de esta región no serán consideradas.

Employment type
Full-Time

Work arrangement
Yes

Get JobBeeper Mobile App

Never miss a job opening! Get instant job alerts on your phone.

Subscribers see fresh openings within minutes. Download the JobBeeper App on Google Play to get real-time push notifications and apply before anyone else.

⚡ Instant Push Alerts 🎯 Tailored Filters 🚀 Direct Employer Links
GET IT ON Google Play

More openings worth a look

Recently tracked roles with full details and direct application links.

6 roles
Good roles move before most people even see them. Tell JobBeeper what you want and get fresh matches delivered in minutes.
Start your free trial →
⚡ Get fresh job alerts 📱 Get App