
#85192
Analista DevOps Pleno
nstech
Sobre a vaga
A nstech é a mais completa plataforma open logistics do mundo, construindo o futuro digital do transporte de cargas junto a todo o ecossistema logístico. Nosso objetivo é conectar e transformar a cadeia logística, oferecendo centenas de soluções integradas em um único lugar. Acreditamos no poder da tecnologia para melhorar o mundo, reduzindo a emissão de CO2, acidentes e roubos.
Sobre a Vaga
Esta é uma oportunidade para um(a) Analista DevOps Pleno com perfil focado em Cloud Operations e Engenharia de Confiabilidade (SRE). Você será a referência técnica para garantir a estabilidade, escalabilidade e resiliência do nosso ecossistema cloud-native baseado em Kubernetes. Sua missão será contribuir com a padronização das esteiras de CI/CD, garantir a governança da infraestrutura através de IaC (Infrastructure as Code) e capitanear a estratégia de observabilidade de ponta a ponta. Buscamos alguém que use a automação avançada para reduzir o MTTR e implementar mecanismos de auto-reparação (self-healing), transformando a eficiência da nossa operação de logística e mobilidade.
Responsabilidades:
- Definir, padronizar e evoluir o modelo de CI/CD da companhia, garantindo esteiras de deploy rápidas, seguras, automatizadas e com validações de segurança integradas (DevSecOps).
- Arquitetar e gerenciar a infraestrutura global via IaC (Infrastructure as Code), garantindo a reprodutibilidade dos ambientes, controle de versão e aplicando práticas recomendadas de mercado.
- Evoluir a estratégia de observabilidade utilizando a plataforma Datadog como ferramenta central (do frontend ao banco de dados).
- Definir e implementar SLIs, SLOs e Error Budgets junto aos times de produto para garantir a saúde do negócio e das aplicações críticas.
- Arquitetar alertas inteligentes e preditivos, explorando capacidades de AIOps para antecipar falhas antes que impactem o cliente final.
- Disseminar a cultura de SRE e DevOps, apoiando desenvolvedores na análise de traces distribuídos, gargalos de performance e adoção dos padrões de deploy e infraestrutura.
- Liderar a resposta a incidentes críticos como Incident Commander, coordenando war rooms e facilitando a comunicação entre times técnicos e de negócio.
- Combater o trabalho manual (toil), priorizando a automação de runbooks e diagnósticos para redução drástica do MTTR.
- Facilitar análises de causa raiz (RCA) com foco em melhoria contínua (blameless post-mortems), garantindo que incidentes gerem evolução na plataforma.
- Desenhar mecanismos complexos de auto-reparação, como parametrização avançada de liveness/readiness probes, HPA/VPA e resiliência de microsserviços.
- Desenvolver ferramentas e scripts (Python, Go, ou Shell) para automatizar a remediação de incidentes e tarefas operacionais.
- Colaborar com a equipe de Engenharia de Infraestrutura para evoluir a plataforma de Cloud, garantindo que as fundações de rede, segurança e computação estejam alinhadas com as necessidades de CI/CD e IaC.
Requisitos Técnicos
- Experiência com Kubernetes (conceitos de Pods, Services, Deployments, Ingress) e Docker
- Experiência prática com ferramentas de APM como Datadog, Dynatrace ou New Relic
- Conhecimento em pelo menos uma nuvem principal (Azure ou AWS)
- Habilidade comprovada em análise de logs, métricas e troubleshooting de aplicações web
- Noções de Shell Script, Python ou PowerShell para automação de tarefas
- Experiência com Helm para gerenciamento de pacotes Kubernetes
- Conhecimento em Prometheus e Grafana
- Familiaridade com pipelines de CI/CD (Azure DevOps, GitHub Actions, Jenkins)
- Conhecimento conceitual de Infraestrutura como Código (Terraform)
- Exposição a conceitos de Service Mesh (Istio, Linkerd)
Desejáveis:
- CKA (Certified Kubernetes Administrator)
- Certificações APM (Datadog, Dynatrace, NewRelic)
- Certificações de Cloud (Azure, AWS)
- Certificações de Automação (Terraform, Ansible)
Perfil:
- Mentalidade SRE: Foco incansável em disponibilidade, performance e resiliência.
- Resolvedor de Problemas (Investigador): Paixão por investigar problemas complexos até a causa raiz, como um detetive.
- Calma sob Pressão: Habilidade de manter o foco e a clareza de raciocínio durante incidentes críticos.
- Colaboração: Capacidade de trabalhar de forma integrada com desenvolvedores, infraestrutura e SREs.
- Ownership (Senso de Dono): Sentir-se responsável pelo sucesso e pela estabilidade das aplicações em produção.
Local:Remoto/Remoto
Formação:Ens. Médio Completo