Ingénieur fiabilité des infrastructures

5 months, 3 weeks ago
Full-time
Senior
DevOps and Infrastructure
Tecsys

Tecsys

Tecsys is a global provider of transformative supply chain solutions, offering innovative warehouse management software and end-to-end visibility for various industries. With a focus on advancing supply chain management since 1983, Tecsys delivers effi...

Air Freight & Logistics
251-1K
Founded 1983
$52M raised

Description

  • Collaborer avec les équipes d’ingénierie pour soutenir les services avant leur mise en service, notamment par la consultation en conception, le développement de plateformes et les revues de lancement.
  • Maintenir les services en production en surveillant la disponibilité, la latence et l’état général du système.
  • Améliorer l’observabilité en optimisant la surveillance et l’alerte avec Datadog et en définissant des SLO/SLI.
  • Créer des tableaux de bord exploitables et mettre en place le signalement des SLA.
  • Développer et faire évoluer l’automatisation avec les outils internes, les cadres IaC et les pipelines CI/CD.
  • Réduire les interventions manuelles et favoriser des systèmes d’auto-réparation.
  • Piloter une gestion durable des incidents et des analyses post-incident sans reproche.
  • Diriger les revues post-incident (RCA) et suivre les correctifs à long terme pour améliorer la stabilité et l’expérience développeur.
  • Créer et maintenir la documentation technique.
  • Agir comme commandant d’incident pour coordonner la réponse interéquipes, les communications et le rétablissement rapide des services.

Requirements

  • Expérience en ingénierie de fiabilité des infrastructures, SRE ou opérations de plateformes dans un environnement SaaS critique.
  • Expérience de travail avec AWS et Kubernetes.
  • Expérience avec Datadog pour la surveillance et l’alerte.
  • Expérience avec Terraform et GitLab CI/CD.
  • Capacité à gérer des incidents, des RCA et des pratiques d’amélioration continue.
  • Solide sens de l’automatisation et de l’ingénierie de la résilience.
  • Disponibilité pour une rotation en cas d’escalade d’incidents.
  • Disponibilité pour des voyages occasionnels, y compris des visites trimestrielles sur site et des conférences, à moins de 10 %.
  • Être citoyen canadien, résident permanent du Canada ou détenir un permis de travail canadien valide.

Benefits

  • Entreprise privilégiant le travail à distance avec flexibilité de travail.
  • Bureaux bien situés et espaces de travail collaboratifs disponibles.
  • Environnement favorisant le bien-être des employés, la productivité et la réduction des trajets domicile-travail.
  • Opportunités d’apprentissage continu.
  • Employeur offrant l’égalité des chances.
  • Accommodements offerts aux candidats sélectionnés pour une entrevue.
  • Processus d’embauche sans filtrage ou rejet automatisé par IA.

Interested in this position?

Apply directly on the company website

Apply Now

Similar Roles

[Job 32173] Developer SRE / Platform Engineer Azure Sênior — AKS & APIM

CI&T 5K-10K Internet Software & Services

A CI&T busca uma pessoa SRE/Platform Engineer Sênior para preparar, operar e evoluir componentes de plataforma Azure, garantindo confiabilidade de soluções em colaboração com Arquitetura e Engenharia.

Azure CI/CD GitHub Actions Kubernetes Terraform
2 hours, 3 minutes ago

(EG0069) Senior Site Reliability Engineer (SRE) - Cassandra & AWS - Talent Connection

Nortal 251-1K Internet Software & Services

Nortal is building a talent network for a Senior Site Reliability Engineer to modernize, scale, and improve the reliability of high-volume production platforms for enterprise clients.

AWS CI/CD Datadog Grafana GraphQL Java Kafka Kubernetes Prometheus Spring Boot Terraform
2 hours, 18 minutes ago

Site Reliability Engineer II

MRSOOL 1K-5K Air Freight & Logistics

Mrsool is seeking an experienced Site Reliability Engineer to improve the stability, scalability, security, and operational efficiency of its high-traffic delivery platform serving the MENA region.

Ansible AWS Azure Chef CI/CD Docker GCP Go Grafana Java Kubernetes Nagios Prometheus Puppet Python Ruby Terraform
2 hours, 48 minutes ago

OMS Application Engineer

Warner Music Group is seeking an OMS Application Engineer to maintain, upgrade, and support the technical systems powering its global commerce ecosystem, with a focus on reliability, scalability, and long-term stability.

AWS CI/CD GitHub Actions Java Microservices
4 days, 1 hour ago

You're on a roll! Sign up now to keep applying.

Sign Up

Already have an account? Log in

Used by 14,729+ remote workers