Numspot recrute un·e Senior Site Reliability Engineer (SRE) pour fiabiliser et faire monter en puissance l’ensemble des services managés PaaS de sa plateforme cloud souveraine. Le rôle est au cœur de l’industrialisation : disponibilité, performance, et capacité à diagnostiquer rapidement des situations complexes en production.
Votre mission : définir, mettre en place et faire vivre les pratiques, l’outillage et les automatismes qui permettent aux équipes Engineering de livrer des services managés stables, observables et opérables, avec des objectifs de fiabilité mesurés.
Pourquoi maintenant : l’offre PaaS s’enrichit et se déploie. Pour tenir la trajectoire, la fiabilité doit être traitée comme un produit, avec des standards (SLI/SLO), des signaux (métriques, logs, traces) et des boucles d’amélioration continue. Le rôle implique également d’apporter une vision SRE mature et de contribuer à la montée en maturité des pratiques de l’équipe.
L’équipe et le rôle
Vous travaillez au sein du département Engineering, en équipe avec les SRE, au contact direct des équipes de développement et des équipes en charge de l’exploitation. L’équipe Services Managés porte des services PaaS (dont Kubernetes et des bases de données managées) qui doivent être simples à consommer et robustes en production.
Dans ce rôle, vous intervenez à la fois sur le terrain (incidents, troubleshooting, amélioration de la production) et sur la structure (observabilité, automatisation, SLO, standards d’exploitation). Vous aidez à transformer des problèmes récurrents en actions concrètes : instrumentation, amélioration d’un runbook, automatisation d’une opération, ou durcissement d’une configuration.
Par votre expérience, vous contribuez également à diffuser les bonnes pratiques SRE, à structurer les approches d’exploitation et à accompagner les équipes sur les enjeux de fiabilité et d’opérabilité.
Ce que vous ferez / Vos missions
L’objectif est de rendre les services managés plus fiables et plus faciles à opérer.
Fondations SRE (SLI/SLO, qualité de service)
Définir, formaliser et suivre les SLIs/SLOs des services managés, avec des alertes alignées sur l’impact.
Mettre en place et animer des routines de revue de fiabilité (incidents, dette d’exploitation, actions priorisées).
Observabilité & diagnostic
Implémenter et faire évoluer l’observabilité (métriques, logs, traces) et les tableaux de bord.
Améliorer la capacité de diagnostic : signaux exploitables, corrélation, réduction du MTTR.
Automatisation & opérations
Automatiser les déploiements et les opérations via IaC et GitOps.
Concevoir et maintenir l’infrastructure des services managés PaaS, en gardant une approche reproductible et documentée.
Optimiser les performances et les coûts d’infrastructure, avec des mesures et des arbitrages explicites.
Gestion d’incidents & amélioration continue
Gérer les incidents (on-call si applicable), conduire des post-mortems factuels et transformer les conclusions en actions concrètes.
Travailler avec les équipes de développement pour améliorer la reliability (patterns, limites, garde-fous, tests de résilience).
Contribuer à la diffusion des bonnes pratiques de fiabilité et à l’amélioration continue des standards d’exploitation.