Skip to content
← Back to job listings

Site Reliability Engineer (SRE) F/H

NUMSPOT · Courbevoie, Ile-de-France, France

External listingfull-time21 days ago

About The Role

Rejoignez Numspot, une entreprise engagée dans la construction d'une plateforme cloud souveraine. En tant que Senior Site Reliability Engineer (SRE), vous serez au cœur de l'industrialisation de nos services managés PaaS. Vous travaillerez en étroite collaboration avec les équipes de développement et d'exploitation pour améliorer la fiabilité et l'opérabilité de nos services. Vous aurez un impact direct sur la qualité de nos services et contribuerez à la montée en maturité de nos pratiques SRE.

  • Définir, formaliser et suivre les SLIs/SLOs des services managés, avec des alertes alignées sur l’impact.
  • Implémenter et faire évoluer l’observabilité (métriques, logs, traces) et les tableaux de bord.
  • Automatiser les déploiements et les opérations via IaC et GitOps.

Vous disposez d’une expérience significative en SRE/DevOps en production sur des systèmes distribués et êtes à l’aise pour intervenir sur des environnements Kubernetes et des services managés. Vous savez arbitrer entre une correction immédiate et une amélioration durable, avec une approche pragmatique orientée fiabilité et amélioration continue.

Vous êtes capable de prendre du recul sur les problématiques d’exploitation, de structurer les pratiques et de documenter ce qui rend les services plus simples à opérer pour l’ensemble de l’équipe. Vous appréciez le travail en transverse et savez partager vos connaissances ainsi qu’accompagner les équipes sur les enjeux de production et de fiabilité.

### Essentiels

  • Solide expérience de Kubernetes en production : administration, troubleshooting, compréhension des composants et des problématiques d’exploitation.
  • Expérience des cloud providers et/ou des environnements Kubernetes sur infrastructure bare metal.
  • Maîtrise des outils d’observabilité : Prometheus, Grafana, Loki, Tempo, OpenTelemetry.
  • Maîtrise des pratiques Infrastructure as Code : Terraform, Ansible, Helm.
  • Expérience des pipelines CI/CD et des déploiements GitOps : GitLab CI, ArgoCD.
  • Solides compétences en scripting et automatisation : Go, Python et/ou Bash.
  • Expérience autour des bases de données managées (PostgreSQL, MongoDB, etc.).
  • Bonnes connaissances des problématiques de stockage distribué et des réseaux.
  • Capacité à diagnostiquer des incidents complexes et à transformer les enseignements en améliorations durables.
  • Culture SRE forte : observabilité, automatisation, fiabilité et amélioration continue.

**Atouts**

  • Certification CKA/CKS.
  • Expérience sur des services managés (PaaS, DBaaS, KaaS…).
  • Connaissance des exigences HDS / SecNumCloud.
  • Background DevOps/SRE sur plateforme PaaS.
  • Votre trajectoire (projection)
  • **À 1 mois**
  • Comprendre l’architecture des services managés PaaS, les dépendances critiques, et les flux d’exploitation.
  • Cartographier les points de fragilité (incidents récents, alertes non actionnables, angles morts d’observabilité).
  • Livrer des améliorations prioritaires (dashboards, alerting, runbooks, automatisation ciblée).

**À 3 mois**

  • Prendre en charge un périmètre de fiabilité (SLO + alerting + plan d’amélioration) sur un ou plusieurs services.
  • Diminuer les alertes non actionnables et améliorer la qualité des signaux.
  • Contribuer à durcir les déploiements (GitOps/IaC) et à standardiser les pratiques d’exploitation.

**À 6 mois**

  • Être autonome sur la gestion d’incidents majeurs et l’amélioration continue associée.
  • Piloter des chantiers structurants (observabilité de bout en bout, résilience, capacity planning, optimisation coûts).
  • Co-construire la roadmap fiabilité avec Engineering et Produit, en liant enjeux et métriques.

**Savoir-faire essentiels :**

  • **Autonomie et proactivité** : Capacité à travailler sans supervision directe tout en identifiant les axes d’amélioration.
  • **Esprit critique** : Être force de proposition sur les choix technologiques et organisationnels.
  • **Collaboration efficace** : Aptitude à collaborer avec des profils variés, en favorisant la cohésion et le partage de connaissances.
  • **Communication claire** : Expliquer des concepts complexes de manière simple et accessible.

**Ce qui vous démarque**

Nous encourageons les talents qui souhaitent évoluer dans un environnement stimulant, qui valorise

  • **L’humilité :** Nous privilégions les leaders capables de reconnaître la valeur des contributions des autres et de continuer à apprendre, peu importe leur expérience.
  • **La solidarité :** Nous encourageons un esprit d’entraide et de coopération entre les équipes, car nous croyons que le succès collectif surpasse les réalisations individuelles.
  • **L’impact :** Vous avez une passion pour développer des solutions qui répondent non seulement aux besoins des utilisateurs, mais qui contribuent également à la défense de l’intérêt général et impactent positivement la société.
  • **L’amélioration continue :** Vous êtes curieux(se) et toujours en quête d’innovation, que ce soit pour vous-même ou pour le produit.

This is an external listing. JobSpring does not represent or verify the employer. Report this listing