Skip to content
← Back to job listings

Senior SRE - Services Cloud Managés (F/H)

NUMSPOT · Courbevoie, Ile-de-France, France

External listingfull-timeabout 2 months ago

About The Role

Rejoignez Numspot, la plateforme cloud souveraine française. En tant que Senior SRE, vous serez responsable de la conception, du déploiement et de la maintenance de nos services cloud managés. Vous travaillerez en étroite collaboration avec le Head of IT Operations et serez impliqué dans toutes les étapes du cycle de vie des services, de la conception à l'exploitation. Vous aurez un impact direct sur la souveraineté numérique européenne et bénéficierez d'un environnement de travail dynamique et stimulant.

  • Intervenir sur les incidents, construire l'infrastructure, passer en revue l'architecture, et prendre les décisions techniques.
  • Définir les objectifs de niveau de service, calibrer les alertes sur l'impact réel et piloter l'error budget.
  • Écrire et maintenir l'infrastructure as code (Terraform, Ansible, Helm, ArgoCD) et concevoir et fiabiliser les pipelines de déploiement.

Vous avez opéré des systèmes distribués en production à grande échelle. Vous êtes aussi à l'aise sur un incident Kubernetes à 2h du matin que sur une revue d'architecture le lendemain. Vous cherchez un poste où vous agissez, pas où vous coordonnez.

**Indispensable**

  • **7 ans et plus** d'expérience SRE, DevOps senior ou Platform Engineering sur des environnements cloud native en production.
  • **Kubernetes en production.** Administration avancée, troubleshooting profond, réseau (CNI, ingress, service mesh), sécurité (RBAC, PSA), composants internes. Vous savez lire un etcd et comprendre pourquoi un pod ne démarre pas.
  • **Culture SRE opérationnelle.** SLO et error budget réellement utilisés pour arbitrer, post mortems conduits, on call géré sérieusement.
  • **IaC en conditions réelles.** Terraform, Ansible, Helm, sur des environnements hybrides ou bare metal.
  • **Sécurité opérationnelle.** IAM, Vault, Sealed Secrets, Keycloak, OIDC, intégrés nativement dans vos déploiements.
  • **Scripting.** Go, Python ou Bash. Vous écrivez des outils, pas seulement des scripts de 20 lignes.
  • **Bases de données en production.** PostgreSQL, MongoDB, managées ou autohébergées. Vous savez quoi faire quand ça ne répond plus.

**Atouts**

  • **Contexte souverain ou haute criticité.** HDS, SecNumCloud ou réglementation sectorielle forte : vous connaissez les contraintes que cela impose en exploitation.
  • **Certification CKA ou CKS.**
  • **Expérience PaaS ou KaaS.** Vous avez conçu ou opéré des services managés exposés à des clients externes.

**Ce qui vous caractérise**

  • Vous documentez pour que la connaissance survive à votre départ.
  • Vous savez quand corriger vite et quand corriger bien, et vous ne laissez pas la correction rapide devenir permanente.
  • Vous challengez les décisions techniques avec des faits, même hors de votre périmètre direct.
  • Vous expliquez un incident P0 à un interlocuteur non technique sans perdre en précision.

Stack technique Orchestration : Kubernetes, OpenShift, Helm, Kustomize. CI/CD et GitOps : GitLab CI, ArgoCD, FluxCD. IaC et automatisation : Terraform, Ansible. Observabilité : Prometheus, Grafana, Loki, ELK, OpenTelemetry. Sécurité et IAM : Keycloak, OIDC, OAuth2, Vault, Sealed Secrets. Infrastructure IaaS : compute, réseau, stockage objet et bloc, volumes dynamiques. Bases de données : PostgreSQL, MongoDB, managées ou autohébergées. Pratiques SRE : SLO, SLA, error budget, alerting orienté impact, chaos testing.

  • * *
  • **Votre trajectoire**
  • **Mois 1**
  • Maîtrise de l'architecture des services de la squad : dépendances, flux critiques, points de fragilité.
  • Cartographie des angles morts d'observabilité, des alertes non actionnables et de la dette d'exploitation.
  • Premières actions concrètes : dashboards, alerting amélioré, runbooks mis à jour.
  • Première rotation on call, avec intervention sur des incidents réels.

**Mois 3**

  • SLO définis et pilotés sur le périmètre de la squad, alerting calibré, error budget actif.
  • Réduction mesurable du bruit d'alerting et amélioration du MTTR.
  • Standards IaC et GitOps durcis et adoptés dans la squad.
  • Incidents P0/P1 gérés de bout en bout avec post mortems structurés.

**Mois 6**

  • Référent technique fiabilité de la squad.
  • Chantiers structurants pilotés : résilience, capacity planning, sécurité opérationnelle.
  • Contribution active à la communauté de pratiques au-delà de la squad.
  • Binôme opérationnel établi avec le Head of IT Operations : vous assurez la continuité des décisions techniques en son absence et vous co-pilotez les chantiers structurants.

Pourquoi NumSpot

  • Vous opérez une infrastructure critique pour la souveraineté numérique européenne : les problèmes sont réels, les enjeux aussi.
  • Votre squad possède le cycle complet du design au run : pas de silo ops, pas de ticket vers une équipe externe. Vous construisez ce que vous opérez.
  • Organisation jeune (créée en 2023, environ 80 personnes) : vos décisions techniques ont un impact immédiat et visible sur le produit.
  • Le contexte de certification (HDS, SecNumCloud en cours) développe une expertise rare et valorisée sur le marché.
  • Stack cloud native open source sur des environnements hybrides et bare metal.

This is an external listing. JobSpring does not represent or verify the employer. Report this listing