Skip to content
← Back to job listings

CLOUD - SRE STOCKAGE

Civils de la Défense - Ministère des Armées et des Anciens combattants · Le Kremlin-Bicêtre, Ile-de-France, France

External listingfull-time21 days ago

About The Role

Rejoignez notre équipe en tant que SRE Ceph. Vous serez responsable du déploiement, de l'exploitation et de l'optimisation des clusters Ceph en production, ainsi que de la conception et de l'évolution des architectures Ceph. Vous garantirez également l'isolation multi-tenant, le chiffrement et la conformité aux exigences de sécurité. Vous participerez à la gestion des incidents et aux astreintes.

  • Déployer, opérer et optimiser les clusters Ceph en production, y compris la gestion des OSDs, MONs, MGRs.
  • Concevoir et faire évoluer les architectures Ceph, y compris les CRUSH maps, les profils d'erasure coding, et les stratégies de pooling.
  • Participer à la gestion d'incidents (niveau N3/N4) et aux astreintes, et conduire des tests de résilience sur le cluster.
  • **Profil recherché**
  • Nous cherchons un SRE Ceph confirmé : 5 à 10 ans d'expérience en production sur des environnements de stockage distribué, avec une maîtrise avérée de Ceph en situation réelle.

Vous possédez de l'expérience professionnelle

  • Exploitation SRE de clusters Ceph à grande échelle : déploiement (Rook, cephadm), opération quotidienne, montée de version sans interruption de service ;
  • Gestion d'incidents N3/N4, tests de résilience (perte d'OSD, de rack, corruption silencieuse) et participation aux astreintes ;
  • Conception ou re-conception d'architectures Ceph : CRUSH maps, choix de profils d'erasure coding, stratégies de pooling et dimensionnement hardware adapté aux profils de charge ;
  • Stockage bloc en environnement Kubernetes et/ou VM : snapshots, réplication inter-sites, gestion du backup natif Ceph ;
  • Culture SRE appliquée au stockage distribué : pilotage par SLO/SLI, budgets d'erreur, RETEX structurés.

Vous disposez également des compétences techniques suivantes

  • Maîtrise avancée de Ceph (RADOS, RBD) : déploiement, tuning fin, diagnostic de performance, compréhension du protocole CRUSH ; capacité à lire et modifier des CRUSH maps, dimensionner des profils d'erasure coding (k+m, localité) et arbitrer les stratégies de pooling selon les profils de charge ;
  • Maîtrise de Linux avancé (I/O scheduler, hugepages, NUMA, optimisation réseau pour trafic de réplication) et d'une stack d'observabilité Ceph (métriques OSD, PG states, recovery throughput) ;
  • Maîtrise d'au moins un langage de programmation (Go, Python) et d'infrastructure-as-code (Terraform, Ansible) ;
  • Compréhension approfondie des fondamentaux : réplication vs erasure coding, consensus distribué (Paxos appliqué aux MONs Ceph), théorème CAP en contexte multi-sites ;
  • Très bonne connaissance sécurité : isolation multi-tenant, chiffrement at-rest/in-transit, gestion des secrets, capacité à dialoguer avec une chaîne SSI.

Vous êtes

  • Rigoureux : Capacité à concevoir et maintenir des infrastructures critiques avec une attention méticuleuse aux détails, particulièrement dans les aspects de sécurité et de reproductibilité ;
  • Innovant : Capacité à proposer des solutions techniques avancées et à implémenter des bonnes pratiques ;
  • Ancré dans une culture d'analyse factuelle et d'amélioration continue.

This is an external listing. JobSpring does not represent or verify the employer. Report this listing