Talent Apply
Log in
All jobs
O

SRE Cloud Native H/F/N

OVHcloud
Lyon, France; Roubaix, France; Nantes, France; Brest, France; Toulouse, France
On-site

About this role

About the Role

Intégrez l’équipe #OneTeam de la Product Unit Public Cloud pour concevoir, faire évoluer et exploiter nos offres Cloud Native (Managed Private Registry, Managed Rancher Service) sur des plateformes Kubernetes hautement disponibles et scalables. En tant que SRE expérimenté, vous garantissez la stabilité des produits et la haute disponibilité des services, et vous participez à l’industrialisation et à l’automatisation des mécanismes de fiabilité. Vous intégrez des pratiques de développement augmentées par l’IA générative au quotidien et, après formation, la rotation d’astreinte pour assurer la continuité de service. What You'll Do

  • Garantir la disponibilité, la performance et la résilience de la plateforme haute disponibilité.

  • Concevoir, faire évoluer et maintenir des architectures distribuées robustes, scalables et sécurisées.

  • Développer des mécanismes d'automatisation, de supervision et d'auto-remédiation (Infrastructure as Code, Controller Kubernetes).

  • Définir et faire évoluer les pratiques de supervision, d'observabilité et d'AI Ops (métriques, logs, alerting, tracing distribué, détection d'anomalies, corrélation d'événements et analyse prédictive).

  • Participer aux analyses d'incidents majeurs, implémenter les actions correctives durables et exploiter les capacités de l'IA pour accélérer l'identification des causes, la résolution des incidents et l'amélioration continue de la fiabilité du produit.

  • Après formation, intégrer la rotation d’astreinte de l’équipe afin d’assurer la continuité de service. What We're Looking For

  • Expérience en SRE Cloud Native et capacité à intervenir au cœur de Kubernetes.

  • Maîtrise des architectures distribuées, de l'Infrastructure as Code et des controllers Kubernetes.

  • Compétences en supervision, observabilité et AI Ops (métriques, logs, alerting, tracing, détection d’anomalies).

  • Expérience dans l’analyse d’incidents majeurs et dans l’action corrective durable; capacité à utiliser l’IA pour accélérer la résolution et l’amélioration continue.

  • Esprit d’équipe et capacité à gérer les astreintes.

  • Intérêt pour l’intégration de l’IA générative dans les pratiques de développement et d’opérations. Nice to Have

  • Connaissance des offres Cloud Native OVHcloud (Managed Private Registry, Managed Rancher Service) et des environnements Kubernetes à grande échelle.

  • Connaissance des concepts d’AI Ops et de l’IA générative appliqués à l’ingénierie des fiabilités. Compensation & Benefits

  • Non spécifié

Your next opportunity starts here

Prepare, apply, track, interview and get hired — all from one platform, with AI in your corner.

Download app

Or sponsor Premium for someone who's job hunting →