About this role
Job title: Senior SRE - Kubernetes managé
About the Role
Au sein de la Product Unit Public Cloud et plus particulièrement l'équipe en charge de la conception, de l'évolution et de l'exploitation de notre offre Kubernetes managé, vous assurez la fiabilité et l'évolutivité de la plateforme. Vous interviendrez au cœur du fonctionnement de Kubernetes pour garantir la stabilité et la performance en environnement de production distribué. Chez OVHcloud, l'IA générative est intégrée à nos pratiques pour concevoir, développer, tester et documenter.
What You'll Do
-
Garantir la disponibilité, la performance et la résilience de la plateforme haute disponibilité.
-
Concevoir, faire évoluer et maintenir des architectures distribuées robustes, scalables et sécurisées.
-
Développer des mécanismes d'automatisation, de supervision et d'auto-remédiation (Infrastructure as Code, scripts, controllers Kubernetes).
-
Contribuer à l'industrialisation, à l'automatisation et à l'amélioration continue des mécanismes de fiabilité.
-
Définir et faire évoluer les pratiques de supervision, d'observabilité et d'AIOps (métriques, logs, alerting, tracing distribué, détection d'anomalies, corrélation d'événements et analyse prédictive).
-
Participer aux analyses d'incidents majeurs, implémenter les actions correctives durables et exploiter les capacités de l'IA pour accélérer l'identification des causes racines.
-
Intégrer la rotation d'astreinte de l'équipe afin d'assurer la continuité de service à nos clients (après une période de formation et de montée en compétence).
-
What We're Looking For
-
Solides connaissances des technologies IaaS (réseau, load balancing, etc.), des serveurs, du stockage, de la virtualisation et des infrastructures distribuées.
-
Maîtrise de l'environnement GNU/Linux (Debian-like) et connaissance du fonctionnement interne de Kubernetes (client ou administrateur).
-
Expérience solide en automatisation d'infrastructure (Infrastructure as Code) et en scripting (Golang/Python, Bash).
-
Connaissances approfondies des principes de supervision, d'observabilité et des outils de tracing système.
-
Intégration native des règles de sécurité informatique dans les déploiements.
-
Autonomie, capacité d'adaptation à un contexte technologique changeant et à un environnement à forte criticité.
-
C'est un +: expérience en prompt engineering et compréhension des chaînes agentiques ou des workflows autonomes (orchestration d'agents, gestion d'outils/fonctions, boucles de rétroaction).
-
Nice to Have
-
Vous avez déjà une expérience en prompt engineering et une bonne compréhension des principes des chaînes agentiques ou des workflows autonomes (orchestration d'agents, gestion d'outils/fonctions, boucles de rétroaction).
-
Compensation & Benefits
-
Une politique de télétravail hybride
-
Un plan d'actionnariat salarié
-
Un programme de reconnaissance de l'ancienneté
-
Des subventions vacances et sport
-
Berceau et crèche d'entreprise (selon site)
-
Des équipes multiculturelles
-
Des locaux bien équipés
-
Une plateforme de formation et de certification en ligne
-
Une offre d'accompagnement médical et social digitalisée pour vous et votre famille