CDISaint jean de braye (Hybride)

Ingénieur observabilité, fiabilité et support de production : supervision, prometheus grafana splunk

Hybride
Votre mission consiste à garantir la disponibilité, la performance, la résilience et l'observabilité du Système d'Information.

Vous interviendrez sur les activités suivantes :
- Dispositif 24/7 : En astreinte du lundi au vendredi de 18h30 à 0h30 et le samedi et dimanche de 8h à 19h (1 semaine sur 5)
- Assurer le maintien en conditions opérationnelles des services, infrastructures et plateformes conformément aux objectifs de disponibilité et de qualité de service ;
- Participer au dispositif d'astreinte selon un roulement d'une semaine toutes les cinq semaines, incluant les soirs, week-ends et jours fériés ;
- Surveiller et analyser les événements, alertes et incidents de production, assurer leur diagnostic, leur traitement et leur coordination avec les équipes concernées ;
- Anticiper les incidents par l'analyse des tendances, des capacités, des signaux faibles et des risques identifiés sur les plateformes ;
- Réaliser les analyses post-incidents, identifier les causes racines et piloter les plans d'actions de fiabilisation ;
- Maintenir et faire évoluer les tableaux de bord, indicateurs, et alertes d'observabilité ;
- Réduire le bruit opérationnel en optimisant les règles d'alerting et en réduisant le volume d'alertes non pertinentes ;
- Participer aux cellules d'incident, de crise et aux démarches d'amélioration continue de la production ;
- Contribuer à l'automatisation, à l'industrialisation et à la simplification des activités d'exploitation ;
- Maintenir et enrichir la documentation, les procédures et les référentiels de l'activité.

Les compétences suivantes constituent des prérequis :
- Maîtrise des concepts et pratiques Site Reliability Engineering (SRE) ;
- Très bonne maîtrise des outils de supervision, monitoring, gestion des logs, trace, métriques et alerting ;
- Aisance dans les environnements conteneurisés et orchestrés (Docker, Kubernetes ou technologies équivalentes) ;
- Bonne compréhension des architectures distribuées, microservices et infrastructures modernes ;
- Expérience de l'automatisation et des pratiques DevOps ;
- Capacité à diagnostiquer et résoudre des incidents complexes ;
- Aptitude à travailler en coordination avec plusieurs équipes techniques.

Environnement Technique :
Outils de Supervision (Prometheus, Grafana, Splunk)
Environnements Conteneurisés : Kubernetes
Système : Linux, Windows
SGBD : PostGreSQL, MariaDB
Socle applicatif : Jboss / Springboot
Scripting Python
Scripting Shell Linux
Architectures distribuées et infrastructures Cloud/Hybrides

Communication :
Capacités rédactionnelles : documentation technique, cahier des charges, communication et compte-rendu
Capacités relationnelles, écrites et orales (sens de l’écoute et du dialogue, conduite de réunion, négociation).

Environnement Méthodologie :
Gestion des événements, incidents et problèmes (ITIL / SRE)
Observabilité et fiabilité des systèmes
Agile / DevOps
Gestion de crise et incidents majeurs
Autonomie, travail collaboratif et partage de connaissances
Force de proposition et amélioration continue.

Informations de la mission :
  • Début de mission : 14/09/2026
  • Durée : 12 mois
  • Date de publication : 12/08/2026 15:16:29

Compétences recherchées

Prometheus (Indispensable)Grafana (Indispensable)Splunk (Indispensable)Kubernetes (Indispensable)Docker (Indispensable)Linux (Indispensable)Windows (Indispensable)PostgreSQL (Indispensable)MariaDB (Indispensable)JBoss (Indispensable)Springboot (Indispensable)Python (Indispensable)Shell (Indispensable)Observabilité (Indispensable)SRE (Indispensable)DevOps (Indispensable)supervision (Indispensable)prometheus grafana splunk (Indispensable)

Intéressé(e) ?

Rejoignez l'équipe et participez à nos projets ambitieux.