Site Reliability Engineer (Palermo)

Site Reliability Engineer (Palermo)

30 ago
|
agap2 Italia
|
Palermo

30 ago

agap2 Italia

Palermo

ppSiamo alla ricerca di un bSite Reliability Engineer /bmotivato a contribuire alla scalabilità e all’ottimizzazione di una complessa binfrastruttura Cloud in produzione su Azure. /b /p pSi tratta di un sistema distribuito progettato per raccogliere, gestire e distribuire grosse moli di dati in tempo reale. Include componenti connessi “at the edge” che devono essere in grado di operare in scenari “offline” e garantire “eventual consistency” dei dati. La lingua di lavoro principale è l’inglese, dato che il sistema è utilizzato da clienti internazionali. /p pIl ruolo richiede un forte focus sull’affidabilità, la scalabilità, la sicurezza e la resilienza dell’infrastruttura, con un utilizzo intensivo di bAzure Kubernetes Service (AKS) /b, bAzure Database for PostgreSQL /b, bMongoDB Atlas /b ed bApache Kafka /b. /p pIl candidato deve inoltre essere disponibile a partecipare alla turnazione on-call, ovviamente remunerata e concordata per essere distribuita equamente nel mese, per la gestione di emergenze e incidenti fuori orario lavorativo standard. /p pNon è necessario avere esperienza approfondita su tutti i tool utilizzati: siamo pronti a offrire formazione tramite corsi e “training on the job” per colmare eventuali lacune e supportare la crescita professionale. /p h3Responsabilità principali /h3 ul liMigliorare la resilienza ed ottimizzare il cluster Kubernetes (AKS su Azure), assicurando performance, scalabilità, sicurezza ed alta affidabilità dei servizi deployati /li liConfigurare ed ottimizzare i database relazionali (PostgreSQL su Azure) e non relazionali (MongoDB Atlas) per garantire performance,



affidabilità e sicurezza dei dati /li liGestire e ottimizzare Apache Kafka (su AKS) per la raccolta e distribuzione di dati in tempo reale /li liAutomatizzare processi operativi per ridurre il “toil” e migliorare l’efficacia dei team (Platform team e Product team) /li liPartecipare alla turnazione on-call per garantire una rapida risposta agli incidenti e alle emergenze /li liSviluppare pipeline di monitoraggio e alerting per identificare e debuggare rapidamente problemi operativi /li liIdentificare prontamente la “root cause” di problemi bloccanti, sviluppando documentazione tecnica dettagliata ed automazioni per evitare che problemi noti si verifichino nuovamente /li liCollaborare con il team di sviluppo per il miglioramento continuo del ciclo di vita dello sviluppo software (SDLC), garantendo pratiche solide e coerenti /li liLaurea in Informatica, Ingegneria o esperienza equivalente /li li3+ anni di esperienza con infrastrutture Cloud, preferibilmente Azure /li liEsperienza con sistemi distribuiti e principi di alta scalabilità e resilienza per applicazioni cloud-native /li liEsperienza consolidata in ambienti Linux, inclusa la gestione e il debugging di problemi di networking (DNS, Load Balancer, firewall e VPN)



/li liEsperienza con tool di monitoraggio e logging (Prometheus, Grafana, Azure Monitor, etc.) /li liEsperienza nella creazione di automazioni (Python, Bash, Terraform) per migliorare i processi operativi, secondo il paradigma Infrastructure-as-Code (IaC) /li liFamiliarità con i principi di Site Reliability Engineering, inclusi SLO, SLA ed “error budgets” /li liDisponibilità a partecipare alla turnazione on-call in reperibilità /li liBuona conoscenza della lingua inglese, scritta e parlata, obbligatoria per l’interazione con clienti internazionali /li liEsperienza nell’implementazione delle best practices di sicurezza su sistemi distribuiti, dalla configurazione di rete alla gestione dei segreti, fino alla scansione automatica per l’identificazione di vulnerabilità note /li liEsperienza con database relazionali (PostgreSQL) e non relazionali (MongoDB) /li liEsperienza con Apache Kafka e conoscenza dei concetti base di stream processing distribuito /li liEsperienza con CI/CD (Jenkins, Gitlab, etc.) /li liFamiliarità con architetture di microservizi e metodologie DevOps/GitOps /li liEsperienza di progettazione e sviluppo di sistemi distribuiti real-time e fault-tolerant /li liOpportunità di lavorare su infrastrutture cloud-native moderne, resilienti e scalabili, in un contesto di stream processing ed edge computing /li liForte attenzione alla cura delle persone, guidata dai nostri valori aziendali di intraprendenza, curiosità, cura e onestà /li liAmbiente collaborativo e stimolante, “remote friendly”, orientato alla crescita competente e personale /li /ul /p #J-18808-Ljbffr

📌 Site Reliability Engineer (Palermo)
🏢 agap2 Italia
📍 Palermo

Candidati a questo annuncio

Mostra le tue capacità professionali all'azienda, compila il form e lascia un tocco personale nella lettera di presentazione, aiuterà il recruiter nella scelta del candidato.

Iscriviti a questa job alert:

Ricevi via email le nuove offerte di lavoro per: site reliability engineer (palermo) / palermo