
Site Reliability Engineering Manager
SRE-johtajat toimivat merkittävin autonomiella ja ovat vastuussa koko palvelualueen toiminnallisesta menestyksestä, tuotepohjaisesta alustasta tai palvelujen kokoelmasta. He tasapainottavat henkilöstö- ja teknisen johtamisen sekä operatiivisen omistajuuden, vaikuttaen säännöllisesti prioriteetteihin pidemmällä aikavälillä tiiminsä ulkopuolella ja tekevät yhteistyötä kehitys- ja tuotejohtajien kanssa parantaakseen luotettavuutta, operatiivista tehokkuutta ja asiakkaiden tuloksia. Heidän odotetaan rakentavan järjestelmiä, prosesseja ja organisaatioita, jotka skaalautuvat.
Työn tiedot
Vastuualueet
- Ohjaa yhtä tai useampaa Site Reliability Engineers -tiimiä
- Vastaa käytettävissä olevasta luotettavuudesta, saatavuudesta, operatiivisesta erinomaisuudesta, automaatiostrategiasta ja teknisestä tehokkuudesta palvelualueellaan
- Vastaa käytettävissä olevasta, suorituskyvystä, skaalautuvuudesta ja operatiivisesta terveydestä
- Edistää SRE-käytäntöjen omaksumista mukaan lukien SLO:t, SLI:t, virtausarvot, onnettomuuksien hallinta ja operatiiviset katselmukset
- Omistaa luotettavuuden tiekartat ja tasapainottaa sijoitukset ominaisuuksien toimituksen, teknisen velan vähentämisen ja operatiivisen kestävyyden välillä
- Asettaa mitattavissa olevia operatiivisia tavoitteita ja jatkuvasti parantaa järjestelmän resilienssiä
- Suunnata ja kommunikoida tuki-ryhmien kanssa julkaisuista, automaatio muutoksista, SOP:ista ja tikettien hallinnasta
- Rakentaa korkeatasoisen tiimin palkkaamalla, ohjaamalla ja urakehityksen tukemalla
- Asettaa odotukset ja suorituskykystandardit organisaation tavoitteiden mukaisesti
- Kehittää tulevia johtajia tiimin sisällä
- Varmistaa teknisen erinomaisuuden suunnittelukatselujen, operatiivisten katselmusten ja hallinnon kautta
- Yhteistyö kehitys-, QA-, tuote- ja julkaisitiimien kanssa varmistamalla SRE-periaatteet
- Käyttää suunnitteluvaiheessa “shift left” -periaatteita suunnittelussa, kehityksessä ja toimituksessa
- Johtaa kriittisten incidenttien käsittelyä ja palautumistoimia
- Edistää syvällisiä jälkiselvityksiä ja automaatiota järjestelmäongelmien ratkaisemiseksi
- Poistaa turhaa työntekoa ohjelmistokehityksen ja alustaratkaisujen avulla
- Varmistaa uuden tuotteen/Palvelun käyttöönottovarmuuden
- Kääntää organisaation strategian toteuttamiskelpoisiksi tiekarteiksi ja kvartaaleittain asetettaviksi tavoitteiksi
- Työskentelee poikkitoiminnallisesti prioriteettien yhdenmukaamiseksi
- Ohjaa arkkitehtuuripäätöksiä, jotka parantavat luotettavuutta, skaalautuvuutta, turvallisuutta ja kustannustehokkuutta
- Johtaa useita samanaikaisia aloitteita eri tuotteiden ja alustojen yli
- Määrittää toimintamenettelyt, standardit ja parhaat käytännöt
- Toimii SRE:n edustajana johdon katselmuksissa ja asiakaspyyntöissä
- Osallistuu budjetointi- ja työvoimasuunnitteluun sekä organisaatiorakenteen suunnitteluun
Vaatimukset
- Kandidaatin tutkinto CS/tekniikka/informaatiojärjestelmät? tai vastaava käytännön kokemus
- Yleensä 8+ vuotta kokemusta ohjelmistokehityksestä, pilvi-infrastruktuurista, alustatekniikasta tai luotettavuustyöstä
- Vähintään 4 vuotta kokemusta pilviympäristöistä (Azure/AWS/GCP)
- Infrastruktuuri koodina (Terraform, Bicep, Ansible)
- Kubernetes ja konttitehtävät
- Näkymiä mittaus- ja telemetriikan työkalut
- CI/CD ja ohjelmistotoimit
- Vähintään 3 vuotta kokemusta insinöörien johtamisesta
- Kokemus tuotantopalveluiden operoinnista ja onnettomuuksien jälkikäsittelystä
- Kokemus onnettomuuksista, jälkiselvityksistä ja luotettavuuden parantamis-ohjelmista
Taidot ja teknologiat
Koulutustaso
Alempi korkeakoulututkinto
Aiheeseen liittyvät mahdollisuudet
Löydä lisää kiinnostuksen kohteisiisi ja taitoihisi sopivia mahdollisuuksia