
Senior Site Reliability Engineer (SRE
Senior SRE at Nebius, Amsterdam with Remote Europe; strong Linux/VM/observability focus.
The role is to join the Compute Node team at Nebius AI Cloud. The Compute Node team is responsible for building and operating the cluster scheduler and node-level services that run and manage virtual machines across all cloud regions. This role focuses on Linux systems engineering, virtualization and operational reliability. You will work close to the operating system and hypervisor, shaping how reliability and observability are embedded into the Compute platform. Your responsibilities will include: Ensure reliability, availability and performance of compute nodes running VMs; Analyze and debug Linux systems across user space and kernel space; Troubleshoot complex production issues involving CPU, memory, NUMA, cgroups and scheduling; Work hands-on with virtualization and containerization, primarily using QEMU/KVM and Linux-native technologies; Design and evolve observability as a core capability of the node layer: metrics, logs, traces, alerts, SLIs and SLOs; Lead incident response, root-cause analysis, and postmortems, driving long-term reliability improvements; Collaborate closely with platform, kernel/hypervisor, GPU and infrastructure teams to improve system design and operability. We expect you to have: Strong Linux expertise: deep understanding of Linux user space and kernel space; knowledge of kernel subsystems (scheduler, memory management, filesystems, cgroups, namespaces); clear understanding of system boundaries and constraints at different layers; Virtualization experience: hands-on experience with QEMU/KVM; understanding of VM lifecycle, performance characteristics and failure modes; Containerization knowledge: practical experience with containers, namespaces and cgroups; strong understanding of resource isolation and control; Strong debugging skills: ability to reason about complex system failures; structured, hypothesis-driven approach to incident analysis; SRE mindset: clear understanding of the SRE role in system design and operations; experience building and operating observability stacks, not just consuming them; ability to turn system behavior into actionable reliability signals. Nice to Have / Optional: Experience with Kubernetes internals or node-level components; Hands-on experience with low-level Linux debugging tools (e.g. perf, eBPF, ftrace, strace, kernel crash dumps); Familiarity with large-scale compute or bare-metal platforms; Contributions to open-source infrastructure or system software; Experience debugging hardware and driver-level issues, including GPUs, NVLink, InfiniBand. Benefits & Perks: Competitive compensation; Career growth and learning opportunities; Flexibility and ownership; Collaborative and innovative culture; Opportunity to work on impactful AI projects; International environment and talented teams. What’s it like to work at Nebius: Fast moving - Bold thinking - Constant growth - Meaningful impact - Trust and real ownership - Opportunity to shape the future of AI. Equal Opportunity Statement: Nebius is an equal opportunity employer. We are committed to fostering an inclusive and diverse workplace and to providing equal employment opportunities in all aspects of employment. We do not discriminate on the basis of race, color, religion, sex (including pregnancy), national origin, ancestry, age, disability, genetic information, marital status, veteran status, sexual orientation, gender identity or expression, or any other characteristic protected by applicable law. Applicants must be authorized to work in the country in which they apply and will be required to provide proof of employment eligibility as a condition of hire. If you need accommodations during the application process, please let us know.
Yllä oleva teksti on työnantajan alkuperäinen työpaikkakuvaus sellaisenaan poimittuna. Muut sivun tiedot, kuten palkka, vastuut ja vaatimukset, ovat järjestelmämme tulkintoja samasta tekstistä, eivät työnantajan erikseen vahvistamia. Pidä niitä siis parhaana tulkintanamme, ei varmistettuina tosiasioina.
Arvioitu 77 vertailukelpoisen ilmoituksen perusteella
- Varmistaa laskentaköntien VM-juoksun luotettavuus, saatavuus ja suorituskyky
- Analysoi ja vianpaiskaa Linux-järjestelmiä käyttäjätilasta ytimeen asti
- Vianmäärä tuotantohäiriöt, joissa CPU, muisti, NUMA, cgroups ja ajoitus vaikuttavat
- Työskentele suoraan virtualisoinnin ja konttien kanssa, ensisijaisesti QEMU/KVM:n ja Linuxin luonnollisten teknologioiden avulla
- Suunnittele ja kehitä observabilityn roolia nodelin varrella: mittarit, lokit, jäljet, hälytykset, SLIn ja SLOin
- Johtaa häiriövastaa, perimmäisten syiden analysointia ja post-mortemeja, edistäen pitkäaikaisia luotettavuusparannuksia
- Tiivis yhteistyö alustan, ydin/hypervisorin, GPU:n ja infrastruktuuritiimien kanssa järjestelmä- suunnittelun ja käytettävyyden parantamiseksi
- Vahva Linux-osaaminen: syvällinen ymmärrys Linuxin käyttäjätilasta ja ydintilasta
- ydinmoduulien alajärjestelmän tuntemus (suunnittelu, muistinhallinta, tiedostojärjestelmät, cgroups, namespace-tyypit)
- järjestelmärajat ja rajallisuudet eri kerroksissa
- Virtualisointikokemus: käytännön kokemusta QEMU/KVM:stä
- VM-elinkaaren, suorituskyvyn ominaisuuksien ja virhetilojen ymmärtäminen
- Containereiden tuntemus: käytännön kokemus konteista, namespaceista ja cgroupsista
- resurssien eristäminen ja hallinta
- Vankat debugging-taidot: kyky järkeillä monimutkaisista järjestelmävirheistä
- hypoteesikeskeinen tapa analysoida häiriötilanteita
- SRE-mentaliteetti: selkeä ymmärrys SRE-roolista järjestelmäarkkitehtuurissa ja operoinneissa
- kokemus observability-kerrosten rakentamisesta ja käyttämisestä
- kyky muuttaa järjestelmän käyttäytyminen käyttökelpoisiksi luotettavuus-signaaleiksi
- Toivottu: Kubernetesin sisäisen toiminnan tai solmukohtien tuntemus
- Käytännön kokemus matalan tason Linux-debug-työkaluista (esim. perf, eBPF, ftrace, strace, kernel crash dumps)
- Kokemus suurimittakaavaisista laskentakohteista tai bare-metal -alustoista
- Avoimen lähdekoodin infrastruktuuriin tai järjestelmäohjelmistoon kontribuutiot
- Kokemus laitteiston ja laiteajurin virheiden, mukaan lukien GPUs, NVLink, InfiniBand, vianmäärityksestä
| Sijainti | Aktiiviset ilmoitukset |
|---|---|
| Etätyö - Globaali | 392 |
| Etätyö - Eurooppa | 203 |
| Amsterdam, Alankomaat | 65 |
| Etätyö - Yhdysvallat | 30 |
| Berliini, Saksa | 21 |
| Lontoo, Yhdistynyt kuningaskunta | 20 |
| Lappeenranta, Suomi | 12 |
| Amsterdam, Netherlands | 11 |
| Helsinki, Suomi | 10 |
| Praha, Tšekki | 10 |
| Amsterdam | 9 |
| Israel | 9 |
| Yhdistynyt kuningaskunta | 8 |
| Mäntsälä, Suomi | 8 |
| Praha, Tšekin tasavalta | 7 |
| Amsterdami, Alankomaat | 7 |
| Etätyö - Europa | 7 |
| Etätyö - Suomi | 6 |
| Lontoo | 4 |
| Mäntsälä, Finland | 4 |
| Kanada | 4 |
| Lontoo, Iso-Britannia | 4 |
| Béthune, Pas-de-Calais | 3 |
| Etätyö · Singapore | 3 |
| Saksa · Remote - Eurooppa | 3 |
| Singapore | 3 |
| Kanada · Remote - Yhdysvallat | 3 |
| New York City, Yhdysvallat | 2 |
| Iso-Britannia | 2 |
| Ranska · Pariisi | 2 |
| Austin, Yhdysvallat | 2 |
| Philadelphia, Pennsylvania | 2 |
| Abu Dhabi | 2 |
| Pariisi, Ranska | 2 |
| Ranska, Pariisi | 2 |
| Tel Aviv, Israel | 2 |
| Oklahoma | 2 |
| New Jersey, Yhdysvallat | 2 |
| Alankomaat | 2 |
| Dubai | 2 |
| New Jersey | 2 |
| Abu Dhabi · Dubai | 2 |
| London, Yhdistynyt kuningaskunta | 2 |
| Praha, Tsekki | 1 |
| Praha, Tshekkia | 1 |
| Etätyö - Saksa | 1 |
| Béthune, Pas-de-Calais, Ranska | 1 |
| Pariisi | 1 |
| Oklahoma, Yhdysvallat | 1 |
| Singapore, Singapore | 1 |
| San Francisco Bay Area, Yhdysvallat | 1 |
| Etätyö - Globaalisti | 1 |
| Kansas City, Yhdysvallat | 1 |
| Abu Dhabi, Yhdistyneet arabiemiirikunnat | 1 |
| Dallas, Yhdysvallat | 1 |
| Praha | 1 |
| Berlin, Saksa | 1 |
| Berlin | 1 |
| Etätyö - Ruotsi | 1 |
| Abu Dhabi, Dubai | 1 |
| London | 1 |
| Praha, Tähät | 1 |
| Lontoo, Yhdistyneet kuningaskunnat | 1 |
| Praha, Tsekin tasavalta | 1 |
| Lontoossa, Yhdistynyt kuningaskunta | 1 |
| Lontoo, Britannia | 1 |
| Alabama, Yhdysvallat | 1 |
| Etätyö - Ranska | 1 |
| Suomi | 1 |
| Puola | 1 |
| Etätyö - Alankomaat | 1 |
| Etätyö - Iso-Britannia | 1 |
| Mäntsälä | 1 |
| Kanada, Remote - Yhdysvallat | 1 |
| Praha, Tjeckien | 1 |
| East London, Yhdistynyt kuningaskunta | 1 |
| Austin, Texas | 1 |
| Tšekki | 1 |
| Etätyö - Yhdistynyt kuningaskunta | 1 |
| Minnesota | 1 |
| Amsterdamin, Alankomaat | 1 |
| Kalifornia, Yhdysvallat | 1 |
| Béthune, Ranska | 1 |
| Minnesota, Yhdysvallat | 1 |
| Philadelphia, Yhdysvallat | 1 |
| Tel Aviv, Israël | 1 |
| Etätyö - Maailmanlaajuinen | 1 |
| Etä | 1 |
| Yhdysvallat? | 1 |
| Etätyö - EU | 1 |
| Belgrad, Serbia | 1 |
| Saksa? | 1 |
| Roolityyppi | Aktiiviset ilmoitukset |
|---|---|
| Backend-insinööri | 188 |
| Ohjelmistoinsinööri | 71 |
| Account Executive | 57 |
| Backend-insinöri | 54 |
| Backend-kehittäjä | 38 |
| Myyntiedustaja | 29 |
| Tuotepäällikkö | 19 |
| Tekninen ohjelmapäällikkö | 7 |
| Järjestelmäinsinööri | 6 |
| Ohjelmistokehittäjä | 5 |
| ML-insinööri | 5 |
| Tekninen tuotepäällikkö | 4 |
| Tekninen projektipäällikkö | 3 |
| Ohjelmistosuunnittelija | 3 |
| Backend Engineer | 3 |
| Toimitusjohtaja | 3 |
| Data Center Operations Technician | 3 |
| Senior Site Reliability Engineer | 3 |
| Back-end-insinööri | 2 |
| Senior ML Engineer | 2 |
| Backend-insinäri | 2 |
| Senior Hypervisor Engineer | 2 |
| Backend-insinääri | 2 |
| Kehitysjohtaja | 2 |
| Avoimet työpaikat Nebiusilla | 2 |
| Projektipäällikkö | 2 |
| IT-teknikko | 2 |
| Ratkaisujen Arkkitehti Johtaja | 1 |
| Seniot tekninen projektipäällikkö | 1 |
| ML-infrastruktuuri-insinööri | 1 |
| Kuljetusturvallisuusjohtaja | 1 |
| Rakennetu kaapelointisuunnittelun insinööri | 1 |
| Backend-ohjelmistokehittäjä | 1 |
| Koulutuksen suunnittelija | 1 |
| Viestintäjohtaja | 1 |
| Hinnoittelun johtaja | 1 |
| Infrastruktuuriturvallisuusinsinööri | 1 |
| Data Scientist | 1 |
| Data Center IT Manager | 1 |
| SRE-insinööri | 1 |
| ML Solutions-arkkitehti | 1 |
| Verkon suunnittelun projektipäällikkö | 1 |
| Henkilöstöasiantuntija | 1 |
| Sovellusturvallisuusinsinööri | 1 |
| Tekninen due diligence -johtaja | 1 |
| Mekaaninen datakeskusoperaattori | 1 |
| Data Center Operations Manager | 1 |
| Microsoft 365-asiantuntija | 1 |
| Datakeskuksen tilojen johtaja | 1 |
| Senior HPC Cluster Engineer | 1 |
| IT-infrastruktuuri-insinööri | 1 |
| Senior Software Engineer | 1 |
| Datakeskuksen sähköjohtaja | 1 |
| Sähköinsinööri | 1 |
| Detektionin suunnittelun ja reagoinnin johtaja | 1 |
| Tietokeskuksen logistiikkaspecialisti | 1 |
| Hypervisor Engineer | 1 |
| Fyysinen turvallisuusjärjestelmäasentaja | 1 |
| Site Reliability Engineer | 1 |
| Strategisen myynnin johtaja | 1 |
| Kokenut backend-kehittäjä | 1 |
| Ratkaisujen arkkitehtuurin johtaja | 1 |
| HPC-klusterinsinööri | 1 |
| Vanhempi Site Reliability Engineer | 1 |
| Tekninen tukihenkilö? (verify) | 1 |
| Senior Verkkoinfrastruktuuri-insinööri | 1 |
| Käytännön Tekninen Projektipäällikkö | 1 |
| Kirjanpitäjä | 1 |
| Toimittajaturvallisuus ja standardit -johtaja | 1 |
| Technical Product Manager | 1 |
| Tuotekasvuanalyysin vetäjä | 1 |
| Partner GTM Suunnittelu ja Analytiikka | 1 |
| Sovellettavat tekoälyn ratkaisujen insinööri | 1 |
| Kumppanuuksien liiketoiminnan kehitysjohtaja | 1 |
| IT-tuki-johtaja | 1 |
| Tuotesuunnittelija | 1 |
| Koneinsinööri | 1 |
| Sääntelyneuvoja | 1 |
| ML-ratkaisujen arkkitehti | 1 |
| Tuotejohtaja | 1 |
| Pilvikonela Arkkitehti | 1 |
| Haavoittuvuuksien hallinnan johtaja | 1 |
| Tekninen tilinhallitseja | 1 |
| Specialist Solutions Architect | 1 |
| Paikkavalinta- ja Colocation-johtaja | 1 |
| Datakeskuksen teknikko | 1 |
| GTM rekrytointipäällikkö | 1 |
| IT-tekniikko | 1 |
| Senior HPC-klusterinsinööri | 1 |
| Backend-insinöörit | 1 |
| Johtaja taloudellisessa raportoinnissa | 1 |
| Soveltava tekoälytutkija | 1 |
| Tuotemuotoilija | 1 |
| Sovellusintegraattori | 1 |
| Toimintojen asiantuntija | 1 |
| Kokenut tukija-insinööri | 1 |
| Software Engineer | 1 |
| Partner-ratkaisujen arkkitehti | 1 |
| Koulutussisällön kirjoittaja | 1 |
| Data-analyytikko | 1 |
| Roolitaso | Aktiiviset ilmoitukset |
|---|---|
| Keskitaso | 505 |
| Senior-taso | 101 |
| Manageri | 27 |
| Esimies | 7 |
| Johto | 3 |
| Ylin johto | 1 |
| Harjoittelija | 1 |
Älä missaa yhtään uutta Site Reliability Engineer-työpaikkaa alueella Etätyö - Eurooppa
Ilmainen viikoittainen tai päivittäinen kooste. Voit peruuttaa milloin vain.
Samankaltaisia työpaikkoja
JobCrawls-haun tuloksia: sama tehtävänimike ja ensisijainen sijainti kuin tässä ilmoituksessa (tämä työpaikka on rajattu pois). Enintään 8 tulosta.



