
ML-systemingenjör - Nebius B.V. - Palo Alto, USA
Tryck på det här kortet för lönediagram och fullständiga ersättningsdetaljer.
Expandera för full lönekontext
Se marknadsposition, jämförelsegraf för lönespann och lokaliserad lönenarrativ.
Jobbeskrivning
Nebius Token Factory bygger en AI-tränings- och modellefterträningskapacitet för förbättring av frontier-modeller. Denna roll äger infrastrukturen som gör storskalig träning och RL-experiment möjliga, pålitliga, reproducerbara och effektiva. Arbetet ligger i skärningspunkten mellan distribuerade system, GPU-prestanda, ramverk för modellträning, RL-pipelines och produktionsteknik. En Senior ML-systemingenjör äger betydande tränings- eller RL-infrastrukturkomponenter från början till slut. De är mycket praktiskt lagda, kan felsöka svåra distribuerade träningsfel självständigt och kan leverera mätbara förbättringar i experimentgenomströmning, stabilitet och GPU-utnyttjande. Dina ansvarsområden: - Bygga och underhålla distribuerad träningsinfrastruktur för SFT, fortsatt förträning, preferensoptimering och RL-arbetsbelastningar. - Integrera och utöka ramverk som Megatron-LM, DeepSpeed, PyTorch FSDP/DTensor, Ray, verl, slime, AReaL, OpenRLHF eller motsvarande interna system. - Implementera och felsöka parallelliseringsstrategier inklusive tensor-, pipeline-, sekvens/kontext-, expert- och dataparallellism. - Bygga pålitliga komponenter för utrullning, servering av belöningsmodeller, replay/databuffert, checkpointing, utvärdering och experimentorkestrering för RL-träning. - Profilera och förbättra GPU-utnyttjande, kommunikationseffektivitet, minnesanvändning och träningsgenomströmning. - Diagnostisera fel i NCCL, CUDA, PyTorch, Ray, schemaläggare, lagring, nätverk och checkpointing-lager. - Skapa reproducerbara träningskörningar, startskript, instrumentpaneler, runbooks och operationella verktyg för forskaranvändare. - Samarbeta med forskare för att omvandla algoritmiska träningsrecept till skalbara, felsökbara system. - Skriva tydliga designdokument, incidentrapporter, benchmarkrapporter och driftsguider. Krav: - Starka kunskaper i Python och PyTorch-teknik. - Praktisk erfarenhet av distribuerad modellträning, storskaliga ML-system eller GPU-klusterbelastningar. - Praktisk förståelse för flaskhalsar vid transformatorträning, minnestryck, gradient/optimerarstatus, kommunikationskostnader och checkpointing. - Erfarenhet av att felsöka produktions- eller forskningsträningsjobb över flera GPU:er eller noder. - Förmåga att resonera kvantitativt kring genomströmning, utnyttjande, minne, tillförlitlighet, kostnad och forskningshastighet. - Starka kommunikationsfärdigheter och förmåga att samarbeta med forskare, ML-ingenjörer, plattformsingenjörer och ledning. Meriterande: - Erfarenhet av Megatron-LM, DeepSpeed, PyTorch FSDP/DTensor, Ray, Slurm, Kubernetes eller stora interna träningsplattformar. - Erfarenhet av RL-infrastrukturramverk som verl, slime, AReaL, OpenRLHF, TRL eller anpassade PPO/GRPO/RLHF-system. - Bekantskap med NCCL, CUDA, Triton, Nsight, InfiniBand, RDMA, RoCE, H100/H200/B200-kluster eller lagrings-/nätverksflaskhalsar. - Erfarenhet av att stödja SFT, DPO, PPO, GRPO, RLAIF, servering av belöningsmodeller, generering av utrullningar eller agentträningsarbetsbelastningar. - Bidrag till open source inom distribuerad träning, RL-infrastruktur, PyTorch, Ray, Megatron, DeepSpeed eller relaterade system.
Företagsinformation
| Plats | Aktiva annonser |
|---|---|
| Distans - Globalt | 558 |
| Distans - Europa | 41 |
| Distans - Suomi | 20 |
| Amsterdam, Nederländerna | 17 |
| Remote - Europa | 15 |
| Berlin, Tyskland | 12 |
| Helsingfors, Finland | 11 |
| Remote - USA | 11 |
| Mäntsälä, Finland | 11 |
| London, Storbritannien | 8 |
| Distans - Finland | 5 |
| Amsterdam | 5 |
| Distans - Yhdysvallat | 5 |
| Israel | 4 |
| Kanada | 4 |
| Singapore | 3 |
| London | 2 |
| Frankrike, Paris | 2 |
| Amsterdam, Nederland | 2 |
| New Jersey, USA | 2 |
| Abu Dhabi | 2 |
| Dubai | 2 |
| Storbritannien | 2 |
| Minnesota, USA | 1 |
| Nederländerna | 1 |
| Praha | 1 |
| Tšekki | 1 |
| Berlin, Deutschland | 1 |
| Abu Dhabi, Förenade Arabemiraten | 1 |
| Fjärrarbete | 1 |
| Prag, Tjeckien | 1 |
| Kanada, Remote - USA | 1 |
| Dallas, USA | 1 |
| New York City, USA | 1 |
| Fjärr - Europa | 1 |
| Philadelphia, USA | 1 |
| Distans | 1 |
| Béthune, Pas-de-Calais, Frankrike | 1 |
| Remote - Yhdysvallat | 1 |
| San Francisco Bay Area, USA | 1 |
| Alabama, USA | 1 |
| Austin, USA | 1 |
| Distans - Förenta staterna | 1 |
| Distans - Singapore | 1 |
| Austin, Texas | 1 |
| East London, Storbritannien | 1 |
| Singapore, Singapore | 1 |
| Berlin | 1 |
| Remote - Förenta staterna | 1 |
| Distans - Mellanöstern | 1 |
| Distans - Nordamerika | 1 |
| Distans - Frankrike | 1 |
| Tel Aviv, Israel | 1 |
| Remote | 1 |
| Remote - Global | 1 |
| Distans - Benelux | 1 |
| Béthune, Frankrike | 1 |
| Paris, Frankrike | 1 |
| Remote - Asien | 1 |
| Kansas City, USA | 1 |
| Finland | 1 |
| Kalifornien, USA | 1 |
| Distans - DACH | 1 |
| Oklahoma, USA | 1 |
| Paris | 1 |
| Fjärr - USA | 1 |
| Abu Dhabi, Dubai | 1 |
| Rolltyp | Aktiva annonser |
|---|---|
| Backend-ingenjör | 241 |
| Backendutvecklare | 81 |
| Backend-Insinör | 81 |
| Account Executive | 76 |
| Systemutvecklare | 72 |
| Backend-insinöri | 21 |
| Backend-insinör | 20 |
| Backendingenjör | 12 |
| Backend-Insinööri | 10 |
| Backend-Insinär | 5 |
| Säljare | 4 |
| Backend Engineer | 4 |
| Produktchef | 3 |
| Backend-insinääri | 3 |
| Backend-insin F6ri | 2 |
| Lediga tjänster hos Nebius | 2 |
| Backendingenjörer, Frontendingenjörer, Site Reliability Engineers | 2 |
| Backend-insinär | 2 |
| Datacenter Logistikspecialist | 1 |
| Dataingenjör | 1 |
| Backendingenjörer | 1 |
| Datacenter IT-tekniker | 1 |
| HR-specialist | 1 |
| Vice President för utvecklarrelationer och community | 1 |
| Datacenter Operations Technician | 1 |
| Backend-insinööri | 1 |
| Data Center IT Manager | 1 |
| Data Center Operations Technician | 1 |
| Chef för Kanalmarknadsföring | 1 |
| Data Scientist | 1 |
| Operatörsspecialist | 1 |
| Revisor | 1 |
| Backend-Insin F6r | 1 |
| Systemingenjör | 1 |
| Rollnivå | Aktiva annonser |
|---|---|
| Medelnivå | 561 |
Nebius B.V. finns med i 788 indexerade jobbannonser i JobCrawls Finlandsdata sedan oktober 2023. I det historiska indexet är de starkaste platssignalerna för den här arbetsgivaren Distans - Globalt, Distans - Europa, och Distans - Suomi.
Visade data baseras på historiska jobbannonser från vår databas.
Jobbdetaljer
Ansvarsområden
- Bygga och underhålla distribuerad träningsinfrastruktur för SFT, fortsatt förträning, preferensoptimering och RL-arbetsbelastningar
- Integrera och utöka ramverk som Megatron-LM, DeepSpeed, PyTorch FSDP/DTensor, Ray, verl, slime, AReaL, OpenRLHF eller motsvarande interna system
- Implementera och felsöka parallelliseringsstrategier inklusive tensor-, pipeline-, sekvens/kontext-, expert- och dataparallellism
- Bygga pålitliga komponenter för utrullning, servering av belöningsmodeller, replay/databuffert, checkpointing, utvärdering och experimentorkestrering för RL-träning
- Profilera och förbättra GPU-utnyttjande, kommunikationseffektivitet, minnesanvändning och träningsgenomströmning
- Diagnostisera fel i NCCL, CUDA, PyTorch, Ray, schemaläggare, lagring, nätverk och checkpointing-lager
- Skapa reproducerbara träningskörningar, startskript, instrumentpaneler, runbooks och operationella verktyg för forskaranvändare
- Samarbeta med forskare för att omvandla algoritmiska träningsrecept till skalbara, felsökbara system
- Skriva tydliga designdokument, incidentrapporter, benchmarkrapporter och driftsguider
Krav
- Starka kunskaper i Python och PyTorch-teknik
- Praktisk erfarenhet av distribuerad modellträning, storskaliga ML-system eller GPU-klusterbelastningar
- Praktisk förståelse för flaskhalsar vid transformatorträning, minnestryck, gradient/optimerarstatus, kommunikationskostnader och checkpointing
- Erfarenhet av att felsöka produktions- eller forskningsträningsjobb över flera GPU:er eller noder
- Förmåga att resonera kvantitativt kring genomströmning, utnyttjande, minne, tillförlitlighet, kostnad och forskningshastighet
- Starka kommunikationsfärdigheter och förmåga att samarbeta med forskare, ML-ingenjörer, plattformsingenjörer och ledning
Kompetenser och tekniker
