Nebius B.V.-logotypen

ML-systemingenjör - Nebius B.V. - Palo Alto, USA

Publicerad: 24 juli 2026
Publicerad idag
Senast sedd i crawl: 23 juli 2026 (idag)
Beräknat utgångsdatum: 28 augusti 2026
Arbetsplats
Roll och ledning
Rollnivå:Senior
Personalansvarsnivå:Ingen personalhantering
Anställningsform
Erfarenhet
5 år

Jobbeskrivning

Nebius Token Factory bygger en AI-tränings- och modellefterträningskapacitet för förbättring av frontier-modeller. Denna roll äger infrastrukturen som gör storskalig träning och RL-experiment möjliga, pålitliga, reproducerbara och effektiva. Arbetet ligger i skärningspunkten mellan distribuerade system, GPU-prestanda, ramverk för modellträning, RL-pipelines och produktionsteknik. En Senior ML-systemingenjör äger betydande tränings- eller RL-infrastrukturkomponenter från början till slut. De är mycket praktiskt lagda, kan felsöka svåra distribuerade träningsfel självständigt och kan leverera mätbara förbättringar i experimentgenomströmning, stabilitet och GPU-utnyttjande. Dina ansvarsområden: - Bygga och underhålla distribuerad träningsinfrastruktur för SFT, fortsatt förträning, preferensoptimering och RL-arbetsbelastningar. - Integrera och utöka ramverk som Megatron-LM, DeepSpeed, PyTorch FSDP/DTensor, Ray, verl, slime, AReaL, OpenRLHF eller motsvarande interna system. - Implementera och felsöka parallelliseringsstrategier inklusive tensor-, pipeline-, sekvens/kontext-, expert- och dataparallellism. - Bygga pålitliga komponenter för utrullning, servering av belöningsmodeller, replay/databuffert, checkpointing, utvärdering och experimentorkestrering för RL-träning. - Profilera och förbättra GPU-utnyttjande, kommunikationseffektivitet, minnesanvändning och träningsgenomströmning. - Diagnostisera fel i NCCL, CUDA, PyTorch, Ray, schemaläggare, lagring, nätverk och checkpointing-lager. - Skapa reproducerbara träningskörningar, startskript, instrumentpaneler, runbooks och operationella verktyg för forskaranvändare. - Samarbeta med forskare för att omvandla algoritmiska träningsrecept till skalbara, felsökbara system. - Skriva tydliga designdokument, incidentrapporter, benchmarkrapporter och driftsguider. Krav: - Starka kunskaper i Python och PyTorch-teknik. - Praktisk erfarenhet av distribuerad modellträning, storskaliga ML-system eller GPU-klusterbelastningar. - Praktisk förståelse för flaskhalsar vid transformatorträning, minnestryck, gradient/optimerarstatus, kommunikationskostnader och checkpointing. - Erfarenhet av att felsöka produktions- eller forskningsträningsjobb över flera GPU:er eller noder. - Förmåga att resonera kvantitativt kring genomströmning, utnyttjande, minne, tillförlitlighet, kostnad och forskningshastighet. - Starka kommunikationsfärdigheter och förmåga att samarbeta med forskare, ML-ingenjörer, plattformsingenjörer och ledning. Meriterande: - Erfarenhet av Megatron-LM, DeepSpeed, PyTorch FSDP/DTensor, Ray, Slurm, Kubernetes eller stora interna träningsplattformar. - Erfarenhet av RL-infrastrukturramverk som verl, slime, AReaL, OpenRLHF, TRL eller anpassade PPO/GRPO/RLHF-system. - Bekantskap med NCCL, CUDA, Triton, Nsight, InfiniBand, RDMA, RoCE, H100/H200/B200-kluster eller lagrings-/nätverksflaskhalsar. - Erfarenhet av att stödja SFT, DPO, PPO, GRPO, RLAIF, servering av belöningsmodeller, generering av utrullningar eller agentträningsarbetsbelastningar. - Bidrag till open source inom distribuerad träning, RL-infrastruktur, PyTorch, Ray, Megatron, DeepSpeed eller relaterade system.

Företagsinformation

Nebius B.V.-logotypen
Teknik
Antal anställda: 1,500
Aktuella lediga tjänster hos Nebius B.V. på JobCrawls
PlatsAktiva annonser
Distans - Globalt558
Distans - Europa41
Distans - Suomi20
Amsterdam, Nederländerna17
Remote - Europa15
Berlin, Tyskland12
Helsingfors, Finland11
Remote - USA11
Mäntsälä, Finland11
London, Storbritannien8
Distans - Finland5
Amsterdam5
Distans - Yhdysvallat5
Israel4
Kanada4
Singapore3
London2
Frankrike, Paris2
Amsterdam, Nederland2
New Jersey, USA2
Abu Dhabi2
Dubai2
Storbritannien2
Minnesota, USA1
Nederländerna1
Praha1
Tšekki1
Berlin, Deutschland1
Abu Dhabi, Förenade Arabemiraten1
Fjärrarbete1
Prag, Tjeckien1
Kanada, Remote - USA1
Dallas, USA1
New York City, USA1
Fjärr - Europa1
Philadelphia, USA1
Distans1
Béthune, Pas-de-Calais, Frankrike1
Remote - Yhdysvallat1
San Francisco Bay Area, USA1
Alabama, USA1
Austin, USA1
Distans - Förenta staterna1
Distans - Singapore1
Austin, Texas1
East London, Storbritannien1
Singapore, Singapore1
Berlin1
Remote - Förenta staterna1
Distans - Mellanöstern1
Distans - Nordamerika1
Distans - Frankrike1
Tel Aviv, Israel1
Remote1
Remote - Global1
Distans - Benelux1
Béthune, Frankrike1
Paris, Frankrike1
Remote - Asien1
Kansas City, USA1
Finland1
Kalifornien, USA1
Distans - DACH1
Oklahoma, USA1
Paris1
Fjärr - USA1
Abu Dhabi, Dubai1
Aktuell rollfördelning hos Nebius B.V. på JobCrawls
RolltypAktiva annonser
Backend-ingenjör241
Backendutvecklare81
Backend-Insinör81
Account Executive76
Systemutvecklare72
Backend-insinöri21
Backend-insinör20
Backendingenjör12
Backend-Insinööri10
Backend-Insinär5
Säljare4
Backend Engineer4
Produktchef3
Backend-insinääri3
Backend-insinF6ri2
Lediga tjänster hos Nebius2
Backendingenjörer, Frontendingenjörer, Site Reliability Engineers2
Backend-insinär2
Datacenter Logistikspecialist1
Dataingenjör1
Backendingenjörer1
Datacenter IT-tekniker1
HR-specialist1
Vice President för utvecklarrelationer och community1
Datacenter Operations Technician1
Backend-insinööri1
Data Center IT Manager1
Data Center Operations Technician1
Chef för Kanalmarknadsföring1
Data Scientist1
Operatörsspecialist1
Revisor1
Backend-InsinF6r1
Systemingenjör1
Aktuell fördelning av rollnivåer hos Nebius B.V. på JobCrawls
RollnivåAktiva annonser
Medelnivå561

Nebius B.V. finns med i 788 indexerade jobbannonser i JobCrawls Finlandsdata sedan oktober 2023. I det historiska indexet är de starkaste platssignalerna för den här arbetsgivaren Distans - Globalt, Distans - Europa, och Distans - Suomi.

Visade data baseras på historiska jobbannonser från vår databas.

Jobbdetaljer

Ansvarsområden

  • Bygga och underhålla distribuerad träningsinfrastruktur för SFT, fortsatt förträning, preferensoptimering och RL-arbetsbelastningar
  • Integrera och utöka ramverk som Megatron-LM, DeepSpeed, PyTorch FSDP/DTensor, Ray, verl, slime, AReaL, OpenRLHF eller motsvarande interna system
  • Implementera och felsöka parallelliseringsstrategier inklusive tensor-, pipeline-, sekvens/kontext-, expert- och dataparallellism
  • Bygga pålitliga komponenter för utrullning, servering av belöningsmodeller, replay/databuffert, checkpointing, utvärdering och experimentorkestrering för RL-träning
  • Profilera och förbättra GPU-utnyttjande, kommunikationseffektivitet, minnesanvändning och träningsgenomströmning
  • Diagnostisera fel i NCCL, CUDA, PyTorch, Ray, schemaläggare, lagring, nätverk och checkpointing-lager
  • Skapa reproducerbara träningskörningar, startskript, instrumentpaneler, runbooks och operationella verktyg för forskaranvändare
  • Samarbeta med forskare för att omvandla algoritmiska träningsrecept till skalbara, felsökbara system
  • Skriva tydliga designdokument, incidentrapporter, benchmarkrapporter och driftsguider

Krav

  • Starka kunskaper i Python och PyTorch-teknik
  • Praktisk erfarenhet av distribuerad modellträning, storskaliga ML-system eller GPU-klusterbelastningar
  • Praktisk förståelse för flaskhalsar vid transformatorträning, minnestryck, gradient/optimerarstatus, kommunikationskostnader och checkpointing
  • Erfarenhet av att felsöka produktions- eller forskningsträningsjobb över flera GPU:er eller noder
  • Förmåga att resonera kvantitativt kring genomströmning, utnyttjande, minne, tillförlitlighet, kostnad och forskningshastighet
  • Starka kommunikationsfärdigheter och förmåga att samarbeta med forskare, ML-ingenjörer, plattformsingenjörer och ledning

Kompetenser och tekniker

PythonPyTorchMegatron-LMDeepSpeedPyTorch FSDPPyTorch DTensorRayverlslimeAReaLOpenRLHFNCCLCUDATritonNsightInfiniBandRDMARoCESlurmKubernetes
18 timmar sedanContent Complete

Help us improve JobCrawls — sign in to sync saved jobs across devices, or send feedback anytime.