Nebius B.V.-logotypen

Senior Machine Learning-ingenjör - Nebius B.V. - Palo Alto, USA

Machine Learning-ingenjör

Publicerad: 24 juli 2026
Publicerad idag
Senast sedd i crawl: 23 juli 2026 (idag)
Beräknat utgångsdatum: 28 augusti 2026
Arbetsplats
Roll och ledning
Rollnivå:Senior
Personalansvarsnivå:Ingen personalhantering
Anställningsform
Erfarenhet
5 år

Jobbeskrivning

Nebius Token Factory bygger en förmåga för AI-träning och modellefterträning för förbättring av frontier-modeller. Denna roll äger infrastrukturen som gör storskalig träning och RL-experiment möjliga, pålitliga, reproducerbara och effektiva. Arbetet ligger i skärningspunkten mellan distribuerade system, GPU-prestanda, ramverk för modellträning, RL-pipelines och produktionsteknik. En Senior MLE äger omfattande optimeringsprojekt för modeller och slutpunkter från start till mål. De är mycket praktiskt lagda, kan felsöka svåra serveringsproblem självständigt och kan leverera mätbara förbättringar utan behov av omfattande övervakning. Dina ansvarsområden: - Äga optimeringsarbete för specifika modellfamiljer, kundslutpunkter eller serveringsbackender. - Köra motorjämförelser och rekommendera praktiska serveringskonfigurationer för specifika arbetsbelastningar. - Felsöka regressioner i modellkvalitet eller prestanda under produktionsutrullningar. - Optimera LLM- och VLM-slutpunkter för latens, genomströmning, minneseffektivitet, GPU-utnyttjande, kvalitet och kostnad per token. - Driftsätta, konfigurera, benchmarka och utöka inferensmotorer som vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo eller liknande system. - Bygga och produktionssätta arbetsflöden för modellkomprimering, inklusive kvantisering, kvantiseringsmedveten träning, destillering, lågbit-servering och återställning av noggrannhet. - Implementera eller integrera spekulativ avkodning, utkastmodell-metoder, KV-cache-optimering, prefix-caching, chunked prefill, kontinuerlig batchning och disaggregerad prefill/decode-servering. - Bygga reproducerbara benchmark-verktyg för TTFT, TPOT, tokens per sekund per GPU, p95/p99-latens, GPU-minne, tillförlitlighet och kostnad per token. - Samarbeta med GPU-kärntekniker och plattformsingenjörer för att diagnostisera flaskhalsar i modellkod, kärnor, runtime, schemaläggare, gateway och klusterlager. - Skriva tydliga designdokument, prestandarapporter, utrullningsplaner och tekniska förklaringar för kunder. Krav: - Starka kunskaper i Python och PyTorch. - Praktisk erfarenhet av att driftsätta eller optimera LLM, VLM eller högpresterande transformer-inferenssystem. - Praktisk kunskap om minst en modern inferensstack såsom vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe eller motsvarande interna system. - Stark förståelse för flaskhalsar i transformer-inferens, inklusive KV-cache, attention, minnesbandbredd, batchning, parallellism och långkontext-servering. - Förmåga att resonera kvantitativt kring avvägningar mellan latens, genomströmning, kvalitet, utnyttjande och kostnad. - Starka kommunikationsfärdigheter och förmåga att samarbeta med forsknings-, kärn-, infrastruktur-, produkt- och kundteam. Meriterande: - Erfarenhet av kvantiseringsmedveten träning, post-training kvantisering, FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant eller relaterade tekniker. - Erfarenhet av destillering, spekulativ avkodning, EAGLE, Medusa, prediktion av flera tokens eller andra metoder för inferensacceleration. - Erfarenhet av agentiska arbetsbelastningar, inklusive verktygsanrop, strukturerade utdata, streaming-API:er, hög samtidighet och flerstegsorkestrering. - Bekantskap med CUDA eller Triton, även om rollen inte primärt är en kärnteknikroll. - Bidrag till open source-projekt som vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe eller relaterade projekt.

Företagsinformation

Nebius B.V.-logotypen
Teknik
Antal anställda: 1,500
Aktuella lediga tjänster hos Nebius B.V. på JobCrawls
PlatsAktiva annonser
Distans - Globalt558
Distans - Europa41
Distans - Suomi20
Amsterdam, Nederländerna17
Remote - Europa15
Berlin, Tyskland12
Mäntsälä, Finland11
Remote - USA11
Helsingfors, Finland11
London, Storbritannien8
Distans - Finland5
Amsterdam5
Distans - Yhdysvallat5
Israel4
Kanada4
Singapore3
Frankrike, Paris2
Amsterdam, Nederland2
New Jersey, USA2
Storbritannien2
Dubai2
Abu Dhabi2
London2
Remote - Asien1
Paris, Frankrike1
Remote - Yhdysvallat1
Austin, USA1
Remote - Förenta staterna1
Fjärrarbete1
New York City, USA1
Singapore, Singapore1
Kalifornien, USA1
Paris1
Béthune, Frankrike1
Prag, Tjeckien1
Abu Dhabi, Dubai1
Distans - Mellanöstern1
Minnesota, USA1
Dallas, USA1
Distans - Nordamerika1
East London, Storbritannien1
Tel Aviv, Israel1
Austin, Texas1
Abu Dhabi, Förenade Arabemiraten1
Béthune, Pas-de-Calais, Frankrike1
Nederländerna1
Distans - Benelux1
Finland1
Kanada, Remote - USA1
Philadelphia, USA1
Berlin, Deutschland1
Remote - Global1
San Francisco Bay Area, USA1
Praha1
Oklahoma, USA1
Berlin1
Distans1
Fjärr - Europa1
Distans - Frankrike1
Alabama, USA1
Remote1
Fjärr - USA1
Tšekki1
Distans - Singapore1
Distans - DACH1
Kansas City, USA1
Distans - Förenta staterna1
Aktuell rollfördelning hos Nebius B.V. på JobCrawls
RolltypAktiva annonser
Backend-ingenjör241
Backendutvecklare81
Backend-Insinör81
Account Executive76
Systemutvecklare72
Backend-insinöri21
Backend-insinör20
Backendingenjör12
Backend-Insinööri10
Backend-Insinär5
Backend Engineer4
Säljare4
Produktchef3
Backend-insinääri3
Backendingenjörer, Frontendingenjörer, Site Reliability Engineers2
Backend-insinär2
Lediga tjänster hos Nebius2
Backend-insinF6ri2
Backend-insinööri1
Revisor1
Dataingenjör1
Datacenter Logistikspecialist1
Vice President för utvecklarrelationer och community1
Systemingenjör1
Datacenter IT-tekniker1
Chef för Kanalmarknadsföring1
Data Scientist1
HR-specialist1
Operatörsspecialist1
Data Center Operations Technician1
Backendingenjörer1
Data Center IT Manager1
Datacenter Operations Technician1
Backend-InsinF6r1
Aktuell fördelning av rollnivåer hos Nebius B.V. på JobCrawls
RollnivåAktiva annonser
Medelnivå561

Nebius B.V. finns med i 788 indexerade jobbannonser i JobCrawls Finlandsdata sedan oktober 2023. I det historiska indexet är de starkaste platssignalerna för den här arbetsgivaren Distans - Globalt, Distans - Europa, och Distans - Suomi.

Visade data baseras på historiska jobbannonser från vår databas.

Jobbdetaljer

Ansvarsområden

  • Äga optimeringsarbete för specifika modellfamiljer, kundslutpunkter eller serveringsbackender
  • Köra motorjämförelser och rekommendera praktiska serveringskonfigurationer för specifika arbetsbelastningar
  • Felsöka regressioner i modellkvalitet eller prestanda under produktionsutrullningar
  • Optimera LLM- och VLM-slutpunkter för latens, genomströmning, minneseffektivitet, GPU-utnyttjande, kvalitet och kostnad per token
  • Driftsätta, konfigurera, benchmarka och utöka inferensmotorer som vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo
  • Bygga och produktionssätta arbetsflöden för modellkomprimering inklusive kvantisering, destillering och återställning av noggrannhet
  • Implementera spekulativ avkodning, KV-cache-optimering, prefix-caching och kontinuerlig batchning
  • Bygga reproducerbara benchmark-verktyg för TTFT, TPOT och andra prestandamått
  • Samarbeta med GPU-kärntekniker och plattformsingenjörer för att diagnostisera flaskhalsar
  • Skriva designdokument, prestandarapporter och tekniska förklaringar

Krav

  • Starka kunskaper i Python och PyTorch
  • Praktisk erfarenhet av att driftsätta eller optimera LLM, VLM eller högpresterande transformer-inferenssystem
  • Praktisk kunskap om minst en modern inferensstack (t.ex. vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe)
  • Stark förståelse för flaskhalsar i transformer-inferens (KV-cache, attention, minnesbandbredd, batchning, parallellism, långkontext-servering)
  • Förmåga att resonera kvantitativt kring avvägningar mellan latens, genomströmning, kvalitet, utnyttjande och kostnad
  • Starka kommunikationsfärdigheter och förmåga att samarbeta med tvärfunktionella team

Kompetenser och tekniker

PythonPyTorchvLLMSGLangTensorRT-LLMTriton Inference ServerNVIDIA DynamoRay ServeKServeCUDATritonKvantiseringDestilleringSpekulativ avkodning
18 timmar sedanContent Complete

Help us improve JobCrawls — sign in to sync saved jobs across devices, or send feedback anytime.