
Senior Machine Learning-ingenjör - Nebius B.V. - Palo Alto, USA
Machine Learning-ingenjör
Tryck på det här kortet för lönediagram och fullständiga ersättningsdetaljer.
Expandera för full lönekontext
Se marknadsposition, jämförelsegraf för lönespann och lokaliserad lönenarrativ.
Jobbeskrivning
Nebius Token Factory bygger en förmåga för AI-träning och modellefterträning för förbättring av frontier-modeller. Denna roll äger infrastrukturen som gör storskalig träning och RL-experiment möjliga, pålitliga, reproducerbara och effektiva. Arbetet ligger i skärningspunkten mellan distribuerade system, GPU-prestanda, ramverk för modellträning, RL-pipelines och produktionsteknik. En Senior MLE äger omfattande optimeringsprojekt för modeller och slutpunkter från start till mål. De är mycket praktiskt lagda, kan felsöka svåra serveringsproblem självständigt och kan leverera mätbara förbättringar utan behov av omfattande övervakning. Dina ansvarsområden: - Äga optimeringsarbete för specifika modellfamiljer, kundslutpunkter eller serveringsbackender. - Köra motorjämförelser och rekommendera praktiska serveringskonfigurationer för specifika arbetsbelastningar. - Felsöka regressioner i modellkvalitet eller prestanda under produktionsutrullningar. - Optimera LLM- och VLM-slutpunkter för latens, genomströmning, minneseffektivitet, GPU-utnyttjande, kvalitet och kostnad per token. - Driftsätta, konfigurera, benchmarka och utöka inferensmotorer som vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo eller liknande system. - Bygga och produktionssätta arbetsflöden för modellkomprimering, inklusive kvantisering, kvantiseringsmedveten träning, destillering, lågbit-servering och återställning av noggrannhet. - Implementera eller integrera spekulativ avkodning, utkastmodell-metoder, KV-cache-optimering, prefix-caching, chunked prefill, kontinuerlig batchning och disaggregerad prefill/decode-servering. - Bygga reproducerbara benchmark-verktyg för TTFT, TPOT, tokens per sekund per GPU, p95/p99-latens, GPU-minne, tillförlitlighet och kostnad per token. - Samarbeta med GPU-kärntekniker och plattformsingenjörer för att diagnostisera flaskhalsar i modellkod, kärnor, runtime, schemaläggare, gateway och klusterlager. - Skriva tydliga designdokument, prestandarapporter, utrullningsplaner och tekniska förklaringar för kunder. Krav: - Starka kunskaper i Python och PyTorch. - Praktisk erfarenhet av att driftsätta eller optimera LLM, VLM eller högpresterande transformer-inferenssystem. - Praktisk kunskap om minst en modern inferensstack såsom vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe eller motsvarande interna system. - Stark förståelse för flaskhalsar i transformer-inferens, inklusive KV-cache, attention, minnesbandbredd, batchning, parallellism och långkontext-servering. - Förmåga att resonera kvantitativt kring avvägningar mellan latens, genomströmning, kvalitet, utnyttjande och kostnad. - Starka kommunikationsfärdigheter och förmåga att samarbeta med forsknings-, kärn-, infrastruktur-, produkt- och kundteam. Meriterande: - Erfarenhet av kvantiseringsmedveten träning, post-training kvantisering, FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant eller relaterade tekniker. - Erfarenhet av destillering, spekulativ avkodning, EAGLE, Medusa, prediktion av flera tokens eller andra metoder för inferensacceleration. - Erfarenhet av agentiska arbetsbelastningar, inklusive verktygsanrop, strukturerade utdata, streaming-API:er, hög samtidighet och flerstegsorkestrering. - Bekantskap med CUDA eller Triton, även om rollen inte primärt är en kärnteknikroll. - Bidrag till open source-projekt som vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe eller relaterade projekt.
Företagsinformation
| Plats | Aktiva annonser |
|---|---|
| Distans - Globalt | 558 |
| Distans - Europa | 41 |
| Distans - Suomi | 20 |
| Amsterdam, Nederländerna | 17 |
| Remote - Europa | 15 |
| Berlin, Tyskland | 12 |
| Mäntsälä, Finland | 11 |
| Remote - USA | 11 |
| Helsingfors, Finland | 11 |
| London, Storbritannien | 8 |
| Distans - Finland | 5 |
| Amsterdam | 5 |
| Distans - Yhdysvallat | 5 |
| Israel | 4 |
| Kanada | 4 |
| Singapore | 3 |
| Frankrike, Paris | 2 |
| Amsterdam, Nederland | 2 |
| New Jersey, USA | 2 |
| Storbritannien | 2 |
| Dubai | 2 |
| Abu Dhabi | 2 |
| London | 2 |
| Remote - Asien | 1 |
| Paris, Frankrike | 1 |
| Remote - Yhdysvallat | 1 |
| Austin, USA | 1 |
| Remote - Förenta staterna | 1 |
| Fjärrarbete | 1 |
| New York City, USA | 1 |
| Singapore, Singapore | 1 |
| Kalifornien, USA | 1 |
| Paris | 1 |
| Béthune, Frankrike | 1 |
| Prag, Tjeckien | 1 |
| Abu Dhabi, Dubai | 1 |
| Distans - Mellanöstern | 1 |
| Minnesota, USA | 1 |
| Dallas, USA | 1 |
| Distans - Nordamerika | 1 |
| East London, Storbritannien | 1 |
| Tel Aviv, Israel | 1 |
| Austin, Texas | 1 |
| Abu Dhabi, Förenade Arabemiraten | 1 |
| Béthune, Pas-de-Calais, Frankrike | 1 |
| Nederländerna | 1 |
| Distans - Benelux | 1 |
| Finland | 1 |
| Kanada, Remote - USA | 1 |
| Philadelphia, USA | 1 |
| Berlin, Deutschland | 1 |
| Remote - Global | 1 |
| San Francisco Bay Area, USA | 1 |
| Praha | 1 |
| Oklahoma, USA | 1 |
| Berlin | 1 |
| Distans | 1 |
| Fjärr - Europa | 1 |
| Distans - Frankrike | 1 |
| Alabama, USA | 1 |
| Remote | 1 |
| Fjärr - USA | 1 |
| Tšekki | 1 |
| Distans - Singapore | 1 |
| Distans - DACH | 1 |
| Kansas City, USA | 1 |
| Distans - Förenta staterna | 1 |
| Rolltyp | Aktiva annonser |
|---|---|
| Backend-ingenjör | 241 |
| Backendutvecklare | 81 |
| Backend-Insinör | 81 |
| Account Executive | 76 |
| Systemutvecklare | 72 |
| Backend-insinöri | 21 |
| Backend-insinör | 20 |
| Backendingenjör | 12 |
| Backend-Insinööri | 10 |
| Backend-Insinär | 5 |
| Backend Engineer | 4 |
| Säljare | 4 |
| Produktchef | 3 |
| Backend-insinääri | 3 |
| Backendingenjörer, Frontendingenjörer, Site Reliability Engineers | 2 |
| Backend-insinär | 2 |
| Lediga tjänster hos Nebius | 2 |
| Backend-insin F6ri | 2 |
| Backend-insinööri | 1 |
| Revisor | 1 |
| Dataingenjör | 1 |
| Datacenter Logistikspecialist | 1 |
| Vice President för utvecklarrelationer och community | 1 |
| Systemingenjör | 1 |
| Datacenter IT-tekniker | 1 |
| Chef för Kanalmarknadsföring | 1 |
| Data Scientist | 1 |
| HR-specialist | 1 |
| Operatörsspecialist | 1 |
| Data Center Operations Technician | 1 |
| Backendingenjörer | 1 |
| Data Center IT Manager | 1 |
| Datacenter Operations Technician | 1 |
| Backend-Insin F6r | 1 |
| Rollnivå | Aktiva annonser |
|---|---|
| Medelnivå | 561 |
Nebius B.V. finns med i 788 indexerade jobbannonser i JobCrawls Finlandsdata sedan oktober 2023. I det historiska indexet är de starkaste platssignalerna för den här arbetsgivaren Distans - Globalt, Distans - Europa, och Distans - Suomi.
Visade data baseras på historiska jobbannonser från vår databas.
Jobbdetaljer
Ansvarsområden
- Äga optimeringsarbete för specifika modellfamiljer, kundslutpunkter eller serveringsbackender
- Köra motorjämförelser och rekommendera praktiska serveringskonfigurationer för specifika arbetsbelastningar
- Felsöka regressioner i modellkvalitet eller prestanda under produktionsutrullningar
- Optimera LLM- och VLM-slutpunkter för latens, genomströmning, minneseffektivitet, GPU-utnyttjande, kvalitet och kostnad per token
- Driftsätta, konfigurera, benchmarka och utöka inferensmotorer som vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo
- Bygga och produktionssätta arbetsflöden för modellkomprimering inklusive kvantisering, destillering och återställning av noggrannhet
- Implementera spekulativ avkodning, KV-cache-optimering, prefix-caching och kontinuerlig batchning
- Bygga reproducerbara benchmark-verktyg för TTFT, TPOT och andra prestandamått
- Samarbeta med GPU-kärntekniker och plattformsingenjörer för att diagnostisera flaskhalsar
- Skriva designdokument, prestandarapporter och tekniska förklaringar
Krav
- Starka kunskaper i Python och PyTorch
- Praktisk erfarenhet av att driftsätta eller optimera LLM, VLM eller högpresterande transformer-inferenssystem
- Praktisk kunskap om minst en modern inferensstack (t.ex. vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe)
- Stark förståelse för flaskhalsar i transformer-inferens (KV-cache, attention, minnesbandbredd, batchning, parallellism, långkontext-servering)
- Förmåga att resonera kvantitativt kring avvägningar mellan latens, genomströmning, kvalitet, utnyttjande och kostnad
- Starka kommunikationsfärdigheter och förmåga att samarbeta med tvärfunktionella team
Kompetenser och tekniker
