Nebius B.V.-logo

Koneoppimisen seniori-insinööri, LLM-inferenssin optimointi - Nebius B.V. - Palo Alto, Yhdysvallat

Koneoppimisinsinööri

Julkaistu: 24. heinäkuuta 2026
Julkaistu tänään
Viimeksi nähty crawlissa: 23. heinäkuuta 2026 (tänään)
Arvioitu päättymispäivä: 28. elokuuta 2026
Rooli ja johtaminen
Roolitaso:Senior-taso
Esihenkilötaso:Ei henkilöstöjohtamista
Työsuhteen tyyppi
Kokemus
5 vuotta

Tehtävänkuvaus

Nebius Token Factory rakentaa tekoälyn koulutus- ja mallien jälkikoulutuskapasiteettia huippumallien parantamiseksi. Tämä rooli vastaa infrastruktuurista, joka tekee laajamittaisesta koulutuksesta ja RL-kokeiluista mahdollisia, luotettavia, toistettavia ja tehokkaita. Työ sijoittuu hajautettujen järjestelmien, GPU-suorituskyvyn, mallien koulutuskehysten, RL-putkien ja tuotanto-insinöörityön leikkauspisteeseen. Senior MLE vastaa merkittävistä mallien ja päätepisteiden optimointiprojekteista päästä päähän. Hän on erittäin käytännönläheinen, kykenee ratkaisemaan vaikeita tarjoilun ongelmia itsenäisesti ja pystyy tuottamaan mitattavia parannuksia ilman tiivistä ohjausta. Vastuualueesi: - Vastaa optimointityöstä tiettyjen malliperheiden, asiakaspäätepisteiden tai tarjoilun taustajärjestelmien osalta. - Suorita moottorivertailuja ja suosittele käytännön tarjoilukonfiguraatioita tiettyihin työkuormiin. - Korjaa mallin laatuun tai suorituskykyyn liittyviä heikennyksiä tuotantoon käyttöönoton aikana. - Optimoi LLM- ja VLM-päätepisteet viiveen, läpimenon, muistitehokkuuden, GPU-hyödyntämisen, laadun ja token-kustannusten suhteen. - Käyttööta otto, konfigurointi, vertailu ja laajentaminen inferenssimoottoreille, kuten vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo tai vastaavat järjestelmät. - Rakenna ja tuo tuotantoon mallien kompressio-työnkulkuja, mukaan lukien kvantisointi, kvantisointitietoinen koulutus, tislaus, low-bit-tarjoilu ja tarkkuuden palautus. - Toteuta tai integroi spekulatiivinen dekoodaus, luonnosmallitavat, KV-välimuistin optimointi, etuliitevälimuistitus, chunked prefill, jatkuva eräajo ja erotettu prefill/decode-tarjoilu. - Rakenna toistettavat vertailutyökalut TTFT:lle, TPOT:lle, tokeneille sekunnissa per GPU, p95/p99-viiveelle, GPU-muistille, luotettavuudelle ja token-kustannuksille. - Tee yhteistyötä GPU-ydininsinöörien ja alustainsinöörien kanssa pullonkaulojen diagnosoimiseksi mallikoodin, ytimien, ajonaikan, ajastimen, gatewayn ja klusterikerrosten välillä. - Kirjoita selkeitä suunnitteludokumentteja, suorituskykyraportteja, käyttöönotto-suunnitelmia ja asiakkaille suunnattuja teknisiä selityksiä. Pakolliset taidot: - Vahva Python- ja PyTorch-insinööritaito. - Käytännön kokemus LLM-, VLM- tai suuritehoisten transformer-inferenssijärjestelmien käyttöönotosta tai optimoinnista. - Käytännön tuntemus vähintään yhdestä nykyaikaisesta inferenssipinosta, kuten vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe tai vastaavat sisäiset järjestelmät. - Vahva ymmärrys transformer-inferenssin pullonkauloista, mukaan lukien KV-välimuisti, attention, muistiväylän leveys, eräajo, rinnakkaisuus ja pitkän kontekstin tarjoilu. - Kyky perustella kvantitatiivisesti viiveen, läpimenon, laadun, hyödyntämisen ja kustannusten välisiä kompromisseja. - Vahvat viestintätaidot ja kyky tehdä yhteistyötä tutkimus-, ydin-, infrastruktuuri-, tuote- ja asiakastiimien kanssa. Toivottu osaaminen: - Kokemus kvantisointitietoisesta koulutuksesta, jälkikoulutus-kvantisoinnista, FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant tai vastaavista tekniikoista. - Kokemus tislauksesta, spekulatiivisesta dekoodauksesta, EAGLE:sta, Medusasta, monen tokenin ennustamisesta tai muista inferenssin kiihdytysmenetelmistä. - Kokemus agenttisista työkuormista, mukaan lukien työkalujen kutsuminen, strukturoidut tulosteet, suoratoisto-API:t, korkea samanaikaisuus ja monivaiheinen orkestrointi. - CUDA- tai Triton-tuttuus, vaikka rooli ei olisi ensisijaisesti ydininsinöörin rooli. - Avoimen lähdekoodin panokset projekteihin kuten vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe tai vastaavat.

Yrityksen tiedot

Nebius B.V.-logo
Teknologia
Henkilöstömäärä: 1,500
Yrityksen Nebius B.V. avoimet tehtävät JobCrawls-palvelussa
SijaintiAktiiviset ilmoitukset
Etätyö - Globaali554
Etätyö - Eurooppa45
Etätyö - Suomi24
Amsterdam, Alankomaat18
Berliini, Saksa12
Etätyö - Yhdysvallat11
Helsinki, Suomi11
Mäntsälä, Suomi7
Etä - Eurooppa6
Lontoo, Yhdistynyt kuningaskunta6
Amsterdam5
Remote - Eurooppa5
Remote - Yhdysvallat5
Etä - Yhdysvallat4
Kanada4
Israel4
Mäntsälä, Finland4
EtE4tyF6 - Globaali3
Singapore3
Etätyö3
Lontoo2
New Jersey, Yhdysvallat2
Abu Dhabi2
Ranska, Pariisi2
Dubai2
Lontoo, Iso-Britannia2
Etätyö - Pohjois-Amerikka1
Etätyö - Benelux1
Berlin1
New York City, Yhdysvallat1
Berlin, Saksa1
EtE4tyF6 - Suomi1
Abu Dhabi, Dubai1
East London, Yhdistynyt kuningaskunta1
Philadelphia, Yhdysvallat1
Etätyö - Singapore1
Etätyö - Lähi-itä1
Tšekki1
Etätyö - Aasia1
Alankomaat1
Etä1
Béthune, Pas-de-Calais, Ranska1
Pariisi, Ranska1
Etätyö - Ranska1
Iso-Britannia1
Praha, Tšekki1
Tel Aviv, Israel1
Béthune, Ranska1
Dallas, Yhdysvallat1
Austin, Texas1
Amsterdami, Alankomaat1
Suomi1
Etätyö - Maailmanlaajuinen1
Kanada, Remote - Yhdysvallat1
Kansas City, Yhdysvallat1
Etätyö - DACH1
Kalifornia, Yhdysvallat1
Alabama, Yhdysvallat1
Austin, Yhdysvallat1
Etätyö - Europa1
Abu Dhabi, Yhdistyneet arabiemiirikunnat1
Oklahoma, Yhdysvallat1
Pariisi1
San Francisco Bay Area, Yhdysvallat1
Minnesota, Yhdysvallat1
Singapore, Singapore1
Praha1
Yhdistynyt kuningaskunta1
Yrityksen Nebius B.V. tehtäväjakauma JobCrawls-palvelussa
TehtävätyyppiAktiiviset ilmoitukset
Backend-insinööri314
Backend-insinöri99
Account Executive76
Ohjelmistoinsinööri71
Backend-kehittäjä54
Backend-insinäri7
Backend Engineer4
Myyntiedustaja4
Backend-insinF6ri3
Tuotepäällikkö3
Backend-insinääri3
Data Center Operations Technician2
Avoimet työpaikat Nebiusilla2
Viestintäjohtaja1
Toimintojen asiantuntija1
Henkilöstöasiantuntija1
Tietokeskuksen logistiikkaspecialisti1
Datakeskuksen IT-tekniikka1
Järjestelmäinsinööri1
Data Scientist1
Kehitysjohtaja kehittäjä- ja yhteisöasioissa1
Data Engineer1
Backend-insinöörit1
Kirjanpitäjä1
Data Center IT Manager1
Yrityksen Nebius B.V. tehtävätasojen jakauma JobCrawls-palvelussa
TehtävätasoAktiiviset ilmoitukset
Keskitaso561

Nebius B.V. 788 indeksoitua työpaikkailmoitusta JobCrawlsin Suomen aineistossa ajankohdasta lokakuu 2023 lähtien. Historiallisessa indeksissä vahvimmat sijaintisignaalit tälle työnantajalle ovat Etätyö - Globaali, Etätyö - Eurooppa, ja Etätyö - Suomi.

Näytetyt tiedot perustuvat tietokantamme aiempiin työpaikkailmoituksiin.

Työn tiedot

Vastuut

  • Vastata optimointityöstä tiettyjen malliperheiden, asiakaspäätepisteiden tai tarjoilun taustajärjestelmien osalta
  • Suorittaa moottorivertailuja ja suositella käytännön tarjoilukonfiguraatioita tiettyihin työkuormiin
  • Korjata mallin laatuun tai suorituskykyyn liittyviä heikennyksiä tuotantoon käyttöönoton aikana
  • Optimoida LLM- ja VLM-päätepisteet viiveen, läpimenon, muistitehokkuuden, GPU-hyödyntämisen, laadun ja token-kustannusten suhteen
  • Käyttööottaa, konfiguroida, vertailla ja laajentaa inferenssimoottoreita, kuten vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo
  • Rakentaa ja tuotantoon ottaa mallien kompressio-työnkulkuja, mukaan lukien kvantisointi, tislaus ja tarkkuuden palautus
  • Toteuttaa spekulatiivinen dekoodaus, KV-välimuistin optimointi, etuliitevälimuistitus ja jatkuva eräajo
  • Rakentaa toistettavat vertailutyökalut TTFT:lle, TPOT:lle ja muille suorituskykymittareille
  • Tehdä yhteistyötä GPU-ydininsinöörien ja alustainsinöörien kanssa pullonkaulojen diagnosoimiseksi
  • Kirjoittaa suunnitteludokumentteja, suorituskykyraportteja ja teknisiä selityksiä

Vaatimukset

  • Vahva Python- ja PyTorch-insinööritaito
  • Käytännön kokemus LLM-, VLM- tai suuritehoisten transformer-inferenssijärjestelmien käyttöönotosta tai optimoinnista
  • Käytännön tuntemus vähintään yhdestä nykyaikaisesta inferenssipinosta (esim. vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe)
  • Vahva ymmärys transformer-inferenssin pullonkauloista (KV-välimuisti, attention, muistiväylän leveys, eräajo, rinnakkaisuus, pitkän kontekstin tarjoilu)
  • Kyky perustella kvantitatiivisesti viiveen, läpimenon, laadun, hyödyntämisen ja kustannusten välisiä kompromisseja
  • Vahvat viestintätaidot ja kyky tehdä yhteistyötä eri tiimien välillä

Taidot ja teknologiat

PythonPyTorchvLLMSGLangTensorRT-LLMTriton Inference ServerNVIDIA DynamoRay ServeKServeCUDATritonKvantisointiTislausSpekulatiivinen dekoodaus
18 tuntia sittenContent Complete

Help us improve JobCrawls — sign in to sync saved jobs across devices, or send feedback anytime.