
Koneoppimisen seniori-insinööri, LLM-inferenssin optimointi - Nebius B.V. - Palo Alto, Yhdysvallat
Koneoppimisinsinööri
Napauta tätä korttia nähdäksesi palkkakaaviot ja täydet palkkatiedot.
Laajenna nähdäksesi täyden palkkakontekstin
Näe markkinasijoittuminen, palkkahaarukan vertailukaavio ja lokalisoitu palkkanarratiivi.
Tehtävänkuvaus
Nebius Token Factory rakentaa tekoälyn koulutus- ja mallien jälkikoulutuskapasiteettia huippumallien parantamiseksi. Tämä rooli vastaa infrastruktuurista, joka tekee laajamittaisesta koulutuksesta ja RL-kokeiluista mahdollisia, luotettavia, toistettavia ja tehokkaita. Työ sijoittuu hajautettujen järjestelmien, GPU-suorituskyvyn, mallien koulutuskehysten, RL-putkien ja tuotanto-insinöörityön leikkauspisteeseen. Senior MLE vastaa merkittävistä mallien ja päätepisteiden optimointiprojekteista päästä päähän. Hän on erittäin käytännönläheinen, kykenee ratkaisemaan vaikeita tarjoilun ongelmia itsenäisesti ja pystyy tuottamaan mitattavia parannuksia ilman tiivistä ohjausta. Vastuualueesi: - Vastaa optimointityöstä tiettyjen malliperheiden, asiakaspäätepisteiden tai tarjoilun taustajärjestelmien osalta. - Suorita moottorivertailuja ja suosittele käytännön tarjoilukonfiguraatioita tiettyihin työkuormiin. - Korjaa mallin laatuun tai suorituskykyyn liittyviä heikennyksiä tuotantoon käyttöönoton aikana. - Optimoi LLM- ja VLM-päätepisteet viiveen, läpimenon, muistitehokkuuden, GPU-hyödyntämisen, laadun ja token-kustannusten suhteen. - Käyttööta otto, konfigurointi, vertailu ja laajentaminen inferenssimoottoreille, kuten vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo tai vastaavat järjestelmät. - Rakenna ja tuo tuotantoon mallien kompressio-työnkulkuja, mukaan lukien kvantisointi, kvantisointitietoinen koulutus, tislaus, low-bit-tarjoilu ja tarkkuuden palautus. - Toteuta tai integroi spekulatiivinen dekoodaus, luonnosmallitavat, KV-välimuistin optimointi, etuliitevälimuistitus, chunked prefill, jatkuva eräajo ja erotettu prefill/decode-tarjoilu. - Rakenna toistettavat vertailutyökalut TTFT:lle, TPOT:lle, tokeneille sekunnissa per GPU, p95/p99-viiveelle, GPU-muistille, luotettavuudelle ja token-kustannuksille. - Tee yhteistyötä GPU-ydininsinöörien ja alustainsinöörien kanssa pullonkaulojen diagnosoimiseksi mallikoodin, ytimien, ajonaikan, ajastimen, gatewayn ja klusterikerrosten välillä. - Kirjoita selkeitä suunnitteludokumentteja, suorituskykyraportteja, käyttöönotto-suunnitelmia ja asiakkaille suunnattuja teknisiä selityksiä. Pakolliset taidot: - Vahva Python- ja PyTorch-insinööritaito. - Käytännön kokemus LLM-, VLM- tai suuritehoisten transformer-inferenssijärjestelmien käyttöönotosta tai optimoinnista. - Käytännön tuntemus vähintään yhdestä nykyaikaisesta inferenssipinosta, kuten vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe tai vastaavat sisäiset järjestelmät. - Vahva ymmärrys transformer-inferenssin pullonkauloista, mukaan lukien KV-välimuisti, attention, muistiväylän leveys, eräajo, rinnakkaisuus ja pitkän kontekstin tarjoilu. - Kyky perustella kvantitatiivisesti viiveen, läpimenon, laadun, hyödyntämisen ja kustannusten välisiä kompromisseja. - Vahvat viestintätaidot ja kyky tehdä yhteistyötä tutkimus-, ydin-, infrastruktuuri-, tuote- ja asiakastiimien kanssa. Toivottu osaaminen: - Kokemus kvantisointitietoisesta koulutuksesta, jälkikoulutus-kvantisoinnista, FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant tai vastaavista tekniikoista. - Kokemus tislauksesta, spekulatiivisesta dekoodauksesta, EAGLE:sta, Medusasta, monen tokenin ennustamisesta tai muista inferenssin kiihdytysmenetelmistä. - Kokemus agenttisista työkuormista, mukaan lukien työkalujen kutsuminen, strukturoidut tulosteet, suoratoisto-API:t, korkea samanaikaisuus ja monivaiheinen orkestrointi. - CUDA- tai Triton-tuttuus, vaikka rooli ei olisi ensisijaisesti ydininsinöörin rooli. - Avoimen lähdekoodin panokset projekteihin kuten vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe tai vastaavat.
Yrityksen tiedot
| Sijainti | Aktiiviset ilmoitukset |
|---|---|
| Etätyö - Globaali | 554 |
| Etätyö - Eurooppa | 45 |
| Etätyö - Suomi | 24 |
| Amsterdam, Alankomaat | 18 |
| Berliini, Saksa | 12 |
| Etätyö - Yhdysvallat | 11 |
| Helsinki, Suomi | 11 |
| Mäntsälä, Suomi | 7 |
| Etä - Eurooppa | 6 |
| Lontoo, Yhdistynyt kuningaskunta | 6 |
| Amsterdam | 5 |
| Remote - Eurooppa | 5 |
| Remote - Yhdysvallat | 5 |
| Etä - Yhdysvallat | 4 |
| Kanada | 4 |
| Israel | 4 |
| Mäntsälä, Finland | 4 |
| Et E4ty F6 - Globaali | 3 |
| Singapore | 3 |
| Etätyö | 3 |
| Lontoo | 2 |
| New Jersey, Yhdysvallat | 2 |
| Abu Dhabi | 2 |
| Ranska, Pariisi | 2 |
| Dubai | 2 |
| Lontoo, Iso-Britannia | 2 |
| Etätyö - Pohjois-Amerikka | 1 |
| Etätyö - Benelux | 1 |
| Berlin | 1 |
| New York City, Yhdysvallat | 1 |
| Berlin, Saksa | 1 |
| Et E4ty F6 - Suomi | 1 |
| Abu Dhabi, Dubai | 1 |
| East London, Yhdistynyt kuningaskunta | 1 |
| Philadelphia, Yhdysvallat | 1 |
| Etätyö - Singapore | 1 |
| Etätyö - Lähi-itä | 1 |
| Tšekki | 1 |
| Etätyö - Aasia | 1 |
| Alankomaat | 1 |
| Etä | 1 |
| Béthune, Pas-de-Calais, Ranska | 1 |
| Pariisi, Ranska | 1 |
| Etätyö - Ranska | 1 |
| Iso-Britannia | 1 |
| Praha, Tšekki | 1 |
| Tel Aviv, Israel | 1 |
| Béthune, Ranska | 1 |
| Dallas, Yhdysvallat | 1 |
| Austin, Texas | 1 |
| Amsterdami, Alankomaat | 1 |
| Suomi | 1 |
| Etätyö - Maailmanlaajuinen | 1 |
| Kanada, Remote - Yhdysvallat | 1 |
| Kansas City, Yhdysvallat | 1 |
| Etätyö - DACH | 1 |
| Kalifornia, Yhdysvallat | 1 |
| Alabama, Yhdysvallat | 1 |
| Austin, Yhdysvallat | 1 |
| Etätyö - Europa | 1 |
| Abu Dhabi, Yhdistyneet arabiemiirikunnat | 1 |
| Oklahoma, Yhdysvallat | 1 |
| Pariisi | 1 |
| San Francisco Bay Area, Yhdysvallat | 1 |
| Minnesota, Yhdysvallat | 1 |
| Singapore, Singapore | 1 |
| Praha | 1 |
| Yhdistynyt kuningaskunta | 1 |
| Tehtävätyyppi | Aktiiviset ilmoitukset |
|---|---|
| Backend-insinööri | 314 |
| Backend-insinöri | 99 |
| Account Executive | 76 |
| Ohjelmistoinsinööri | 71 |
| Backend-kehittäjä | 54 |
| Backend-insinäri | 7 |
| Backend Engineer | 4 |
| Myyntiedustaja | 4 |
| Backend-insin F6ri | 3 |
| Tuotepäällikkö | 3 |
| Backend-insinääri | 3 |
| Data Center Operations Technician | 2 |
| Avoimet työpaikat Nebiusilla | 2 |
| Viestintäjohtaja | 1 |
| Toimintojen asiantuntija | 1 |
| Henkilöstöasiantuntija | 1 |
| Tietokeskuksen logistiikkaspecialisti | 1 |
| Datakeskuksen IT-tekniikka | 1 |
| Järjestelmäinsinööri | 1 |
| Data Scientist | 1 |
| Kehitysjohtaja kehittäjä- ja yhteisöasioissa | 1 |
| Data Engineer | 1 |
| Backend-insinöörit | 1 |
| Kirjanpitäjä | 1 |
| Data Center IT Manager | 1 |
| Tehtävätaso | Aktiiviset ilmoitukset |
|---|---|
| Keskitaso | 561 |
Nebius B.V. 788 indeksoitua työpaikkailmoitusta JobCrawlsin Suomen aineistossa ajankohdasta lokakuu 2023 lähtien. Historiallisessa indeksissä vahvimmat sijaintisignaalit tälle työnantajalle ovat Etätyö - Globaali, Etätyö - Eurooppa, ja Etätyö - Suomi.
Näytetyt tiedot perustuvat tietokantamme aiempiin työpaikkailmoituksiin.
Työn tiedot
Vastuut
- Vastata optimointityöstä tiettyjen malliperheiden, asiakaspäätepisteiden tai tarjoilun taustajärjestelmien osalta
- Suorittaa moottorivertailuja ja suositella käytännön tarjoilukonfiguraatioita tiettyihin työkuormiin
- Korjata mallin laatuun tai suorituskykyyn liittyviä heikennyksiä tuotantoon käyttöönoton aikana
- Optimoida LLM- ja VLM-päätepisteet viiveen, läpimenon, muistitehokkuuden, GPU-hyödyntämisen, laadun ja token-kustannusten suhteen
- Käyttööottaa, konfiguroida, vertailla ja laajentaa inferenssimoottoreita, kuten vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo
- Rakentaa ja tuotantoon ottaa mallien kompressio-työnkulkuja, mukaan lukien kvantisointi, tislaus ja tarkkuuden palautus
- Toteuttaa spekulatiivinen dekoodaus, KV-välimuistin optimointi, etuliitevälimuistitus ja jatkuva eräajo
- Rakentaa toistettavat vertailutyökalut TTFT:lle, TPOT:lle ja muille suorituskykymittareille
- Tehdä yhteistyötä GPU-ydininsinöörien ja alustainsinöörien kanssa pullonkaulojen diagnosoimiseksi
- Kirjoittaa suunnitteludokumentteja, suorituskykyraportteja ja teknisiä selityksiä
Vaatimukset
- Vahva Python- ja PyTorch-insinööritaito
- Käytännön kokemus LLM-, VLM- tai suuritehoisten transformer-inferenssijärjestelmien käyttöönotosta tai optimoinnista
- Käytännön tuntemus vähintään yhdestä nykyaikaisesta inferenssipinosta (esim. vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe)
- Vahva ymmärys transformer-inferenssin pullonkauloista (KV-välimuisti, attention, muistiväylän leveys, eräajo, rinnakkaisuus, pitkän kontekstin tarjoilu)
- Kyky perustella kvantitatiivisesti viiveen, läpimenon, laadun, hyödyntämisen ja kustannusten välisiä kompromisseja
- Vahvat viestintätaidot ja kyky tehdä yhteistyötä eri tiimien välillä
Taidot ja teknologiat
