AMD-logo
Arvioitu kuukausipalkka
Arvioitu €2 630 - €3 184
Julkaistu 15. heinäkuuta 2026 · 23 päivää sittenViimeksi nähty 7. elokuuta 2026Haku päättyy 9. heinäkuuta 2027

Tekoälyn suorituskyvyn insinööri

Johtava tekoälyn suorituskyvyn insinööri - LLM-inferenssi (SGLang)
Helsinki, Suomi
Hybridityö · Ohjelmistotekniikka
Kokoaikainen · Senior-taso
Englanti
Ei henkilöstöjohtamista
Ylempi korkeakoulututkinto
7 vuoden kokemus
Kuinka tämä palkka vertautuu muihin
Palkkayhteys: Tekoälyn suorituskyvyn insinööri

Vie hiiri rivin päälle tai napauta riviä nähdäksesi täydelliset tilastot (EUR / kk tässä kaaviossa).

Kuukausipalkkavertailu nimikkeelle Tekoälyn suorituskyvyn insinööri
MarkkinatAlaraja (25. persentiili)MediaaniYläraja (75. persentiili)
Tietojemme mukainen palkka — ei mainittu ilmoituksessa (Senior-taso)€219/kuukaudessa€242/kuukaudessa€265/kuukaudessa
Tietoa tehtävästä

AMD etsii suorituskykyyn keskittyvää insinööriä ajamaan tekoälyn inferenssin suorituskyvyn äärirajoille AMD-GPU-laitteilla, käyttäen SGLangia ensisijaisena palveluskeletona. Johdat pientä, erittäin teknistä tiimiä ja työskentelet koko pinon läpi: profiloiden, diagnosoimalla ja optimoimalla johtavia malleja SGLangilla asiakasrelevantteihin konfiguraatioihin (esim. agenttipohjainen koodaus, pitkä konteksti, korkea läpimäärä). KESKEISET VASTUUT: - Ajaa suorituskyvyn optimointia päästä päähän SGLangilla johtavissa malleissa ja asiakaskonfiguraatioissa, kuroen umpeen kilpailuetuja ydin- ja järjestelmätason optimoinneilla - Profiloida, diagnosoida ja ratkaista vaikeimmat pinon yli ulottuvat suorituskyvyn pullonkaulat SGLang-käytöissä, GPU-ytimistä ja operaattorien ohjauksesta SGLang-ajastimeen, RadixAttentioniin/prefix-välimuistiin ja monisolmuviestintään - Diagnosoida ydin-tason suorituskykyongelmia profilointityökaluilla: tunnistaa käyttöasteen rajoitukset, L2-välimuistin tyhjennykset, rekisteripaineet, muistin koalesenssiongelmat jne. - Johtaa asiakasrajapinnan teknisiä projekteja: esittää löydökset, suosittelee optimointeja ja toimittaa mitattavia suorituskyvyn parannuksia - Integroida ja optimoida mukautettuja ytimiä (Triton, Gluon, CK, PyDSL, ASM, AITER) SGLangiin - Optimoida monisolmuinen hajautettu inferenssi SGLangilla: viestinnän ja laskennan päällekkäisyys, rinnakkaisuusstrategiat (TP/EP/DP) - Kehittää ja hioa yhteistä suorituskyvyn optimointimetodologiaa - Hyödyntää tekoälyagentteja päivittäisessä työssä ja määritellä parhaita käytäntöjä tekoälyavusteiselle suorituskyvyn suunnittelulle - Viedä optimointeja SGLangiin ja muihin avoimen lähdekoodin kehyksiin, kuten vLLM:ään ja PyTorchiin SUOSITELTU KOKEMUS: - 7+ vuotta ohjelmistokehityskokemusta GPU-laskennasta, tekoälyjärjestelmistä tai HPC:stä - Syvää käytännön kokemusta SGLang-sisäisistä toiminnoista; vLLM, TensorRT-LLM tai vastaava on etu - Vahva tausta työkuorman profiloinnissa ja pullonkaulojen diagnosoinnissa - Ymmärrys GPU-ytimen suorituskyvyn ominaisuuksista: käyttöaste, rekisteri- ja LDS-paine, muistin koalesenssi, välimuistin hyödyntäminen - Ymmärrys malliarkkitehtuureista (transformers, MoE, diffusion), inferenssiparametreista (spekulatiivinen dekoodaus, jatkuva eräajo) - Kokemus mukautettujen ytimien kehityksestä tai integroinnista (HIP, CUDA, Triton, CK) - Ymmärrys monen GPU:n ja monisolmuisten hajautettujen järjestelmien toiminnasta: RCCL/NCCL, RDMA - Vahva osaaminen Pythonissa ja C++:ssa - Kokemusta asiakasrajapinnan teknisestä johtamisesta - Sujuva tekoälyavusteinen kehitystyö - Vahva Linux-järjestelmien tuntemus - Erinomaiset englannin kielen kirjalliset ja suulliset viestintätaidot AKATEEMISET TUTKINNOT: Maisterin tai tohtorin tutkinto tietojenkäsittelytieteessä, tietotekniikassa, sähkötekniikassa tai vastaavassa.

Työn tiedot

Vastuualueet

  • Ajaa suorituskyvyn optimointia päästä päähän SGLangilla johtavissa malleissa ja asiakaskonfiguraatioissa
  • Profiloida, diagnosoida ja ratkaista pinon yli ulottuvia suorituskyvyn pullonkauloja GPU-ytimistä SGLang-ajastimeen
  • Tunnistaa ja ratkaista ydin-tason ongelmia, kuten käyttöasteen rajoituksia ja L2-välimuistin tyhjennyksiä
  • Johtaa asiakasrajapinnan teknisiä projekteja ja toimittaa mitattavia suorituskyvyn parannuksia
  • Integroida ja optimoida mukautettuja ytimiä (Triton, Gluon, CK, PyDSL, ASM, AITER) SGLangiin
  • Optimoida monisolmuinen hajautettu inferenssi keskittyen viestinnän ja laskennan päällekkäisyyteen
  • Kehittää yhteistä suorituskyvyn optimointimetodologiaa tiimille
  • Hyödyntää tekoälyagentteja työn nopeuttamiseen ja määritellä tekoälyavusteisen suunnittelun parhaat käytännöt
  • Viedä optimointeja SGLangiin, vLLM:ään ja PyTorchiin

Vaatimukset

  • 7+ vuotta ohjelmistokehityskokemusta GPU-laskennasta, tekoälyjärjestelmistä tai HPC:stä
  • Syvää käytännön kokemusta SGLang-sisäisistä toiminnoista
  • Vahva tausta työkuorman profiloinnissa ja pullonkaulojen diagnosoinnissa
  • Ymmärrys GPU-ytimen suorituskyvyn ominaisuuksista (käyttöaste, rekisteri-/LDS-paine, muistin koalesenssi, välimuistin hyödyntäminen)
  • Ymmärrys malliarkkitehtuureista (transformers, MoE, diffusion) ja inferenssiparametreista (spekulatiivinen dekoodaus, jatkuva eräajo)
  • Kokemus mukautettujen ytimien kehityksestä tai integroinnista (HIP, CUDA, Triton, CK tai vastaava)
  • Ymmärrys monen GPU:n ja monisolmuisten hajautettujen järjestelmien toiminnasta (RCCL/NCCL, RDMA)
  • Vahva osaaminen Pythonissa ja C++:ssa
  • Kokemusta asiakasrajapinnan teknisestä johtamisesta
  • Vahva Linux-järjestelmien tuntemus
  • Erinomaiset englannin kielen kirjalliset ja suulliset viestintätaidot
  • Maisterin tai tohtorin tutkinto tietojenkäsittelytieteessä, tietotekniikassa, sähkötekniikassa tai vastaavassa

Taidot ja teknologiat

SGLangvLLMPyTorchTritonGluonCKPyDSLASMAITERHIPCUDARCCLNCCLRDMAPythonC++Linux
Seen 2 hours agoContent Complete
AMD-logo
AMD · 15 avointa tehtävää
Suosituimmat sijainnit: Helsinki, Suomi · 7 · Etätyö - Suomi · 2 · Etätyö - Iso-Britannia · 1+5 muuta sijaintia
Näytä yritysprofiili
Yleisimmät rekrytoidut roolit
Ohjelmistoinsinööri
3
Tutkija
2
Data Scientist
2
Henkilöstöasiantuntija
2
Muu
1
Roolitasojen jakautuma
Keskitaso (2)

Help us improve JobCrawls — sign in to sync saved jobs across devices, or send feedback anytime.