
Tekoälyn suorituskyvyn insinööri
Vie hiiri rivin päälle tai napauta riviä nähdäksesi täydelliset tilastot (EUR / kk tässä kaaviossa).
| Markkinat | Alaraja (25. persentiili) | Mediaani | Yläraja (75. persentiili) |
|---|---|---|---|
| Tietojemme mukainen palkka — ei mainittu ilmoituksessa (Senior-taso) | €219/kuukaudessa | €242/kuukaudessa | €265/kuukaudessa |
AMD etsii suorituskykyyn keskittyvää insinööriä ajamaan tekoälyn inferenssin suorituskyvyn äärirajoille AMD-GPU-laitteilla, käyttäen SGLangia ensisijaisena palveluskeletona. Johdat pientä, erittäin teknistä tiimiä ja työskentelet koko pinon läpi: profiloiden, diagnosoimalla ja optimoimalla johtavia malleja SGLangilla asiakasrelevantteihin konfiguraatioihin (esim. agenttipohjainen koodaus, pitkä konteksti, korkea läpimäärä). KESKEISET VASTUUT: - Ajaa suorituskyvyn optimointia päästä päähän SGLangilla johtavissa malleissa ja asiakaskonfiguraatioissa, kuroen umpeen kilpailuetuja ydin- ja järjestelmätason optimoinneilla - Profiloida, diagnosoida ja ratkaista vaikeimmat pinon yli ulottuvat suorituskyvyn pullonkaulat SGLang-käytöissä, GPU-ytimistä ja operaattorien ohjauksesta SGLang-ajastimeen, RadixAttentioniin/prefix-välimuistiin ja monisolmuviestintään - Diagnosoida ydin-tason suorituskykyongelmia profilointityökaluilla: tunnistaa käyttöasteen rajoitukset, L2-välimuistin tyhjennykset, rekisteripaineet, muistin koalesenssiongelmat jne. - Johtaa asiakasrajapinnan teknisiä projekteja: esittää löydökset, suosittelee optimointeja ja toimittaa mitattavia suorituskyvyn parannuksia - Integroida ja optimoida mukautettuja ytimiä (Triton, Gluon, CK, PyDSL, ASM, AITER) SGLangiin - Optimoida monisolmuinen hajautettu inferenssi SGLangilla: viestinnän ja laskennan päällekkäisyys, rinnakkaisuusstrategiat (TP/EP/DP) - Kehittää ja hioa yhteistä suorituskyvyn optimointimetodologiaa - Hyödyntää tekoälyagentteja päivittäisessä työssä ja määritellä parhaita käytäntöjä tekoälyavusteiselle suorituskyvyn suunnittelulle - Viedä optimointeja SGLangiin ja muihin avoimen lähdekoodin kehyksiin, kuten vLLM:ään ja PyTorchiin SUOSITELTU KOKEMUS: - 7+ vuotta ohjelmistokehityskokemusta GPU-laskennasta, tekoälyjärjestelmistä tai HPC:stä - Syvää käytännön kokemusta SGLang-sisäisistä toiminnoista; vLLM, TensorRT-LLM tai vastaava on etu - Vahva tausta työkuorman profiloinnissa ja pullonkaulojen diagnosoinnissa - Ymmärrys GPU-ytimen suorituskyvyn ominaisuuksista: käyttöaste, rekisteri- ja LDS-paine, muistin koalesenssi, välimuistin hyödyntäminen - Ymmärrys malliarkkitehtuureista (transformers, MoE, diffusion), inferenssiparametreista (spekulatiivinen dekoodaus, jatkuva eräajo) - Kokemus mukautettujen ytimien kehityksestä tai integroinnista (HIP, CUDA, Triton, CK) - Ymmärrys monen GPU:n ja monisolmuisten hajautettujen järjestelmien toiminnasta: RCCL/NCCL, RDMA - Vahva osaaminen Pythonissa ja C++:ssa - Kokemusta asiakasrajapinnan teknisestä johtamisesta - Sujuva tekoälyavusteinen kehitystyö - Vahva Linux-järjestelmien tuntemus - Erinomaiset englannin kielen kirjalliset ja suulliset viestintätaidot AKATEEMISET TUTKINNOT: Maisterin tai tohtorin tutkinto tietojenkäsittelytieteessä, tietotekniikassa, sähkötekniikassa tai vastaavassa.
Työn tiedot
Vastuualueet
- Ajaa suorituskyvyn optimointia päästä päähän SGLangilla johtavissa malleissa ja asiakaskonfiguraatioissa
- Profiloida, diagnosoida ja ratkaista pinon yli ulottuvia suorituskyvyn pullonkauloja GPU-ytimistä SGLang-ajastimeen
- Tunnistaa ja ratkaista ydin-tason ongelmia, kuten käyttöasteen rajoituksia ja L2-välimuistin tyhjennyksiä
- Johtaa asiakasrajapinnan teknisiä projekteja ja toimittaa mitattavia suorituskyvyn parannuksia
- Integroida ja optimoida mukautettuja ytimiä (Triton, Gluon, CK, PyDSL, ASM, AITER) SGLangiin
- Optimoida monisolmuinen hajautettu inferenssi keskittyen viestinnän ja laskennan päällekkäisyyteen
- Kehittää yhteistä suorituskyvyn optimointimetodologiaa tiimille
- Hyödyntää tekoälyagentteja työn nopeuttamiseen ja määritellä tekoälyavusteisen suunnittelun parhaat käytännöt
- Viedä optimointeja SGLangiin, vLLM:ään ja PyTorchiin
Vaatimukset
- 7+ vuotta ohjelmistokehityskokemusta GPU-laskennasta, tekoälyjärjestelmistä tai HPC:stä
- Syvää käytännön kokemusta SGLang-sisäisistä toiminnoista
- Vahva tausta työkuorman profiloinnissa ja pullonkaulojen diagnosoinnissa
- Ymmärrys GPU-ytimen suorituskyvyn ominaisuuksista (käyttöaste, rekisteri-/LDS-paine, muistin koalesenssi, välimuistin hyödyntäminen)
- Ymmärrys malliarkkitehtuureista (transformers, MoE, diffusion) ja inferenssiparametreista (spekulatiivinen dekoodaus, jatkuva eräajo)
- Kokemus mukautettujen ytimien kehityksestä tai integroinnista (HIP, CUDA, Triton, CK tai vastaava)
- Ymmärrys monen GPU:n ja monisolmuisten hajautettujen järjestelmien toiminnasta (RCCL/NCCL, RDMA)
- Vahva osaaminen Pythonissa ja C++:ssa
- Kokemusta asiakasrajapinnan teknisestä johtamisesta
- Vahva Linux-järjestelmien tuntemus
- Erinomaiset englannin kielen kirjalliset ja suulliset viestintätaidot
- Maisterin tai tohtorin tutkinto tietojenkäsittelytieteessä, tietotekniikassa, sähkötekniikassa tai vastaavassa
Taidot ja teknologiat
Koulutustaso
Ylempi korkeakoulututkinto
Aiheeseen liittyvät mahdollisuudet
Löydä lisää kiinnostuksen kohteisiisi ja taitoihisi sopivia mahdollisuuksia