AMD-logo
Arvioitu kuukausipalkka
Arvioitu €2 630 - €3 184
Julkaistu 15. heinäkuuta 2026 · 23 päivää sittenViimeksi nähty 7. elokuuta 2026Haku päättyy 9. heinäkuuta 2027

AI-suorituskykyinsinööri

Senior AI-suorituskykyinsinööri - LLM-inferenssi (vLLM)
Helsinki, Suomi
Hybridityö · Ohjelmistotekniikka
Kokoaikainen · Senior-taso
Englanti
Ei henkilöstöjohtamista
Ylempi korkeakoulututkinto
5 vuoden kokemus
Kuinka tämä palkka vertautuu muihin
Palkkayhteys: AI-suorituskykyinsinööri

Vie hiiri rivin päälle tai napauta riviä nähdäksesi täydelliset tilastot (EUR / kk tässä kaaviossa).

Kuukausipalkkavertailu nimikkeelle AI-suorituskykyinsinööri
MarkkinatAlaraja (25. persentiili)MediaaniYläraja (75. persentiili)
Tietojemme mukainen palkka — ei mainittu ilmoituksessa (Senior-taso)€219/kuukaudessa€242/kuukaudessa€265/kuukaudessa
Tietoa tehtävästä

AMD etsii suorituskykyyn keskittyvää senior-insinööriä maksimoimaan tekoälyinferenssin suorituskyvyn AMD:n GPU-kiihdyttimillä, käyttäen ensisijaisena palveluskeletona vLLM:ää. Työskentelet koko pinon läpi: profiloiden, diagnosoimalla ja optimoimalla johtavia malleja vLLM:ssä asiakasrelevantteihin palvelukonfiguraatioihin (esim. agenttipohjainen koodaus, pitkä konteksti, korkea läpimäärä). Olet vastuussa vaativista suorituskykyongelmista strategisilla asiakkuuksilla ja luot mitattavia parannuksia sekä uudelleenkäytettäviä menetelmiä. KESKEISET VASTUUT: - Aja suorituskyvyn optimointia päästä päähän vLLM:ssä johtavilla malleilla ja asiakasrelevantteihin palvelukonfiguraatioihin, kuroen umpeen kilpailuetuja ydin- ja järjestelmätason optimoinneilla - Profiloi, diagnosoi ja ratkaise vLLM-käyttöönottojen poikkitason suorituskykyongelmia GPU-ytimistä ja operaattorien ohjauksesta vLLM-ajastimeen, PagedAttention/KV-välimuistin hallintaan ja monisolmun viestintään - Diagnosoi ydin-tason suorituskykyongelmia profilointityökaluilla: tunnista käyttöasteen rajoitukset, L2-välimuistin tyhjennys (thrashing), rekisteripaine, muistin koaleskenssiongelmat jne., ja muuta löydökset toiminnallisiksi optimoinneiksi - Osallistu asiakasrajapinnan teknisiin projekteihin: esittele löydökset, suosittele optimointeja ja toimita mitattavia suorituskyvyn parannuksia vLLM:ssä - Integroi ja optimoi mukautettuja ytimiä (Triton, Gluon, CK, PyDSL, ASM, AITER) vLLM:ään ymmärtäen ohjauspolut, muodon erottaminen ja taustajärjestelmän valinta - Optimoi monisolmuinen hajautettu inferenssi vLLM:ssä: viestinnän ja laskennan päällekkäisyys, rinnakkaisuusstrategiat (TP/PP/EP/DP) ja skaalautuvuus - Osallistu yhteiseen suorituskyvyn optimointimetodologiaan, joka nostaa tiimin tasoa - Hyödynnä tekoälyagentteja päivittäisen työn nopeuttamiseksi ja auta määrittelemään parhaat käytännöt tekoälyavusteiselle suorituskyvyn suunnittelulle - Vie optimoinnit vLLM:ään ja muihin avoimen lähdekoodin kehyksiin, kuten SGLang ja PyTorch SUOSITELTU KOKEMUS: - Yli 5 vuoden ohjelmistokehityskokemus GPU-laskennasta, tekoälyjärjestelmistä tai suorituskykyisestä laskennasta (HPC) - Käytännön kokemus vLLM:n sisäisestä toiminnasta (V1-moottori, ajastin, PagedAttention/KV-välimuistin hallinta, chunked prefill, ROCm-taustaintegraatio); tuttuus SGLangiin, TensorRT-LLM:ään tai vastaaviin on etu - Vahva tausta päästä päähän ulottuvassa kuormituksen profiloinnissa ja pullonkaulojen diagnosoinnissa - Ymmärrys GPU-ytimen suorituskyvyn ominaisuuksista: käyttöaste, rekisteri- ja LDS-paine, muistin koaleskenssi, välimuistin hyödyntäminen, wavefront-ajastus ja ohjetason pullonkaulat - Kyky lukea ja analysoida ydin-tason profilointidataa ja muuttaa se konkreettisiksi optimointitoimiksi - Ymmärrys malliarkkitehtuureista (transformers, MoE, diffusion), inferenssiparadigmista (spekulatiivinen dekoodaus, prefill-decode-disaggregaatio, jatkuva eräajo) ja siitä, miten ne mapautuvat rautaan ja vLLM:n suoritusmalliin - Kokemus mukautettujen ydinten kehityksestä tai integroinnista (HIP, CUDA, Triton, CK tai vastaava) - Ymmärrys monen GPU:n ja monisolmuisten hajautettujen järjestelmien toiminnasta: scale-up ja scale-out topologiat, RCCL/NCCL, RDMA ja viestinnän ja laskennan päällekkäisyys - Vahva osaaminen Python- ja C++-kielissä - Kyky toimia asiakkaiden kanssa, esitellä löydöksiä ja tukea teknisiä päätöksiä - Sujuva tekoälyavusteinen kehitys: tekoälyagenttien ja -työkalujen päivittäinen käyttäjä - Vahva Linux-järjestelmien tuntemus - Erinomaiset englannin kielen kirjalliset ja suulliset viestintätaidot AKATEEMINEN TUTKINTO: Maisterin tai tohtorin tutkinto tietojenkäsittelytieteessä, tietotekniikassa, sähkötekniikassa tai vastaavassa. Jatkotutkinto on toivottu, mutta poikkeuksellinen alan kokemus arvostetaan yhtä paljon. SIJAINTI: Helsinki, Suomi tai Tukholma, Ruotsi.

Työn tiedot

Vastuualueet

  • Aja suorituskyvyn optimointia päästä päähän vLLM:ssä johtavilla malleilla ja palvelukonfiguraatioilla
  • Profiloi, diagnosoi ja ratkaise poikkitason suorituskykyongelmia GPU-ytimistä vLLM-ajastimeen
  • Tunnista ydin-tason ongelmia, kuten käyttöasteen rajoituksia ja L2-välimuistin tyhjennystä, profilointityökaluilla
  • Osallistu asiakasrajapinnan teknisiin projekteihin ja toimita mitattavia suorituskyvyn parannuksia
  • Integroi ja optimoi mukautettuja ytimiä (Triton, Gluon, CK, PyDSL, ASM, AITER) vLLM:ään
  • Optimoi monisolmuinen hajautettu inferenssi, mukaan lukien viestinnän ja laskennan päällekkäisyys
  • Kehitä yhteisiä suorituskyvyn optimointimetodologioita tiimille
  • Hyödynnä tekoälyagentteja päivittäisen työn nopeuttamiseksi ja määrittele tekoälyavusteisen suunnittelun parhaat käytännöt
  • Vie optimoinnit vLLM:ään, SGLangiin ja PyTorchiin

Vaatimukset

  • Yli 5 vuoden ohjelmistokehityskokemus GPU-laskennasta, tekoälyjärjestelmistä tai suorituskykyisestä laskennasta
  • Käytännön kokemus vLLM:n sisäisestä toiminnasta (V1-moottori, ajastin, PagedAttention/KV-välimuistin hallinta, chunked prefill, ROCm-taustaintegraatio)
  • Vahva tausta päästä päähän ulottuvassa kuormituksen profiloinnissa ja pullonkaulojen diagnosoinnissa
  • Ymmärrys GPU-ytimen suorituskyvyn ominaisuuksista (käyttöaste, rekisteri-/LDS-paine, muistin koaleskenssi, välimuistin hyödyntäminen)
  • Kyky analysoida ydin-tason profilointidataa ja muuttaa se optimoinneiksi
  • Ymmärrys malliarkkitehtuureista (transformers, MoE, diffusion) ja inferenssiparadigmista
  • Kokemus mukautettujen ydinten kehityksestä tai integroinnista (HIP, CUDA, Triton, CK tai vastaava)
  • Ymmärrys monen GPU:n ja monisolmuisten hajautettujen järjestelmien toiminnasta (RCCL/NCCL, RDMA)
  • Vahva osaaminen Python- ja C++-kielissä
  • Vahva Linux-järjestelmien tuntemus
  • Erinomaiset englannin kielen kirjalliset ja suulliset viestintätaidot

Taidot ja teknologiat

vLLMROCmGPU-ytimetTritonGluonCKPyDSLASMAITERPythonC++LinuxSGLangPyTorchTensorRT-LLMHIPCUDARCCLNCCLRDMA
Seen 2 hours agoContent Complete
AMD-logo
AMD · 15 avointa tehtävää
Suosituimmat sijainnit: Helsinki, Suomi · 7 · Etätyö - Suomi · 2 · Remote - Global · 1+5 muuta sijaintia
Näytä yritysprofiili
Yleisimmät rekrytoidut roolit
Ohjelmistoinsinööri
3
Henkilöstöasiantuntija
2
Data Scientist
2
Tutkija
2
Muu
1
Roolitasojen jakautuma
Keskitaso (2)

Help us improve JobCrawls — sign in to sync saved jobs across devices, or send feedback anytime.