AMD-logotyp
Beräknad månadslön
Uppskattat €2 630 - €3 184
Publicerad 15 juli 2026 · för 23 dagar sedanSenast sedd 7 augusti 2026Sista ansökningsdag 9 juli 2027

AI-prestandaingenjör

Principal AI-prestandaingenjör - LLM-inferens (SGLang)
Helsingfors, Finland
Hybrid · Programvaruteknik
Heltid · Senior
Engelska
Ingen personalhantering
Masters
7 års erfarenhet
Hur denna lön står sig i jämförelse
Lönekontext: AI-prestandaingenjör

Håll muspekaren över eller tryck på en rad för fullständig statistik (EUR / månad i detta diagram).

Månadslönjämförelse för AI-prestandaingenjör
\n\n---\n\n MarknadNedre gräns (25:e percentilen)\n\n---\n\n Median\n\n---\n\n Övre gräns (75:e percentilen)
Lön i vår data — anges ej i annonsen (Senior)€219/per månad€242/per månad€265/per månad
Om rollen

AMD söker en prestandafokuserad ingenjör för att driva AI-inferensprestandan till den absoluta gränsen på AMD-GPU:er, med SGLang som primärt serveringsramverk. Du kommer att leda ett litet, högtekniskt team och arbeta ända till slut över hela stacken: profilering, diagnostik och optimering av ledande modeller som körs på SGLang i kundrelevanta serveringskonfigurationer (t.ex. agentisk kodning, lång kontext, hög genomströmning). HUVUDANSVAR: - Driva prestandaoptimering från start till slut på SGLang över ledande modeller och kundrelevanta konfigurationer genom optimeringar på kärn- och systemnivå - Profilera, diagnostisera och lösa de svåraste prestandaflaskhalsarna i SGLang-distributioner, från GPU-kärnor och operatörsdispatch till SGLang-schemaläggaren, RadixAttention/prefix-caching och kommunikation mellan flera noder - Diagnostisera prestandaproblem på kärnnivå med profileringsverktyg: identifiera begränsningar i beläggning, L2-cache-thrashing, registertryck, minneskoalescensproblem etc. - Leda kundvända tekniska engagemang: presentera resultat, rekommendera optimeringar och leverera mätbara prestandaförbättringar - Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom SGLang - Optimera distribuerad inferens i flera noder på SGLang: överlappning av kommunikation och beräkning, parallelliseringsstrategier (TP/EP/DP) - Utveckla och förfina en gemensam metodik för prestandaoptimering - Använda AI-agenter för att accelerera dagligt arbete - Bidra med optimeringar till SGLang och närliggande open source-ramverk som vLLM och PyTorch ÖNSKAD ERFARENHET: - 7+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller HPC - Djup praktisk erfarenhet av SGLang-internals; vLLM, TensorRT-LLM eller liknande är ett plus - Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar - Förståelse för GPU-kärnprestanda: beläggning, register- och LDS-tryck, minneskoalescens, cacheutnyttjande - Förståelse för modellarkitekturer (transformers, MoE, diffusion) och inferensparadigm (spekulativ avkodning, kontinuerlig batchning) - Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK) - Förståelse för distribuerade system med flera GPU:er och noder: RCCL/NCCL, RDMA - Starkt kunnande i Python och C++ - Erfarenhet av kundvända tekniska ledarskap - Flyt i AI-assisterad utveckling - Starka kunskaper i Linux-system - Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter AKADEMISKA MERITER: Master eller doktorsexamen i datavetenskap, datorteknik, elektroteknik eller motsvarande.

Jobbdetaljer

Ansvarsområden

  • Driva prestandaoptimering från start till slut på SGLang över ledande modeller och kundkonfigurationer
  • Profilera, diagnostisera och lösa prestandaflaskhalsar från GPU-kärnor till SGLang-schemaläggaren
  • Identifiera och lösa problem på kärnnivå, såsom begränsningar i beläggning och L2-cache-thrashing
  • Leda kundvända tekniska engagemang och leverera mätbara prestandaförbättringar
  • Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom SGLang
  • Optimera distribuerad inferens i flera noder med fokus på överlappning av kommunikation och beräkning
  • Utveckla en gemensam metodik för prestandaoptimering för teamet
  • Använda AI-agenter för att accelerera arbetsflöden och definiera bästa praxis för AI-assisterad teknik
  • Bidra med optimeringar till SGLang, vLLM och PyTorch

Krav

  • 7+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller HPC
  • Djup praktisk erfarenhet av SGLang-internals
  • Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar
  • Förståelse för GPU-kärnprestanda (beläggning, register-/LDS-tryck, minneskoalescens, cacheutnyttjande)
  • Förståelse för modellarkitekturer (transformers, MoE, diffusion) och inferensparadigm (spekulativ avkodning, kontinuerlig batchning)
  • Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK eller liknande)
  • Förståelse för distribuerade system med flera GPU:er och noder (RCCL/NCCL, RDMA)
  • Starkt kunnande i Python och C++
  • Erfarenhet av kundvända tekniska ledarskap
  • Starka kunskaper i Linux-system
  • Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter
  • Master eller doktorsexamen i datavetenskap, datorteknik, elektroteknik eller motsvarande

Kompetenser & tekniker

SGLangvLLMPyTorchTritonGluonCKPyDSLASMAITERHIPCUDARCCLNCCLRDMAPythonC++Linux

Utbildningsnivå

Masters
Seen 2 hours agoContent Complete
AMD-logotyp
AMD · 15 lediga tjänster
Topporter: Helsingfors, Finland · 7 · Distans - Finland · 2 · Distans - Nederländerna · 1+5 andra platser
Visa företag
Vanligaste rollerna
Systemutvecklare
3
HR-specialist
2
Forskare
2
Data Scientist
2
Annat
1
Fördelning av senioritetsnivåer
Medelnivå (2)

Help us improve JobCrawls — sign in to sync saved jobs across devices, or send feedback anytime.