AMD-logotyp
Beräknad månadslön
Uppskattat €2 630 - €3 184
Publicerad 15 juli 2026 · för 23 dagar sedanSenast sedd 7 augusti 2026Sista ansökningsdag 9 juli 2027

AI-prestandaingenjör

Senior AI-prestandaingenjör - LLM-inferens (vLLM)
Helsingfors, Finland
Hybrid · Programvaruteknik
Heltid · Senior
Engelska
Ingen personalhantering
Masters
5 års erfarenhet
Hur denna lön står sig i jämförelse
Lönekontext: AI-prestandaingenjör

Håll muspekaren över eller tryck på en rad för fullständig statistik (EUR / månad i detta diagram).

Månadslönjämförelse för AI-prestandaingenjör
\n\n---\n\n MarknadNedre gräns (25:e percentilen)\n\n---\n\n Median\n\n---\n\n Övre gräns (75:e percentilen)
Lön i vår data — anges ej i annonsen (Senior)€219/per månad€242/per månad€265/per månad
Om rollen

AMD söker en prestandafokuserad senior ingenjör för att maximera AI-inferensprestandan på AMD-GPU:er, främst med hjälp av serveringsramverket vLLM. Du kommer att arbeta i hela stacken: profilering, diagnostik och optimering av ledande modeller som körs på vLLM i kundrelevanta serveringskonfigurationer (t.ex. agentisk kodning, lång kontext, hög genomströmning). Du kommer att ansvara för svåra prestandaproblem i våra mest strategiska kunduppdrag och lämna efter dig mätbara förbättringar och återanvändbara metodiker. HUVUDANSVAR: - Driva prestandaoptimering från ände till ände i vLLM för ledande modeller och kundrelevanta serveringskonfigurationer, och stänga konkurrensgap genom optimeringar på kärn- och systemnivå - Profilera, diagnostisera och lösa prestandaflaskhalsar i vLLM-distributioner, från GPU-kärnor och operatörsdispatch till vLLM-schemaläggaren, PagedAttention/KV-cachehantering och kommunikation mellan flera noder - Diagnostisera prestandaproblem på kärnnivå med profileringsverktyg: identifiera begränsningar i beläggning, L2-cache-thrashing, registertryck, problem med minneskoalescens etc., och översätta fynden till konkreta optimeringar - Bidra till kundnära tekniska uppdrag: presentera resultat, rekommendera optimeringar och leverera mätbara prestandaförbättringar i vLLM - Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom vLLM, med förståelse för dispatch-vägar, formextraktion och backend-val - Optimera distribuerad inferens över flera noder i vLLM: överlappning mellan kommunikation och beräkning, parallelliseringsstrategier (TP/PP/EP/DP) och skalningsprestanda - Bidra till en gemensam metodik för prestandaoptimering som höjer nivån i teamet - Använda AI-agenter för att accelerera det dagliga arbetet och hjälpa till att definiera bästa praxis för AI-assisterad prestandateknik - Bidra med optimeringar till vLLM och närliggande open source-ramverk som SGLang och PyTorch ÖNSKAD ERFARENHET: - 5+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller högpresterande beräkningar (HPC) - Praktisk erfarenhet av vLLM-internals (V1-motor, schemaläggare, PagedAttention/KV-cachehanterare, chunked prefill, ROCm-backend-integration); bekantskap med SGLang, TensorRT-LLM eller liknande är ett plus - Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar - Förståelse för GPU-kärnprestanda: beläggning, register- och LDS-tryck, minneskoalescens, cacheutnyttjande, wavefront-schemaläggning och flaskhalsar på instruktionsnivå - Förmåga att läsa och analysera profileringsdata på kärnnivå och översätta det till konkreta optimeringsåtgärder - Förståelse för modellarkitekturer (transformers, MoE, diffusion), inferensparadigm (spekulativ avkodning, prefill-decode-disaggregering, kontinuerlig batchning) och hur dessa mappar mot hårdvara och vLLM:s exekveringsmodell - Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK eller liknande) - Förståelse för distribuerade system med flera GPU:er och noder: scale-up och scale-out topologier, RCCL/NCCL, RDMA och överlappning mellan kommunikation och beräkning - Starkt kunnande i Python och C++ - Förmåga att interagera med kunder, presentera resultat och stödja tekniska beslut - Flyt i AI-assisterad utveckling: daglig användare av AI-agenter och verktyg - Starka kunskaper i Linux-system - Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter AKADEMISKA MERITER: Master eller doktorsexamen i datavetenskap, datorteknik, elektroteknik eller motsvarande. Avancerad examen föredras, men exceptionell branscherfarenhet värderas lika högt. PLATS: Helsingfors, Finland eller Stockholm, Sverige.

Jobbdetaljer

Ansvarsområden

  • Driva prestandaoptimering från ände till ände i vLLM för ledande modeller och serveringskonfigurationer
  • Profilera, diagnostisera och lösa prestandaflaskhalsar från GPU-kärnor till vLLM-schemaläggaren
  • Identifiera problem på kärnnivå, såsom beläggningsbegränsningar och L2-cache-thrashing, med profileringsverktyg
  • Bidra till kundnära tekniska uppdrag och leverera mätbara prestandaförbättringar
  • Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom vLLM
  • Optimera distribuerad inferens över flera noder, inklusive överlappning mellan kommunikation och beräkning
  • Utveckla gemensamma metodiker för prestandaoptimering för teamet
  • Använda AI-agenter för att accelerera det dagliga arbetet och definiera bästa praxis för AI-assisterad teknik
  • Bidra med optimeringar till vLLM, SGLang och PyTorch

Krav

  • 5+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller högpresterande beräkningar
  • Praktisk erfarenhet av vLLM-internals (V1-motor, schemaläggare, PagedAttention/KV-cachehanterare, chunked prefill, ROCm-backend-integration)
  • Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar
  • Förståelse för GPU-kärnprestanda (beläggning, register-/LDS-tryck, minneskoalescens, cacheutnyttjande)
  • Förmåga att analysera profileringsdata på kärnnivå och översätta det till optimeringar
  • Förståelse för modellarkitekturer (transformers, MoE, diffusion) och inferensparadigm
  • Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK eller liknande)
  • Förståelse för distribuerade system med flera GPU:er och noder (RCCL/NCCL, RDMA)
  • Starkt kunnande i Python och C++
  • Starka kunskaper i Linux-system
  • Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter

Kompetenser & tekniker

vLLMROCmGPU-kärnorTritonGluonCKPyDSLASMAITERPythonC++LinuxSGLangPyTorchTensorRT-LLMHIPCUDARCCLNCCLRDMA

Utbildningsnivå

Masters
Seen 2 hours agoContent Complete
AMD-logotyp
AMD · 15 lediga tjänster
Topporter: Helsingfors, Finland · 7 · Distans - Finland · 2 · Distans - Nederländerna · 1+5 andra platser
Visa företag
Vanligaste rollerna
Systemutvecklare
3
Forskare
2
Data Scientist
2
HR-specialist
2
Annat
1
Fördelning av senioritetsnivåer
Medelnivå (2)

Help us improve JobCrawls — sign in to sync saved jobs across devices, or send feedback anytime.