
Håll muspekaren över eller tryck på en rad för fullständig statistik (EUR / månad i detta diagram).
| \n\n---\n\n Marknad | Nedre gräns (25:e percentilen) | \n\n---\n\n Median | \n\n---\n\n Övre gräns (75:e percentilen) |
|---|---|---|---|
| Lön i vår data — anges ej i annonsen (Senior) | €219/per månad | €242/per månad | €265/per månad |
AMD söker en prestandafokuserad senior ingenjör för att maximera AI-inferensprestandan på AMD-GPU:er, främst med hjälp av serveringsramverket vLLM. Du kommer att arbeta i hela stacken: profilering, diagnostik och optimering av ledande modeller som körs på vLLM i kundrelevanta serveringskonfigurationer (t.ex. agentisk kodning, lång kontext, hög genomströmning). Du kommer att ansvara för svåra prestandaproblem i våra mest strategiska kunduppdrag och lämna efter dig mätbara förbättringar och återanvändbara metodiker. HUVUDANSVAR: - Driva prestandaoptimering från ände till ände i vLLM för ledande modeller och kundrelevanta serveringskonfigurationer, och stänga konkurrensgap genom optimeringar på kärn- och systemnivå - Profilera, diagnostisera och lösa prestandaflaskhalsar i vLLM-distributioner, från GPU-kärnor och operatörsdispatch till vLLM-schemaläggaren, PagedAttention/KV-cachehantering och kommunikation mellan flera noder - Diagnostisera prestandaproblem på kärnnivå med profileringsverktyg: identifiera begränsningar i beläggning, L2-cache-thrashing, registertryck, problem med minneskoalescens etc., och översätta fynden till konkreta optimeringar - Bidra till kundnära tekniska uppdrag: presentera resultat, rekommendera optimeringar och leverera mätbara prestandaförbättringar i vLLM - Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom vLLM, med förståelse för dispatch-vägar, formextraktion och backend-val - Optimera distribuerad inferens över flera noder i vLLM: överlappning mellan kommunikation och beräkning, parallelliseringsstrategier (TP/PP/EP/DP) och skalningsprestanda - Bidra till en gemensam metodik för prestandaoptimering som höjer nivån i teamet - Använda AI-agenter för att accelerera det dagliga arbetet och hjälpa till att definiera bästa praxis för AI-assisterad prestandateknik - Bidra med optimeringar till vLLM och närliggande open source-ramverk som SGLang och PyTorch ÖNSKAD ERFARENHET: - 5+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller högpresterande beräkningar (HPC) - Praktisk erfarenhet av vLLM-internals (V1-motor, schemaläggare, PagedAttention/KV-cachehanterare, chunked prefill, ROCm-backend-integration); bekantskap med SGLang, TensorRT-LLM eller liknande är ett plus - Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar - Förståelse för GPU-kärnprestanda: beläggning, register- och LDS-tryck, minneskoalescens, cacheutnyttjande, wavefront-schemaläggning och flaskhalsar på instruktionsnivå - Förmåga att läsa och analysera profileringsdata på kärnnivå och översätta det till konkreta optimeringsåtgärder - Förståelse för modellarkitekturer (transformers, MoE, diffusion), inferensparadigm (spekulativ avkodning, prefill-decode-disaggregering, kontinuerlig batchning) och hur dessa mappar mot hårdvara och vLLM:s exekveringsmodell - Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK eller liknande) - Förståelse för distribuerade system med flera GPU:er och noder: scale-up och scale-out topologier, RCCL/NCCL, RDMA och överlappning mellan kommunikation och beräkning - Starkt kunnande i Python och C++ - Förmåga att interagera med kunder, presentera resultat och stödja tekniska beslut - Flyt i AI-assisterad utveckling: daglig användare av AI-agenter och verktyg - Starka kunskaper i Linux-system - Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter AKADEMISKA MERITER: Master eller doktorsexamen i datavetenskap, datorteknik, elektroteknik eller motsvarande. Avancerad examen föredras, men exceptionell branscherfarenhet värderas lika högt. PLATS: Helsingfors, Finland eller Stockholm, Sverige.
Jobbdetaljer
Ansvarsområden
- Driva prestandaoptimering från ände till ände i vLLM för ledande modeller och serveringskonfigurationer
- Profilera, diagnostisera och lösa prestandaflaskhalsar från GPU-kärnor till vLLM-schemaläggaren
- Identifiera problem på kärnnivå, såsom beläggningsbegränsningar och L2-cache-thrashing, med profileringsverktyg
- Bidra till kundnära tekniska uppdrag och leverera mätbara prestandaförbättringar
- Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom vLLM
- Optimera distribuerad inferens över flera noder, inklusive överlappning mellan kommunikation och beräkning
- Utveckla gemensamma metodiker för prestandaoptimering för teamet
- Använda AI-agenter för att accelerera det dagliga arbetet och definiera bästa praxis för AI-assisterad teknik
- Bidra med optimeringar till vLLM, SGLang och PyTorch
Krav
- 5+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller högpresterande beräkningar
- Praktisk erfarenhet av vLLM-internals (V1-motor, schemaläggare, PagedAttention/KV-cachehanterare, chunked prefill, ROCm-backend-integration)
- Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar
- Förståelse för GPU-kärnprestanda (beläggning, register-/LDS-tryck, minneskoalescens, cacheutnyttjande)
- Förmåga att analysera profileringsdata på kärnnivå och översätta det till optimeringar
- Förståelse för modellarkitekturer (transformers, MoE, diffusion) och inferensparadigm
- Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK eller liknande)
- Förståelse för distribuerade system med flera GPU:er och noder (RCCL/NCCL, RDMA)
- Starkt kunnande i Python och C++
- Starka kunskaper i Linux-system
- Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter
Kompetenser & tekniker
Utbildningsnivå
MastersFörmåner & Perks

Relaterade möjligheter
Hitta fler möjligheter som matchar dina intressen och färdigheter