
Håll muspekaren över eller tryck på en rad för fullständig statistik (EUR / månad i detta diagram).
| \n\n---\n\n Marknad | Nedre gräns (25:e percentilen) | \n\n---\n\n Median | \n\n---\n\n Övre gräns (75:e percentilen) |
|---|---|---|---|
| Lön i vår data — anges ej i annonsen (Senior) | €219/per månad | €242/per månad | €265/per månad |
AMD söker en prestandafokuserad ingenjör för att driva AI-inferensprestandan till den absoluta gränsen på AMD-GPU:er, med SGLang som primärt serveringsramverk. Du kommer att leda ett litet, högtekniskt team och arbeta ända till slut över hela stacken: profilering, diagnostik och optimering av ledande modeller som körs på SGLang i kundrelevanta serveringskonfigurationer (t.ex. agentisk kodning, lång kontext, hög genomströmning). HUVUDANSVAR: - Driva prestandaoptimering från start till slut på SGLang över ledande modeller och kundrelevanta konfigurationer genom optimeringar på kärn- och systemnivå - Profilera, diagnostisera och lösa de svåraste prestandaflaskhalsarna i SGLang-distributioner, från GPU-kärnor och operatörsdispatch till SGLang-schemaläggaren, RadixAttention/prefix-caching och kommunikation mellan flera noder - Diagnostisera prestandaproblem på kärnnivå med profileringsverktyg: identifiera begränsningar i beläggning, L2-cache-thrashing, registertryck, minneskoalescensproblem etc. - Leda kundvända tekniska engagemang: presentera resultat, rekommendera optimeringar och leverera mätbara prestandaförbättringar - Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom SGLang - Optimera distribuerad inferens i flera noder på SGLang: överlappning av kommunikation och beräkning, parallelliseringsstrategier (TP/EP/DP) - Utveckla och förfina en gemensam metodik för prestandaoptimering - Använda AI-agenter för att accelerera dagligt arbete - Bidra med optimeringar till SGLang och närliggande open source-ramverk som vLLM och PyTorch ÖNSKAD ERFARENHET: - 7+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller HPC - Djup praktisk erfarenhet av SGLang-internals; vLLM, TensorRT-LLM eller liknande är ett plus - Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar - Förståelse för GPU-kärnprestanda: beläggning, register- och LDS-tryck, minneskoalescens, cacheutnyttjande - Förståelse för modellarkitekturer (transformers, MoE, diffusion) och inferensparadigm (spekulativ avkodning, kontinuerlig batchning) - Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK) - Förståelse för distribuerade system med flera GPU:er och noder: RCCL/NCCL, RDMA - Starkt kunnande i Python och C++ - Erfarenhet av kundvända tekniska ledarskap - Flyt i AI-assisterad utveckling - Starka kunskaper i Linux-system - Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter AKADEMISKA MERITER: Master eller doktorsexamen i datavetenskap, datorteknik, elektroteknik eller motsvarande.
Jobbdetaljer
Ansvarsområden
- Driva prestandaoptimering från start till slut på SGLang över ledande modeller och kundkonfigurationer
- Profilera, diagnostisera och lösa prestandaflaskhalsar från GPU-kärnor till SGLang-schemaläggaren
- Identifiera och lösa problem på kärnnivå, såsom begränsningar i beläggning och L2-cache-thrashing
- Leda kundvända tekniska engagemang och leverera mätbara prestandaförbättringar
- Integrera och optimera anpassade kärnor (Triton, Gluon, CK, PyDSL, ASM, AITER) inom SGLang
- Optimera distribuerad inferens i flera noder med fokus på överlappning av kommunikation och beräkning
- Utveckla en gemensam metodik för prestandaoptimering för teamet
- Använda AI-agenter för att accelerera arbetsflöden och definiera bästa praxis för AI-assisterad teknik
- Bidra med optimeringar till SGLang, vLLM och PyTorch
Krav
- 7+ års erfarenhet av programvaruutveckling inom GPU-beräkningar, AI-system eller HPC
- Djup praktisk erfarenhet av SGLang-internals
- Stark bakgrund inom profilering av arbetsbelastningar och diagnos av flaskhalsar
- Förståelse för GPU-kärnprestanda (beläggning, register-/LDS-tryck, minneskoalescens, cacheutnyttjande)
- Förståelse för modellarkitekturer (transformers, MoE, diffusion) och inferensparadigm (spekulativ avkodning, kontinuerlig batchning)
- Erfarenhet av utveckling eller integration av anpassade kärnor (HIP, CUDA, Triton, CK eller liknande)
- Förståelse för distribuerade system med flera GPU:er och noder (RCCL/NCCL, RDMA)
- Starkt kunnande i Python och C++
- Erfarenhet av kundvända tekniska ledarskap
- Starka kunskaper i Linux-system
- Utmärkta skriftliga och muntliga engelska kommunikationsfärdigheter
- Master eller doktorsexamen i datavetenskap, datorteknik, elektroteknik eller motsvarande
Kompetenser & tekniker
Utbildningsnivå
Masters
Relaterade möjligheter
Hitta fler möjligheter som matchar dina intressen och färdigheter