
Nebius bygger en högpresterande AI-molnplattform och vi söker en AI-observabilitetsingenjör som ska ansvara för AI-observabilitetens ryggrad — från spårning av LLM och agenter till plattforms- och infrastrukturmetrik — så att Azure AI-plattformen blir synlig, mätbar, tillförlitlig och självbetjänande. Dina ansvarsområden: - Starta och driva övervakning av LLM och agenter med Langfuse. - Fånga spår, latens, tokenanvändning, kostnad, kvalitetsvärden, analys av prompter och modellversioner samt säkerhetssignaler. - Bygga lätta interna verktyg och exportörer i Python. - Designa och underhålla Grafana-instrumentpaneler, Prometheus-metrik och Azure-observabilitetsstacken. - Instrumentera plattforms- och AI-arbetsbelastningar för hälsa, användning, kostnad och SLA-rapportering. - Mata in telemetri och operativa insikter i Platform Engineerings backlog. - Ansvara för Terraform IaC och CI/CD för observabilitetsverktyg. - Stödja incidentutredning och rotorsaksanalys. Krav: - 5–8 års erfarenhet av observabilitet, SRE, plattformsteknik, DevOps eller molnteknik. - Stark erfarenhet av Azure Monitor, Application Insights, Log Analytics och Managed Grafana. - Praktisk erfarenhet av Langfuse, Grafana och Prometheus. - Erfarenhet av Terraform och CI/CD. - Python-kunskaper för instrumentering, exportörer och automatisering. - Bekantskap med ML-arbetsbelastningar och AI-specifik metrik. - Kunskap om loggar, metrik, spår, instrumentpaneler, larm, SLI:er och SLO:er. - Medelnivå eller högre engelska. Meriterande: - PromQL och Kusto Query Language. - OpenTelemetry, inklusive GenAI semantiska konventioner. - Ramverk för LLM-utvärdering. - AI-kostnadsspaneler och FinOps. - Verktyg för larm, jour och incidenthantering. - AKS- och Kubernetes-observabilitet.
Jobbdetaljer
Ansvarsområden
- Starta och driva övervakning av LLM och agenter med Langfuse
- Fånga spår, latens, tokenanvändning, kostnad, kvalitetsvärden, analys av prompter och modellversioner samt säkerhetssignaler
- Bygga lätta interna verktyg och exportörer i Python
- Designa och underhålla Grafana-instrumentpaneler, Prometheus-metrik och Azure-observabilitetsstacken
- Instrumentera plattforms- och AI-arbetsbelastningar för hälsa, användning, kostnad och SLA-rapportering
- Mata in telemetri och operativa insikter i Platform Engineerings backlog
- Ansvara för Terraform IaC och CI/CD för observabilitetsverktyg
- Stödja incidentutredning och rotorsaksanalys
Krav
- 5–8 års erfarenhet av observabilitet, SRE, plattformsteknik, DevOps eller molnteknik
- Stark erfarenhet av Azure Monitor, Application Insights, Log Analytics och Managed Grafana
- Praktisk erfarenhet av Langfuse, Grafana och Prometheus
- Erfarenhet av Terraform och CI/CD
- Python-kunskaper för instrumentering, exportörer och automatisering
- Bekantskap med ML-arbetsbelastningar och AI-specifik metrik
- Kunskap om loggar, metrik, spår, instrumentpaneler, larm, SLI:er och SLO:er
- Medelnivå eller högre engelska
Kompetenser & tekniker

Relaterade möjligheter
Hitta fler möjligheter som matchar dina intressen och färdigheter