
Nebius rakentaa korkean suorituskyvyn AI-pilvialustaa, ja etsimme tekoälyn observoinnin insinööriä vastaamaan AI-observoinnin perusrakenteesta — LLM- ja agenttien seurannasta alusta- ja infrastruktuurimetriikoihin — jotta Azure AI -alusta olisi näkyvä, mitattava, luotettava ja itsepalveluun perustuva. Vastuualueesi: - Käynnistää ja operoida LLM- ja agenttien monitorointia Langfusella. - Kerätä jälkiä, viiveitä, token-käyttöä, kustannuksia, laatupisteitä, prompt- ja malliversioanalyyseja sekä turvasignaaleja. - Rakentaa kevyitä sisäisiä työkaluja ja eksporttereita Pythonilla. - Suunnitella ja ylläpitää Grafana-näyttötauluja, Prometheus-metriikoita ja Azuren observointipinoa. - Instrumentoida alustan ja tekoälykuormien terveys, käyttö, kustannukset ja SLA-raportointi. - Syöttää telemetriaa ja operatiivisia oivalluksia Platform Engineeringin backlogiin. - Vastata Terraform IaC:sta ja CI/CD:stä observointityökaluille. - Tukea incidenttien tutkintaa ja juurisyyanalyyseja. Pakolliset vaatimukset: - 5–8 vuoden kokemus observoinnista, SRE:stä, alustatekniikasta, DevOpsista tai pilvitekniikasta. - Vahva kokemus Azure Monitorista, Application Insightsista, Log Analyticsista ja Managed Grafanasta. - Käytännön kokemus Langfusesta, Grafanasta ja Prometheuksesta. - Kokemus Terraformista ja CI/CD:stä. - Python-taidot instrumentointiin, eksporttereihin ja automaatioon. - Tuttuus ML-työkuormista ja tekoälykohtaisista metriikoista. - Tieto lokeista, metriikoista, jäljistä, näyttötauluista, hälytyksistä, SLI:sta ja SLO:sta. - Vähintään keskitason englannin kielen taito. Toivottavaa: - PromQL ja Kusto Query Language. - OpenTelemetry, mukaan lukien GenAI-semanttiset konventiot. - LLM-arviointikehykset. - AI-kustannusnäyttötaulut ja FinOps. - Hälytys-, päivystys- ja incidentinhallintatyökalut. - AKS- ja Kubernetes-observointi.
Työn tiedot
Vastuualueet
- Käynnistää ja operoida LLM- ja agenttien monitorointia Langfusella
- Kerätä jälkiä, viiveitä, token-käyttöä, kustannuksia, laatupisteitä, prompt- ja malliversioanalyyseja sekä turvasignaaleja
- Rakentaa kevyitä sisäisiä työkaluja ja eksporttereita Pythonilla
- Suunnitella ja ylläpitää Grafana-näyttötauluja, Prometheus-metriikoita ja Azuren observointipinoa
- Instrumentoida alustan ja tekoälykuormien terveys, käyttö, kustannukset ja SLA-raportointi
- Syöttää telemetriaa ja operatiivisia oivalluksia Platform Engineeringin backlogiin
- Vastata Terraform IaC:sta ja CI/CD:stä observointityökaluille
- Tukea incidenttien tutkintaa ja juurisyyanalyyseja
Vaatimukset
- 5–8 vuoden kokemus observoinnista, SRE:stä, alustatekniikasta, DevOpsista tai pilvitekniikasta
- Vahva kokemus Azure Monitorista, Application Insightsista, Log Analyticsista ja Managed Grafanasta
- Käytännön kokemus Langfusesta, Grafanasta ja Prometheuksesta
- Kokemus Terraformista ja CI/CD:stä
- Python-taidot instrumentointiin, eksporttereihin ja automaatioon
- Tuttuus ML-työkuormista ja tekoälykohtaisista metriikoista
- Tieto lokeista, metriikoista, jäljistä, näyttötauluista, hälytyksistä, SLI:sta ja SLO:sta
- Vähintään keskitason englannin kielen taito
Taidot ja teknologiat

Aiheeseen liittyvät mahdollisuudet
Löydä lisää kiinnostuksen kohteisiisi ja taitoihisi sopivia mahdollisuuksia