Hoppa till innehåll

Kör ditt första jobb

Användare

Det här går igenom ett riktigt jobb: en PyTorch-container, en timme, med en mapp monterad så ditt arbete överlever. När du är klar har du ett skal inne i en container på en GPU-nod.

Du behöver ett konto i en tenant, och kontot behöver tokens och behörighet att lägga jobb. Har du inte det än har din tenantadministratör det - inloggning förklarar hur konton blir till.

  1. Öppna Jobs och välj NEW JOB.

    Jobs-sidan är egentligen hela produkten. Allt annat stödjer den.

    Jobs-sidan med Quick Deploy-mallar ovanför en tabell med tidigare jobb.
  2. Ange en image.

    Skriv nvidia/pytorch:24.07-py3 i Docker image. Jobbnamnet fylls i av sig självt utifrån imagen; skriv över det om du vill.

    Låt Docker registry stå på Auto-detect. Den spelar bara roll för privata registries, som Docker-images täcker.

  3. Sätt en körtid.

    En timme är förvalet och räcker gott här. När den går ut stoppas containern, så ta i lite mer än du tror att du behöver. Du kan förlänga senare, men bara medan jobbet kör.

  4. Montera en mapp.

    Under Folders to mount, välj + ADD, peka ut din bucket och tryck MOUNT. Den dyker upp med en sökväg i containern, till exempel /homecatalog.

    Det här är steget folk hoppar över. Utan det raderas allt du skriver inne i containern när jobbet tar slut.

    Create New Job-panelen med en image satt och en mapp monterad, med sammanfattningen till höger.
  5. Läs sammanfattningen, köa sedan.

    Panelen till höger berättar fyra saker som är värda att kolla innan du spenderar något: vilken det hamnar på, när det är tillgängligt, vad det kostar, och om något är monterat.

    Välj QUEUE JOB.

  6. Se det starta.

    Jobbet dyker upp som booked och går vidare till running av sig självt. Listan uppdaterar sig själv.

    Jobbtabellen med ett nyss skapat jobb i tillståndet booked, som startar inom en minut.
  7. Skaffa ett skal.

    Fäll ut jobbraden, markera tjänsten i den, och använd Terminal i detaljpanelens huvud. Du är root inne i din container.

Du la ett jobb i en kö. Kön hade en nod som var online och hade en ledig GPU, så schemaläggaren bokade ditt jobb dit, hämtade imagen och startade containern med din bucket monterad på /homecatalog.

Från och med nu spenderar jobbet tokens varje minut, oavsett om du gör något med det. Avbryt det när du är klar. Körtiden är ett tak, inte ett mål.

Vad du ser Betyder oftast
QUEUE JOB förblir grå Ingen image, körtid noll, eller att du saknar behörigheten att lägga jobb i den kön
“This queue has no node that can run a job right now” Alla noder i kön är offline eller avstängda
Jobbet står kvar på queued och bokas aldrig Köns noder är upptagna. Sammanfattningens “Available in” sa det innan du skickade
failed nästan direkt Nästan alltid imagen: ett stavfel, eller ett privat registry utan credentials

Felsökning går igenom var och en ordentligt.

Exponera porten din app lyssnar på och öppna den som en proxy. Se Portar och proxies.