Hoppa till innehåll

Vad är AiQu?

AiQu kör Docker-containrar på delade GPU- och CPU-maskiner.

Du kommer med en image och säger hur mycket du behöver. AiQu hittar en maskin som kan ta det, startar din container där, ger dig en terminal och en URL in i den, och stoppar den när körtiden tar slut. Det du betalar för är tiden din container faktiskt höll de resurserna.

Det är hela erbjudandet. Det är med flit inte ett Kubernetes, inte en notebook-tjänst och inte en MLOps-pipeline. Det är ett sätt att få en container på en GPU utan att äga GPU:n.

Någon med en modell att träna eller ett experiment att köra. Du har en Docker-image, eller nöjer dig med en av de färdiga, och behöver några timmar på en riktig GPU. Du vill inte lära dig en schemaläggare.

Ett team som äger GPU:er och vill låta andra använda dem. Du lägger in dina maskiner som noder, grupperar dem i köer och delar ut åtkomst per användargrupp. Maskinerna förblir dina; schemaläggningen och redovisningen är inte längre ditt problem.

En organisation som kör flera av båda. Varje team får en tenant. Tenants ser inte varandras jobb, användare, lagring eller noder.

  • Vilken image som helst. Docker Hub, eller ett privat registry din tenant har konfigurerat.
  • Ett skal. En terminal i webbläsaren, eller SSH från din egen maskin.
  • En URL. Varje port din container lyssnar på kan proxas ut, publikt eller privat, med ett IP-filter om du vill ha ett.
  • Lagring som överlever. Buckets du monterar in i containern. Allt utanför en montering är borta när jobbet tar slut.
  • En räkning som går att läsa. Tokens, debiterade per minut för hållna resurser, med transaktionshistorik per jobb.

AiQu startar inte om ditt jobb när det kraschar, skalar inte automatiskt, och håller inte en container vid liv för att den fortfarande gör något nyttigt. Behöver du mer tid förlänger du jobbet innan det går ut.

En nod är en maskin som har anslutit sig till en tenant. Det kan vara en server i ett rack, en arbetsstation under någons skrivbord, eller en låda hos en kund. Noder ansluter utåt till centralservern genom en tunnel, så en nod behöver inte vara nåbar från internet. Den behöver bara kunna nå AiQu.

Det är därför en nod kan vara offline. När den är det har köerna som beror på den ingenting att schemalägga på, och jobb blir stående. System-sidan är där du kollar det.