Modeļu serveri

Modeli var īrēt mūžīgi vai mašīnu nopirkt vienreiz.

Modeļu serveris ir mašīna ar GPU jūsu pašu serveru telpā, kas darbina atvērtos modeļus visiem uzņēmumā. Neviens neskaita jūsu tokenus, uzdevuma saturs nepamet tīklu, un noslogots mēnesis maksā tikpat, cik kluss. Četras konfigurācijas — no vienas GPU kastes desmit cilvēku komandai līdz astoņu GPU skapim.

  • Maksas par uzdevumu nav nekad
  • Uzdevuma saturs paliek jūsu tīklā
  • Dzelzs, salikšana un modeļu palaišana vienā cenā

Modeļu serverisNo viena līdz astoņiem GPU vienā korpusā

Vispirms par to

Harness licence un modeļu serveris ir divi dažādi pirkumi, un lielākā daļa uzņēmumu sāk tikai ar pirmo. Licence darbina AI darbinieku uz jūsu datora ar jebkuru modeli — arī ar mākoņa modeli. Modeļu serveri pērk tad, kad grib, lai pats modelis stāv ēkā. Harness licences cenas.

Kāpēc savs

Četras lietas, ko modelis ar skaitītāju nedod

Rēķins pārstāj augt līdz ar lietošanu

Maksa par uzdevumu visdārgāk maksā tieši par to, kā dēļ produkts tika pirkts. Rutīna, kas izlasa divsimt rēķinu, maksā divsimt reižu vairāk nekā tā, kas izlasa vienu, tāpēc mēnesis, kad kaut kas beidzot ir kārtīgi automatizēts, ir mēnesis, kad rēķins uzlec. Uz savas mašīnas šis skaitlis nekustas: noslogots GPU un dīkstāvē stāvošs maksā vienādi.

Saturs nepamet tīklu

Ko rutīna izlasa, to modelis redz — līgumus, algas, klientu datus, pirmkodu. Uz modeļu servera šis teksts ceļo starp divām mašīnām jūsu pašu ēkā, un atbilde auditoram, kur dati aizgāja, ir skapja numurs, nevis apakšapstrādātāju saraksts.

Modelis nemainās jums zem rokas

Mākoņa modeļus izslēdz, pārtrenē un ierobežo pēc sveša grafika, un rutīna, kas pagājušajā ceturksnī tika apstiprināta, šajā var klusi sākt uzvesties citādi. Svari, kas stāv pie jums, paliek baits baitā tie paši, līdz jūs izlemjat tos nomainīt, un dienu izvēlaties jūs.

Beigās jums kaut kas pieder

Četri gadi abonementu uz cilvēku beidzas ar atceltiem rēķiniem. Četri gadi ar modeļu serveri beidzas ar mašīnu, kas joprojām strādā, svariem, kas strādā bez kāda atļaujas, un dzelzi, ko var pārdot vai likt citā darbā.

Rēķins

Kur līknes krustojas

Apaļi skaitļi, ne piedāvājums. Tie ir šeit tāpēc, ka jautājums uzrodas katras sarunas pirmajās piecās minūtēs, un tāpēc, ka godīgā atbilde ir atkarīga no tā, cik smagi mašīnu dzen.

25 €

uz cilvēku mēnesī

Tik maksā mākoņa AI biznesa plāns par vienu vietu. Desmit cilvēku ir 3000 € gadā — pirms vēl kāda rutīna ir pieskārusies API ar skaitītāju.

10–12 tūkst. €

vienreiz, līdz desmit cilvēkiem

Studio konfigurācija ar uzliktiem un palaistiem modeļiem. Tālāk ir aptuveni 400 € gadā par elektrību — vienalga, vai desmit cilvēki to dzen visu dienu, vai neviens nepiesakās.

3–4 gadi

līdz vietas izmaksā vairāk

Tik ilgi atmaksājas desmit klusas vietas. Rutīnas, kas visu dienu iet pret API ar skaitītāju, gadus pārvērš mēnešos — tieši tur modeļu serveris no gaumes jautājuma kļūst par lētāko variantu.

Labāk zaudēt darījumu nekā pārdot nepareizu mašīnu. Ja slodze tiešām ir viegla, mākoņa modelis ir lētākā atbilde, un tieši to mēs arī pateiksim.

Četras konfigurācijas

No kastes plauktā līdz skapim datu centrā

Konfigurācijas zemāk ir aptuvenas: tās ir šeit, lai jūs redzētu, ko aptuveni maksā jūsu cilvēku skaits, pirms kāds ceļ klausuli. Precīzo saliekam pēc sarunas par modeļiem, kas vajadzīgi, un slodzi, ko tiem uzliksiet.

Sāciet šeit

Studio

1× RTX PRO 6000 Blackwell Max-Q — 96 GB videoatmiņas

≈ 10–12 tūkst. €

  • LietotājiLīdz 10 cilvēkiem
  • Jauda~0,6 kW slodzē

Platforma

Torņa korpuss, 16 kodolu Ryzen vai Threadripper, 128 GB RAM, 2 TB NVMe, 10 GbE

Modeļi

gpt-oss-120b MXFP4, Qwen3-32B FP8 ar pilnu kontekstu vai Llama 3.3 70B INT4 — un blakus iegulumu modelis meklēšanai.

Ar šo saruna sākas: parasta kontaktligzda, skapis ar gaisa plūsmu, nekāda reka un nekādas serveru telpas. Ja desmit cilvēki ir jūsu mērogs, šī ir visa atbilde.

Business

4× RTX PRO 6000 Max-Q — 384 GB videoatmiņas

≈ 45–60 tūkst. €

  • Lietotāji50–150 cilvēku
  • Jauda~2 kW slodzē

Platforma

2U/4U korpuss, EPYC ar 32 kodoliem, 512 GB RAM, 4 TB NVMe, 25 GbE

Modeļi

Qwen3-235B-A22B FP8, Llama 3.3 70B ar pilnu kontekstu vai vairāki mazāki modeļi paralēli — saruna, iegulumi un koda modelis vienlaikus.

Vēl der parastā serveru telpā: nav vajadzīgs ne datu centrs, ne īpaša dzesēšana.

Enterprise

8× RTX PRO 6000 Server Edition — 768 GB videoatmiņas

≈ 100–130 tūkst. €

  • Lietotāji200–500 cilvēku
  • Jauda~4–5 kW slodzē

Platforma

4U astoņu GPU platforma (Supermicro, Gigabyte), 2× EPYC, 1 TB RAM, 8 TB NVMe, 100 GbE

Modeļi

DeepSeek V3.x un R1 INT4, GLM-4.6 FP8, Qwen3-Coder-480B FP8.

Vajag skapi ar atbilstošu dzesēšanu. NVLink nav, tāpēc tensor parallel iet pa PCIe 5: inferencei tas ir pieņemami, fine-tuningam lēni.

Frontier

8× H200 141 GB HGX — 1128 GB videoatmiņas ar NVLink

≈ 300–400 tūkst. €

  • Lietotāji1000+ cilvēku
  • Jauda~10–12 kW slodzē

Platforma

2× Xeon vai EPYC, 2 TB RAM, 400 GbE vai InfiniBand; alternatīva ir 8× B200

Modeļi

DeepSeek V3.x FP8, Kimi K2 INT4 (vai FP8 ar ierobežotu KV kešu) un pilns fine-tuning 70B klases modeļiem.

Tikai datu centrā vai colocation, un piegādes laiks ir mēneši.

Ko sedz cena

Cenā un jūsu pusē

Cenā

  • Dzelzs, salikta un pārbaudīta slodzē, pirms tā aizbrauc.
  • Atvērtie modeļi uzlikti, kvantēti un pieejami aiz viena galapunkta jūsu tīklā.
  • Harness pieslēgts tam, un jūsu rutīnas izietas pret izvēlēto modeli.
  • Rakstiska nodošana: kas kur darbojas, kā to restartēt, kā vēlāk pielikt modeli.

Jūsu pusē

  • Elektrība, dzesēšana un vieta — Studio pietiek ar kontaktligzdu un plauktu, pārējiem vajag reku ar atbilstošu gaisa plūsmu.
  • Tīkla pieeja no datoriem, kas to lietos.
  • Ikdienas uzturēšana. Kas tur darbā pārējos serverus, tur arī šo.
  • Cenā nav ne SLA, ne attālinātas administrēšanas. Ja kaut kas no tā ir vajadzīgs, pasakiet, un mēs to nocenosim atsevišķi.

Kā tas notiek

Četri soļi, un tikai pirmajā vajag jūs

  1. Pasakiet slodzi

    Cik cilvēku, ko rutīnas tiešām dara un vai kaut kam jāpaliek atdalītā tīklā. Tas ir viss uzdevums — nav nekādas izpētes fāzes, par ko maksāt.

  2. Konfigurācija un fiksēta cena

    GPU izvēlamies pēc modeļiem, kas jums vajadzīgi, nevis otrādi, un jūs saņemat vienu skaitli ar salikšanu iekšā. Ja darbu padara mazāka mašīna, piedāvājums ir par mazāko.

  3. Salikta un izmērīta

    Mašīnu saliekam, modeļus uzliekam un palaižam, un pirms izsūtīšanas to dzenam jūsu slodzē: tokeni sekundē uz modeļiem, kurus tiešām lietosiet, nevis lapa ar benchmark rezultātiem.

  4. Uzstādīta un pieslēgta

    Tā nonāk jūsu telpā, Harness tiek pieslēgts, un jūsu rutīnas iziet no gala līdz galam, pirms darbu saucam par padarītu.

Pasakiet, cik cilvēku un ko viņi dara

Atpakaļ saņemat konfigurāciju un vienu skaitli. Nekādas izpētes darbnīcas, nekāda kalkulatora uz vietu un nekādas sarunas, kas jāizsēž, pirms redzat cenu.