🔒 Súkromné spracovanie LLM NOVÉ

Spustite otvorené LLM na vlastnom venovanom 🇪🇺 GPU serveri v EÚ – úplne súkromné, bez zdieľania dát. Každý model je testovaný na skutočnej hardvére, preto Vám ukážeme GPU s najlepším pomomerom cena/výkon a jeho meranú rýchlosť.

Rýchla nasadenie vLLM Úplne súkromné, bez zdieľania údajov Overené na skutočnom hardvére v Európskej únii
Zobraziť modely & GPU Ponajmúvať GPU server

Ako už máte spustený GPU server a chcete na ňom nasadiť model pomocou vLLM, alebo ste začiatkom a chcete sa pustiť do súkromného hostovaného LLM inference v EÚ — táto služba Private LLM s jedným kliknutím je práve pre Vás.

📱➡️🖥️ Táto tabuľka sa najlepšie zobrazuje a používa na stolových prehliadačoch.
Modelis_gated: Zda je chránený prístup vyžadujúci overenie identít alebo je stiahnutý z súkromnej repozitárie. U verejných modelov môže zostávať prazdné. Token si môžete vygenerovať tu: https://huggingface.co/settings/tokens. Token sa využije len pri stiahnutí modelu. max_tokens: Určuje maximálny rozmer kontextového okna, ktoré server má podporovať. Priamo ovplyvňuje výpočetnú náročnosť VRAM. Typické hodnoty: - Malé modely: 4096 - Stredné modely: 8192 - Modely s dlhším kontextom: 16384+ Vysšie hodnoty významne navyšujú spotrebovanie pamäti. Ak Vám na serveri nedostatočne zbýva VRAM, znížte túto hodnotu. modelname: Identifikátor modelu Hugging Face, ktorý má naložiť vLLM. Príklad: mistralai/Ministral-3-14B-Instruct-2512 Ďalšie kompatibilné príklady: Qwen/Qwen2.5-14B-Instruct google/gemma google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-InstructParalelný tok/z (t/s)Jednotlivý tok/zásahHodnota za hodinuMesačneKonfig
Llama 3.3 70B 4-bit
Perfect on sparbox.m2
12,2886835€0.70/h
€375.00/mo
sparbox.m2
Qwen3 30B 4-bit
Perfect on sparbox.m2
84,992877168€0.70/h
€375.00/mo
sparbox.m2
Qwen3.6 27B 4-bit
Perfect on sparbox.m2
69,63239666€0.70/h
€375.00/mo
sparbox.m2
Qwen3.6 35B 4-bit
Perfect on sparbox.m2
62,464747143€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 31B 4-bit
Perfect on sparbox.m2
17,40839062€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 E2B
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
76,800914133€0.38/h
€205.00/mo
sparbox.sm1
117,760
+52%
1,160
+27%
184€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 E4B
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
30,72053870€0.38/h
€205.00/mo
sparbox.sm1
95,232
+205%
737
+37%
104€0.70/h
€375.00/mo
sparbox.m2
Granite 4.1 8B
Perfect on novatesla.s1
More context, higher speed on sparbox.m2
More context, higher speed on infinityai.s1
41,98424739€0.29/h
€155.00/mo
novatesla.s1
76,800
+80%
556
+125%
76€0.70/h
€375.00/mo
sparbox.m2
69,632
+62%
539
+118%
69€0.62/h
€330.00/mo
infinityai.s1
Llama 3.1 8B
Perfect on sparbox.m2
95,23262186€0.70/h
€375.00/mo
sparbox.m2
Phi 4
Perfect on sparbox.m2
14,33636750€0.70/h
€375.00/mo
sparbox.m2
Phi 4 multimodal
Perfect on sparbox.m2
117,760941144€0.70/h
€375.00/mo
sparbox.m2
Ministral 3 14B
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
20,48042956€0.38/h
€205.00/mo
sparbox.sm1
84,992
+300%
623
+45%
89€0.70/h
€375.00/mo
sparbox.m2
Ministral 3 3B
Perfect on sparbox.sm1
84,9921,218164€0.38/h
€205.00/mo
sparbox.sm1
Mistral 7B
Perfect on sparbox.sm1
28,67239953€0.38/h
€205.00/mo
sparbox.sm1
Llama 3.1 8B 8-bit
Perfect on ranger.s1.de
More context, higher speed on infinityai.s1
20,4806962€0.49/h
€260.00/mo
ranger.s1.de
117,760
+449%
889
+1197%
115€0.62/h
€330.00/mo
infinityai.s1
GPT OSS 20B
Perfect on sparbox.m2
117,760739223€0.70/h
€375.00/mo
sparbox.m2
Ornith 1.0 9B 4-bit
Perfect on ranger.s1.de
52,2247859€0.49/h
€260.00/mo
ranger.s1.de
Qwen3 Coder 30B 4-bit
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
25,600886170€0.38/h
€205.00/mo
sparbox.sm1
84,992
+224%
949
+7%
167€0.70/h
€375.00/mo
sparbox.m2
Qwen3 VL 32B 4-bit
Perfect on sparbox.m2
37,88842963€0.70/h
€375.00/mo
sparbox.m2
Qwen2.5 32B 4-bit
Perfect on sparbox.m2
28,67243864€0.70/h
€375.00/mo
sparbox.m2
Qwen2.5 7B
Perfect on sparbox.sm1
28,67240051€0.38/h
€205.00/mo
sparbox.sm1
Qwen3 14B
Perfect on sparbox.m2
36,86436450€0.70/h
€375.00/mo
sparbox.m2
Qwen3 32B 8-bit
Perfect on sparbox.m2
18,43229742€0.70/h
€375.00/mo
sparbox.m2
Qwen3 4B
Perfect on sparbox.sm1
36,86462785€0.38/h
€205.00/mo
sparbox.sm1
Qwen3 4B (2507)
Perfect on sparbox.sm1
More context, higher speed on infinityai.s1
58,36862684€0.38/h
€205.00/mo
sparbox.sm1
117,760
+100%
918
+47%
119€0.62/h
€330.00/mo
infinityai.s1
Qwen3 8B
Perfect on sparbox.sm1
More context, higher speed on infinityai.s1
23,55237949€0.38/h
€205.00/mo
sparbox.sm1
36,864
+54%
590
+56%
75€0.62/h
€330.00/mo
infinityai.s1
Qwen3 Coder 30B 8-bit
Perfect on sparbox.m2
41,984812153€0.70/h
€375.00/mo
sparbox.m2
Qwen3 VL 32B 8-bit
Perfect on sparbox.m2
15,36029441€0.70/h
€375.00/mo
sparbox.m2
Qwen3 VL 4B
Perfect on novatesla.s1
More context, higher speed on sparbox.m2
69,63243668€0.29/h
€155.00/mo
novatesla.s1
117,760
+69%
874
+101%
119€0.70/h
€375.00/mo
sparbox.m2
Qwen3.5 9B
Perfect on sparbox.m2
95,23255882€0.70/h
€375.00/mo
sparbox.m2
Qwen3.6 27B 8-bit
Perfect on sparbox.m2
28,67216447€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 31B 8-bit
Perfect on sparbox.m2
8,19228643€0.70/h
€375.00/mo
sparbox.m2

Kontext = maximálne využiteľné okno kontextu. Paralelný/Jednotlivý = tokeny/sec. Ceny odrážajú najlepšie pomery cena/výkon GPU na model. Ceny sú predplatené; udržujete plný prístup k root.

Chcete len GPU server?

Tu nemusíte vyberať model — objednajte si holý GPU server a spustite na ňom čo len chcete, s plným prístupom root.

Objednať GPU server

Vaša vLLM správa je pripravená hneď po nasadení

Okamžite po stlačení tlačítka Spustiť je váš súkromný model dostupný cez kompatibilné OpenAI rozhranie – sledujte výkonnosť, využitie kontextu a požiadosti priamo z vlastného panelu.

vLLM server dashboard shown after deploying a private LLM on Trooper.AI

Top 10 vlastností vašho súkromného GPU servera pre LLM

Spravovaný GPU server predinštalovaný s vLLM

Trooper.AI vám poskytuje spravovaný GPU server prednastavený s vLLM, pripravený na obsluhu ľubovoľného otvoreného veľkého jazykového modelu cez rýchlu, kompatibilnú API vo forme OpenAI. Namesto toho, aby ste strávili hodiny výberom GPU, instaláciou ovládačov CUDA, kompiláciou vLLM a nastavovaním spúšťacích parametrov, vyberiete si model vyššie a kliknete na Spustiť. Za niekoľko minút dostanete dedikovaný GPU server hostovaný v EÚ so zadaným vLLM už bežiacim presne takú konfiguráciu, ktorú sme pre tento model optimalizovali – vrátane dĺžky kontextu, paralelizmu a argumentov príkazového riadka.

Prečo predinštalovaný server s vLLM?

vLLM je štandardný prístrojový motor na vysoký prienik (high-throughput) pre inferenciu, ale jeho nastavenie do produkčného prostredia je náročné: vyžaduje zhodnotenie verzií ovládača a CUDA, výber parametrov --max-num-batched-tokens, --max-num-seqs a správneho okna kontextu pre dostupnú VRAM vašej grafovej karty, ako aj overenie, že sa model skutočne načítava. Naša správovaná GPU serverová platforma predinštalovaná s vLLM odstráni túto práciu. Každá konfigurácia na tejto stránke pochádza priamo zo automatizovaných benchmarkov na reálnom hardvére, takže nasadený server funguje presne ako testovaný beh – bez experimentovania.

Soukromé, hostované v EÚ a vaše

Každý server běží na dedikovaných grafických kartách (bare-metal GPUs) v datových centrách v Nemecku certifikovaných podľa normy ISO/IEC 27001 a plne súladných s GDPR. Máte plný prístup cez SSH ako root, trvalé zariadenie a súkromné pripojenie – vaše dotazy ani dáta neopustia váš server. Pretože ide o celkový GPU server (nie zdieľanú inferenciu), môžete tiež nainštalovať ďalšie softvére umelých inteligencií, vykonávať fine-tuning alebo spustiť modely obrazov či zvuku vedľa svojho LLM.

Priezračná cena za výkon

Pre každý model zobrazíme GPU s najlepším pomerm cenou a výkonom, s transparentnou hodinovú aj mesačnou cenením. Môžete si prezrieť reálne vzorkové odpovede na model cez Zobraziť kvalitu odpovedi pred nasadením, aby ste vedeli o rýchlosti a kvalite odpovedí, za ktoré platíte. Platite hodinu za experimentovanie alebo mesiačne pre produkciu – sprístupnený správovaný GPU server prednastavený s vLLM, ktorý sa prispôsobi vašim potrebum.

Vlastný súkromný GPU server s LLM

Vlastný prístupový LLM GPU server dáva celú stroj: plnú prístupovosť ako root, súkromné rozhranie kompatibilné s OpenAI, neobmedzené požiadavky za predplatený fixný poplatok a voľnosť na úpravu modelov, výmenu modelov alebo spracovanie obrazových a zvukových úloh vedľa vašej LLM. Pretože grafická karta je vaša, výkonnosť a dĺžka kontextu sú predvídateľné a vaše dotazy nikdy nezostavia váš server – ideálne pre stabilný prienik tráfiku a striktné požadavky na ochranu súkromia.

Vyberte model z matice vyššie a kliknite na Spustiť: už za niekoľko minút dostanete GPU server hostovaný v EU s predinštalovaným vLLM so presne overenou konfiguráciou – dĺžka kontextu, paralelizmus a spúšťacie vlajky sú zahrnuté. Platíte hodinovými sazbami pri experimentácii alebo mesačnými pre produkciu; akokoľvek môžete ľubovoľne upgradovať na väčší GPU pre väčšiu kapacitu kontextu alebo modely bez reinštalácie.

Markus and Jaimie working on an A100 GPU cluster for inference servers

Spoloľahlivé hardvére, vyrobené odborníkmi

Za každým súkromným GPU serverom pre LLM stojí hardvér podnikovej triedy, ktorý je zrekonštruovaný a udržiavaný našou vlastnou tímou. Tu vidíte Markusa a Jaimeho pri montáži klastra NVIDIA A100 v jednom zo našich certifikovaných kolokračných datových centier v Nemecku pod štandardom ISO/IEC 27001 – rovnakú triedu GPU serverov ako tie, ktoré nasadzujete cez túto stránku. Premenujeme vysokovýkonomé komponenty na optimalizované systémy pre inferenciu, čím predĺžujeme životnosť hardvéru a zároveň snižujeme množstvo elektrického odpadku. Nepredávame tretie strany kapacity; vlastníme a prevádzkujeme vlastný hardvér v kolokračných datových centrách v Nemecku i Holandsku, čo nám umožňuje zaručovať výkonnostné parametre, bezpečnosť a rezidenciu dát vo všetkých vrstvách architektúry.

Kompatibilné s OpenAI Chat Completions API – Migrujte Vašu AI Infrastruktúru za Minútky

Vaš privátny vLLM server poskytuje koncový bod zcela kompatibilný s formátom OpenAI Chat Completions API (/v1/chat/completions). Ak už vaša aplikácia používa OpenAI SDK – Python, Node.js alebo ľubovoľného klienta HTTP – stačí ju nastaviť na váš vlastný server; ide o zmenu jedným riadkom: aktualizujte základnú URL adresu a API kľúč. Dostanete rovnaký schéma požiadavky a odpovedi, plnú podporu pre streamovanie, režim JSON, volanie funkcií a multimodálne vstupy. Žiadna rekonfigurácia kódu, žiadne nové abstrakcie ani závislosť od dodávateľa – integracia ostáva presunutelná a vy si udržíte kontrolu.

Hľadáte alternatívu k OpenAI API hostovanú v Európe? Súkromný GPU server s LLM ponúka ekvivalentnú funkčnosť Chat Completions API so sídlom dát v EU, predplatenou fixnou cenou a plným vlastníctvom stroja.

Pracuje s nástrojmi, ktoré už používate

Pretože váš server podporuje API OpenAI Chat Completions, môžete ho pripojiť k takmer ľubovoľnému nástroju na umelú inteligenciu, IDE alebo automatizačnej platforme – stačí nastaviť základnú URL na svoj vlastný endpoint a pridať svoj ključ. Niektoré populárne príklady:

Otevrený WebUI
n8n
VS Code (Continue, Cline)
OpenClaw
Kurzor
LibreChat
Flowise
Dify
LangChain
LlamaIndex
Hlupá taverna
Home Assistant

… a mnohé ďalšie – akýkoľvek aplikácia, agenta alebo SDK, ktoré podporujú kompatibilný koncový bod s OpenAI, funguje bez problémov.