Spustite otvorené LLM na vlastnom venovanom 🇪🇺 GPU serveri v EÚ – úplne súkromné, bez zdieľania dát. Každý model je testovaný na skutočnej hardvére, preto Vám ukážeme GPU s najlepším pomomerom cena/výkon a jeho meranú rýchlosť.
Ako už máte spustený GPU server a chcete na ňom nasadiť model pomocou vLLM, alebo ste začiatkom a chcete sa pustiť do súkromného hostovaného LLM inference v EÚ — táto služba Private LLM s jedným kliknutím je práve pre Vás.
| Model | is_gated: Zda je chránený prístup vyžadujúci overenie identít alebo je stiahnutý z súkromnej repozitárie. U verejných modelov môže zostávať prazdné. Token si môžete vygenerovať tu: https://huggingface.co/settings/tokens. Token sa využije len pri stiahnutí modelu. max_tokens: Určuje maximálny rozmer kontextového okna, ktoré server má podporovať. Priamo ovplyvňuje výpočetnú náročnosť VRAM. Typické hodnoty: - Malé modely: 4096 - Stredné modely: 8192 - Modely s dlhším kontextom: 16384+ Vysšie hodnoty významne navyšujú spotrebovanie pamäti. Ak Vám na serveri nedostatočne zbýva VRAM, znížte túto hodnotu. modelname: Identifikátor modelu Hugging Face, ktorý má naložiť vLLM. Príklad: mistralai/Ministral-3-14B-Instruct-2512 Ďalšie kompatibilné príklady: Qwen/Qwen2.5-14B-Instruct google/gemma google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-Instruct | Paralelný tok/z (t/s) | Jednotlivý tok/zásah | Hodnota za hodinu | Mesačne | Konfig |
|---|---|---|---|---|---|---|
| Llama 3.3 70B 4-bit Perfect on sparbox.m2 | 12,288 | 68 | 35 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 30B 4-bit Perfect on sparbox.m2 | 84,992 | 877 | 168 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 4-bit Perfect on sparbox.m2 | 69,632 | 396 | 66 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 35B 4-bit Perfect on sparbox.m2 | 62,464 | 747 | 143 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 4-bit Perfect on sparbox.m2 | 17,408 | 390 | 62 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 E2B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 76,800 | 914 | 133 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +52% | 1,160 +27% | 184 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Gemma 4 E4B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 30,720 | 538 | 70 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 95,232 +205% | 737 +37% | 104 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Granite 4.1 8B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 More context, higher speed on infinityai.s1 | 41,984 | 247 | 39 | €0.29/h | €155.00/mo | novatesla.s1 |
| 76,800 +80% | 556 +125% | 76 | €0.70/h | €375.00/mo | sparbox.m2 | |
| 69,632 +62% | 539 +118% | 69 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Llama 3.1 8B Perfect on sparbox.m2 | 95,232 | 621 | 86 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 Perfect on sparbox.m2 | 14,336 | 367 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 multimodal Perfect on sparbox.m2 | 117,760 | 941 | 144 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ministral 3 14B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 20,480 | 429 | 56 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +300% | 623 +45% | 89 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Ministral 3 3B Perfect on sparbox.sm1 | 84,992 | 1,218 | 164 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Mistral 7B Perfect on sparbox.sm1 | 28,672 | 399 | 53 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Llama 3.1 8B 8-bit Perfect on ranger.s1.de More context, higher speed on infinityai.s1 | 20,480 | 69 | 62 | €0.49/h | €260.00/mo | ranger.s1.de |
| 117,760 +449% | 889 +1197% | 115 | €0.62/h | €330.00/mo | infinityai.s1 | |
| GPT OSS 20B Perfect on sparbox.m2 | 117,760 | 739 | 223 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ornith 1.0 9B 4-bit Perfect on ranger.s1.de | 52,224 | 78 | 59 | €0.49/h | €260.00/mo | ranger.s1.de |
| Qwen3 Coder 30B 4-bit Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 25,600 | 886 | 170 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +224% | 949 +7% | 167 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3 VL 32B 4-bit Perfect on sparbox.m2 | 37,888 | 429 | 63 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 32B 4-bit Perfect on sparbox.m2 | 28,672 | 438 | 64 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 7B Perfect on sparbox.sm1 | 28,672 | 400 | 51 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 14B Perfect on sparbox.m2 | 36,864 | 364 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 32B 8-bit Perfect on sparbox.m2 | 18,432 | 297 | 42 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on sparbox.sm1 | 36,864 | 627 | 85 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 4B (2507) Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 58,368 | 626 | 84 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +100% | 918 +47% | 119 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 23,552 | 379 | 49 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 36,864 +54% | 590 +56% | 75 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 Coder 30B 8-bit Perfect on sparbox.m2 | 41,984 | 812 | 153 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 32B 8-bit Perfect on sparbox.m2 | 15,360 | 294 | 41 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 | 69,632 | 436 | 68 | €0.29/h | €155.00/mo | novatesla.s1 |
| 117,760 +69% | 874 +101% | 119 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3.5 9B Perfect on sparbox.m2 | 95,232 | 558 | 82 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 8-bit Perfect on sparbox.m2 | 28,672 | 164 | 47 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 8-bit Perfect on sparbox.m2 | 8,192 | 286 | 43 | €0.70/h | €375.00/mo | sparbox.m2 |
Kontext = maximálne využiteľné okno kontextu. Paralelný/Jednotlivý = tokeny/sec. Ceny odrážajú najlepšie pomery cena/výkon GPU na model. Ceny sú predplatené; udržujete plný prístup k root.
Tu nemusíte vyberať model — objednajte si holý GPU server a spustite na ňom čo len chcete, s plným prístupom root.
Objednať GPU serverOkamžite po stlačení tlačítka Spustiť je váš súkromný model dostupný cez kompatibilné OpenAI rozhranie – sledujte výkonnosť, využitie kontextu a požiadosti priamo z vlastného panelu.
Trooper.AI vám poskytuje spravovaný GPU server prednastavený s vLLM, pripravený na obsluhu ľubovoľného otvoreného veľkého jazykového modelu cez rýchlu, kompatibilnú API vo forme OpenAI. Namesto toho, aby ste strávili hodiny výberom GPU, instaláciou ovládačov CUDA, kompiláciou vLLM a nastavovaním spúšťacích parametrov, vyberiete si model vyššie a kliknete na Spustiť. Za niekoľko minút dostanete dedikovaný GPU server hostovaný v EÚ so zadaným vLLM už bežiacim presne takú konfiguráciu, ktorú sme pre tento model optimalizovali – vrátane dĺžky kontextu, paralelizmu a argumentov príkazového riadka.
vLLM je štandardný prístrojový motor na vysoký prienik (high-throughput) pre inferenciu, ale jeho nastavenie do produkčného prostredia je náročné: vyžaduje zhodnotenie verzií ovládača a CUDA, výber parametrov --max-num-batched-tokens, --max-num-seqs a správneho okna kontextu pre dostupnú VRAM vašej grafovej karty, ako aj overenie, že sa model skutočne načítava. Naša správovaná GPU serverová platforma predinštalovaná s vLLM odstráni túto práciu. Každá konfigurácia na tejto stránke pochádza priamo zo automatizovaných benchmarkov na reálnom hardvére, takže nasadený server funguje presne ako testovaný beh – bez experimentovania.
Každý server běží na dedikovaných grafických kartách (bare-metal GPUs) v datových centrách v Nemecku certifikovaných podľa normy ISO/IEC 27001 a plne súladných s GDPR. Máte plný prístup cez SSH ako root, trvalé zariadenie a súkromné pripojenie – vaše dotazy ani dáta neopustia váš server. Pretože ide o celkový GPU server (nie zdieľanú inferenciu), môžete tiež nainštalovať ďalšie softvére umelých inteligencií, vykonávať fine-tuning alebo spustiť modely obrazov či zvuku vedľa svojho LLM.
Pre každý model zobrazíme GPU s najlepším pomerm cenou a výkonom, s transparentnou hodinovú aj mesačnou cenením. Môžete si prezrieť reálne vzorkové odpovede na model cez Zobraziť kvalitu odpovedi pred nasadením, aby ste vedeli o rýchlosti a kvalite odpovedí, za ktoré platíte. Platite hodinu za experimentovanie alebo mesiačne pre produkciu – sprístupnený správovaný GPU server prednastavený s vLLM, ktorý sa prispôsobi vašim potrebum.
Vlastný prístupový LLM GPU server dáva celú stroj: plnú prístupovosť ako root, súkromné rozhranie kompatibilné s OpenAI, neobmedzené požiadavky za predplatený fixný poplatok a voľnosť na úpravu modelov, výmenu modelov alebo spracovanie obrazových a zvukových úloh vedľa vašej LLM. Pretože grafická karta je vaša, výkonnosť a dĺžka kontextu sú predvídateľné a vaše dotazy nikdy nezostavia váš server – ideálne pre stabilný prienik tráfiku a striktné požadavky na ochranu súkromia.
Vyberte model z matice vyššie a kliknite na Spustiť: už za niekoľko minút dostanete GPU server hostovaný v EU s predinštalovaným vLLM so presne overenou konfiguráciou – dĺžka kontextu, paralelizmus a spúšťacie vlajky sú zahrnuté. Platíte hodinovými sazbami pri experimentácii alebo mesačnými pre produkciu; akokoľvek môžete ľubovoľne upgradovať na väčší GPU pre väčšiu kapacitu kontextu alebo modely bez reinštalácie.
Za každým súkromným GPU serverom pre LLM stojí hardvér podnikovej triedy, ktorý je zrekonštruovaný a udržiavaný našou vlastnou tímou. Tu vidíte Markusa a Jaimeho pri montáži klastra NVIDIA A100 v jednom zo našich certifikovaných kolokračných datových centier v Nemecku pod štandardom ISO/IEC 27001 – rovnakú triedu GPU serverov ako tie, ktoré nasadzujete cez túto stránku. Premenujeme vysokovýkonomé komponenty na optimalizované systémy pre inferenciu, čím predĺžujeme životnosť hardvéru a zároveň snižujeme množstvo elektrického odpadku. Nepredávame tretie strany kapacity; vlastníme a prevádzkujeme vlastný hardvér v kolokračných datových centrách v Nemecku i Holandsku, čo nám umožňuje zaručovať výkonnostné parametre, bezpečnosť a rezidenciu dát vo všetkých vrstvách architektúry.
Vaš privátny vLLM server poskytuje koncový bod zcela kompatibilný s formátom OpenAI Chat Completions API (/v1/chat/completions). Ak už vaša aplikácia používa OpenAI SDK – Python, Node.js alebo ľubovoľného klienta HTTP – stačí ju nastaviť na váš vlastný server; ide o zmenu jedným riadkom: aktualizujte základnú URL adresu a API kľúč. Dostanete rovnaký schéma požiadavky a odpovedi, plnú podporu pre streamovanie, režim JSON, volanie funkcií a multimodálne vstupy. Žiadna rekonfigurácia kódu, žiadne nové abstrakcie ani závislosť od dodávateľa – integracia ostáva presunutelná a vy si udržíte kontrolu.
Hľadáte alternatívu k OpenAI API hostovanú v Európe? Súkromný GPU server s LLM ponúka ekvivalentnú funkčnosť Chat Completions API so sídlom dát v EU, predplatenou fixnou cenou a plným vlastníctvom stroja.
Pretože váš server podporuje API OpenAI Chat Completions, môžete ho pripojiť k takmer ľubovoľnému nástroju na umelú inteligenciu, IDE alebo automatizačnej platforme – stačí nastaviť základnú URL na svoj vlastný endpoint a pridať svoj ključ. Niektoré populárne príklady:
… a mnohé ďalšie – akýkoľvek aplikácia, agenta alebo SDK, ktoré podporujú kompatibilný koncový bod s OpenAI, funguje bez problémov.