Spustite otvorené LLM na vlastnom venovanom EU GPU serveri – úplne súkromné, bez zdieľania údajov. Každý model je vyhodnotený na skutočnej hardvére, preto Vám ukážeme GPU s najlepším pomomerom cena/výkon a jeho meranú rýchlosť.
| Model | is_gated: Zda je chránený prístup vyžadujúci overenie identít alebo je stiahnutý z súkromnej repozitárie. U verejných modelov môže zostávať prazdné. Token si môžete vygenerovať tu: https://huggingface.co/settings/tokens. Token sa využije len pri stiahnutí modelu. max_tokens: Určuje maximálny rozmer kontextového okna, ktoré server má podporovať. Priamo ovplyvňuje výpočetnú náročnosť VRAM. Typické hodnoty: - Malé modely: 4096 - Stredné modely: 8192 - Modely s dlhším kontextom: 16384+ Vysšie hodnoty významne navyšujú spotrebovanie pamäti. Ak Vám na serveri nedostatočne zbýva VRAM, znížte túto hodnotu. modelname: Identifikátor modelu Hugging Face, ktorý má naložiť vLLM. Príklad: mistralai/Ministral-3-14B-Instruct-2512 Ďalšie kompatibilné príklady: Qwen/Qwen2.5-14B-Instruct google/gemma google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-Instruct | Paralelný tok/z (t/s) | Jednotlivý tok/zásah | Hodnota za hodinu | Mesačne | Konfig |
|---|---|---|---|---|---|---|
| Llama 3.3 70B Perfect on sparbox.m2 | 14,745 | 72 | 9 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 30B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 170 | 21 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 185 +9% | 24 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3.6 27B (AWQ) Perfect on infinityai.s1 | 65,536 | 103 | 14 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3.6 35B Perfect on infinityai.s1 | 95,550 | 111 | 15 | €0.59/h | €335.00/mo | infinityai.s1 |
| DeepSeek R1 0528 Qwen3 8B Perfect on infinityai.s1 | 85,995 | 592 | 75 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 31B (QAT) Perfect on infinityai.s1 | 16,384 | 146 | 19 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E2B Perfect on infinityai.s1 | 131,072 | 1,105 | 153 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E4B Perfect on infinityai.s1 | 106,167 | 684 | 93 | €0.59/h | €335.00/mo | infinityai.s1 |
| Granite 4.1 8B Perfect on infinityai.s1 | 77,395 | 530 | 69 | €0.59/h | €335.00/mo | infinityai.s1 |
| Llama 3.1 8B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 26,541 | 378 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| 106,167 +300% | 601 +59% | 84 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Phi 4 Perfect on infinityai.s1 | 16,384 | 337 | 44 | €0.59/h | €335.00/mo | infinityai.s1 |
| Phi 4 multimodal instruct Perfect on infinityai.s1 | 117,964 | 947 | 130 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 14B Perfect on infinityai.s1 | 21,497 | 605 | 79 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 3B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 19,347 | 1,221 | 165 | €0.38/h | €215.00/mo | ranger.s1 |
| 85,995 +344% | 1,605 +31% | 215 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Mistral 7B Perfect on infinityai.s1 | 32,768 | 622 | 81 | €0.59/h | €335.00/mo | infinityai.s1 |
| GPT oss 20B Perfect on infinityai.s1 | 131,072 | 701 | 196 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ornith 1.0 9B Perfect on ranger.s1 | 47,774 | 155 | 68 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 Coder 30B (AWQ) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 864 | 169 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 908 | 149 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 VL 32B (AWQ) Perfect on infinityai.s1 | 32,768 | 408 | 55 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 32B Perfect on infinityai.s1 | 32,768 | 419 | 56 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 7B Perfect on ranger.s1 | 32,768 | 393 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 14B Perfect on infinityai.s1 | 29,491 | 335 | 43 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 32B Perfect on sparbox.m2 | 21,497 | 291 | 41 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on ranger.s1 | 40,960 | 623 | 84 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 4B (2507) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 65,536 | 622 | 83 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +100% | 868 +40% | 116 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on infinityai.s1 | 40,960 | 569 | 74 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 Coder 30B (FP8) Perfect on sparbox.m2 | 32,768 | 776 | 148 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 32B (FP8) Perfect on sparbox.m2 | 13,270 | 288 | 40 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on ranger.s1 | 47,774 | 252 | 63 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3.5 9B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 21,497 | 283 | 46 | €0.38/h | €215.00/mo | ranger.s1 |
| 95,550 +344% | 388 +37% | 79 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Qwen3.6 27B (FP8) Perfect on sparbox.m2 | 32,768 | 242 | 46 | €0.73/h | €420.00/mo | sparbox.m2 |
| Gemma 4 31B (FP8) Perfect on sparbox.m2 | 8,192 | 117 | 42 | €0.73/h | €420.00/mo | sparbox.m2 |
| GLM 4.6V Flash Perfect on infinityai.s1 | 106,167 | 482 | 60 | €0.59/h | €335.00/mo | infinityai.s1 |
Kontext = maximálne využiteľné okno kontextu. Paralelný/Jednotlivý = tokeny/sec. Ceny odrážajú najlepšie pomery cena/výkon GPU na model. Ceny sú predplatené; udržujete plný prístup k root.
Trooper.AI vám poskytuje spravovaný GPU server prednastavený s vLLM, pripravený na obsluhu ľubovoľného otvoreného veľkého jazykového modelu cez rýchlu, kompatibilnú API vo forme OpenAI. Namesto toho, aby ste strávili hodiny výberom GPU, instaláciou ovládačov CUDA, kompiláciou vLLM a nastavovaním spúšťacích parametrov, vyberiete si model vyššie a kliknete na Spustiť. Za niekoľko minút dostanete dedikovaný GPU server hostovaný v EÚ so zadaným vLLM už bežiacim presne takú konfiguráciu, ktorú sme pre tento model optimalizovali – vrátane dĺžky kontextu, paralelizmu a argumentov príkazového riadka.
vLLM je štandardný prístrojový motor na vysoký prienik (high-throughput) pre inferenciu, ale jeho nastavenie do produkčného prostredia je náročné: vyžaduje zhodnotenie verzií ovládača a CUDA, výber parametrov --max-num-batched-tokens, --max-num-seqs a správneho okna kontextu pre dostupnú VRAM vašej grafovej karty, ako aj overenie, že sa model skutočne načítava. Naša správovaná GPU serverová platforma predinštalovaná s vLLM odstráni túto práciu. Každá konfigurácia na tejto stránke pochádza priamo zo automatizovaných benchmarkov na reálnom hardvére, takže nasadený server funguje presne ako testovaný beh – bez experimentovania.
Každý server běží na dedikovaných grafických kartách (bare-metal GPUs) v datových centrách v Nemecku certifikovaných podľa normy ISO/IEC 27001 a plne súladných s GDPR. Máte plný prístup cez SSH ako root, trvalé zariadenie a súkromné pripojenie – vaše dotazy ani dáta neopustia váš server. Pretože ide o celkový GPU server (nie zdieľanú inferenciu), môžete tiež nainštalovať ďalšie softvére umelých inteligencií, vykonávať fine-tuning alebo spustiť modely obrazov či zvuku vedľa svojho LLM.
Pre každý model zobrazíme GPU s najlepším pomerm cenou a výkonom, s transparentnou hodinovú aj mesačnou cenením. Môžete si prezrieť reálne vzorkové odpovede na model cez Zobraziť kvalitu odpovedi pred nasadením, aby ste vedeli o rýchlosti a kvalite odpovedí, za ktoré platíte. Platite hodinu za experimentovanie alebo mesiačne pre produkciu – sprístupnený správovaný GPU server prednastavený s vLLM, ktorý sa prispôsobi vašim potrebum.