Soukromé spracovanie LLM

Spustite otvorené LLM na vlastnom venovanom EU GPU serveri – úplne súkromné, bez zdieľania údajov. Každý model je vyhodnotený na skutočnej hardvére, preto Vám ukážeme GPU s najlepším pomomerom cena/výkon a jeho meranú rýchlosť.

Modelis_gated: Zda je chránený prístup vyžadujúci overenie identít alebo je stiahnutý z súkromnej repozitárie. U verejných modelov môže zostávať prazdné. Token si môžete vygenerovať tu: https://huggingface.co/settings/tokens. Token sa využije len pri stiahnutí modelu. max_tokens: Určuje maximálny rozmer kontextového okna, ktoré server má podporovať. Priamo ovplyvňuje výpočetnú náročnosť VRAM. Typické hodnoty: - Malé modely: 4096 - Stredné modely: 8192 - Modely s dlhším kontextom: 16384+ Vysšie hodnoty významne navyšujú spotrebovanie pamäti. Ak Vám na serveri nedostatočne zbýva VRAM, znížte túto hodnotu. modelname: Identifikátor modelu Hugging Face, ktorý má naložiť vLLM. Príklad: mistralai/Ministral-3-14B-Instruct-2512 Ďalšie kompatibilné príklady: Qwen/Qwen2.5-14B-Instruct google/gemma google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-InstructParalelný tok/z (t/s)Jednotlivý tok/zásahHodnota za hodinuMesačneKonfig
Llama 3.3 70B
Perfect on sparbox.m2
14,745729€0.73/h
€420.00/mo
sparbox.m2
Qwen3 30B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,49117021€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
185
+9%
24€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 27B (AWQ)
Perfect on infinityai.s1
65,53610314€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 35B
Perfect on infinityai.s1
95,55011115€0.59/h
€335.00/mo
infinityai.s1
DeepSeek R1 0528 Qwen3 8B
Perfect on infinityai.s1
85,99559275€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 31B (QAT)
Perfect on infinityai.s1
16,38414619€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E2B
Perfect on infinityai.s1
131,0721,105153€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E4B
Perfect on infinityai.s1
106,16768493€0.59/h
€335.00/mo
infinityai.s1
Granite 4.1 8B
Perfect on infinityai.s1
77,39553069€0.59/h
€335.00/mo
infinityai.s1
Llama 3.1 8B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
26,54137851€0.38/h
€215.00/mo
ranger.s1
106,167
+300%
601
+59%
84€0.73/h
€420.00/mo
sparbox.m2
Phi 4
Perfect on infinityai.s1
16,38433744€0.59/h
€335.00/mo
infinityai.s1
Phi 4 multimodal instruct
Perfect on infinityai.s1
117,964947130€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 14B
Perfect on infinityai.s1
21,49760579€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 3B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
19,3471,221165€0.38/h
€215.00/mo
ranger.s1
85,995
+344%
1,605
+31%
215€0.59/h
€335.00/mo
infinityai.s1
Mistral 7B
Perfect on infinityai.s1
32,76862281€0.59/h
€335.00/mo
infinityai.s1
GPT oss 20B
Perfect on infinityai.s1
131,072701196€0.59/h
€335.00/mo
infinityai.s1
Ornith 1.0 9B
Perfect on ranger.s1
47,77415568€0.38/h
€215.00/mo
ranger.s1
Qwen3 Coder 30B (AWQ)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,491864169€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
908149€0.59/h
€335.00/mo
infinityai.s1
Qwen3 VL 32B (AWQ)
Perfect on infinityai.s1
32,76840855€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 32B
Perfect on infinityai.s1
32,76841956€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 7B
Perfect on ranger.s1
32,76839351€0.38/h
€215.00/mo
ranger.s1
Qwen3 14B
Perfect on infinityai.s1
29,49133543€0.59/h
€335.00/mo
infinityai.s1
Qwen3 32B
Perfect on sparbox.m2
21,49729141€0.73/h
€420.00/mo
sparbox.m2
Qwen3 4B
Perfect on ranger.s1
40,96062384€0.38/h
€215.00/mo
ranger.s1
Qwen3 4B (2507)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
65,53662283€0.38/h
€215.00/mo
ranger.s1
131,072
+100%
868
+40%
116€0.59/h
€335.00/mo
infinityai.s1
Qwen3 8B
Perfect on infinityai.s1
40,96056974€0.59/h
€335.00/mo
infinityai.s1
Qwen3 Coder 30B (FP8)
Perfect on sparbox.m2
32,768776148€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 32B (FP8)
Perfect on sparbox.m2
13,27028840€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 4B
Perfect on ranger.s1
47,77425263€0.38/h
€215.00/mo
ranger.s1
Qwen3.5 9B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
21,49728346€0.38/h
€215.00/mo
ranger.s1
95,550
+344%
388
+37%
79€0.73/h
€420.00/mo
sparbox.m2
Qwen3.6 27B (FP8)
Perfect on sparbox.m2
32,76824246€0.73/h
€420.00/mo
sparbox.m2
Gemma 4 31B (FP8)
Perfect on sparbox.m2
8,19211742€0.73/h
€420.00/mo
sparbox.m2
GLM 4.6V Flash
Perfect on infinityai.s1
106,16748260€0.59/h
€335.00/mo
infinityai.s1

Kontext = maximálne využiteľné okno kontextu. Paralelný/Jednotlivý = tokeny/sec. Ceny odrážajú najlepšie pomery cena/výkon GPU na model. Ceny sú predplatené; udržujete plný prístup k root.

Spravovaný GPU server predinštalovaný s vLLM

Trooper.AI vám poskytuje spravovaný GPU server prednastavený s vLLM, pripravený na obsluhu ľubovoľného otvoreného veľkého jazykového modelu cez rýchlu, kompatibilnú API vo forme OpenAI. Namesto toho, aby ste strávili hodiny výberom GPU, instaláciou ovládačov CUDA, kompiláciou vLLM a nastavovaním spúšťacích parametrov, vyberiete si model vyššie a kliknete na Spustiť. Za niekoľko minút dostanete dedikovaný GPU server hostovaný v EÚ so zadaným vLLM už bežiacim presne takú konfiguráciu, ktorú sme pre tento model optimalizovali – vrátane dĺžky kontextu, paralelizmu a argumentov príkazového riadka.

Prečo predinštalovaný server s vLLM?

vLLM je štandardný prístrojový motor na vysoký prienik (high-throughput) pre inferenciu, ale jeho nastavenie do produkčného prostredia je náročné: vyžaduje zhodnotenie verzií ovládača a CUDA, výber parametrov --max-num-batched-tokens, --max-num-seqs a správneho okna kontextu pre dostupnú VRAM vašej grafovej karty, ako aj overenie, že sa model skutočne načítava. Naša správovaná GPU serverová platforma predinštalovaná s vLLM odstráni túto práciu. Každá konfigurácia na tejto stránke pochádza priamo zo automatizovaných benchmarkov na reálnom hardvére, takže nasadený server funguje presne ako testovaný beh – bez experimentovania.

Soukromé, hostované v EÚ a vaše

Každý server běží na dedikovaných grafických kartách (bare-metal GPUs) v datových centrách v Nemecku certifikovaných podľa normy ISO/IEC 27001 a plne súladných s GDPR. Máte plný prístup cez SSH ako root, trvalé zariadenie a súkromné pripojenie – vaše dotazy ani dáta neopustia váš server. Pretože ide o celkový GPU server (nie zdieľanú inferenciu), môžete tiež nainštalovať ďalšie softvére umelých inteligencií, vykonávať fine-tuning alebo spustiť modely obrazov či zvuku vedľa svojho LLM.

Priezračná cena za výkon

Pre každý model zobrazíme GPU s najlepším pomerm cenou a výkonom, s transparentnou hodinovú aj mesačnou cenením. Môžete si prezrieť reálne vzorkové odpovede na model cez Zobraziť kvalitu odpovedi pred nasadením, aby ste vedeli o rýchlosti a kvalite odpovedí, za ktoré platíte. Platite hodinu za experimentovanie alebo mesiačne pre produkciu – sprístupnený správovaný GPU server prednastavený s vLLM, ktorý sa prispôsobi vašim potrebum.