Prywatne Wnioskowanie Modeli Językowych

Uruchom otwarte modele językowe (LLM) na własnym dedykowanym serwerze z kartą graficzną w UE — całkowicie prywatnie, bez udostępniania danych. Każdy model jest testowany na rzeczywistym sprzęcie, dzięki czemu pokazujemy Ci najlepszą pod względem stosunku cena/wydajność kartę graficzną oraz jej zmierzoną prędkość.

ModelKontekstRównoległe tok./sJeden tok/sGodzinowoMiesięcznieKonfiguracja
Llama 3.3 70B
Perfect on sparbox.m2
14,745729€0.73/h
€420.00/mo
sparbox.m2
Qwen3 30B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,49117021€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
185
+9%
24€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 27B (AWQ)
Perfect on infinityai.s1
65,53610314€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 35B
Perfect on infinityai.s1
95,55011115€0.59/h
€335.00/mo
infinityai.s1
DeepSeek R1 0528 Qwen3 8B
Perfect on infinityai.s1
85,99559275€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 31B (QAT)
Perfect on infinityai.s1
16,38414619€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E2B
Perfect on infinityai.s1
131,0721,105153€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E4B
Perfect on infinityai.s1
106,16768493€0.59/h
€335.00/mo
infinityai.s1
Granite 4.1 8B
Perfect on infinityai.s1
77,39553069€0.59/h
€335.00/mo
infinityai.s1
Llama 3.1 8B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
26,54137851€0.38/h
€215.00/mo
ranger.s1
106,167
+300%
601
+59%
84€0.73/h
€420.00/mo
sparbox.m2
Phi 4
Perfect on infinityai.s1
16,38433744€0.59/h
€335.00/mo
infinityai.s1
Phi 4 multimodal instruct
Perfect on infinityai.s1
117,964947130€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 14B
Perfect on infinityai.s1
21,49760579€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 3B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
19,3471,221165€0.38/h
€215.00/mo
ranger.s1
85,995
+344%
1,605
+31%
215€0.59/h
€335.00/mo
infinityai.s1
Mistral 7B
Perfect on infinityai.s1
32,76862281€0.59/h
€335.00/mo
infinityai.s1
GPT oss 20B
Perfect on infinityai.s1
131,072701196€0.59/h
€335.00/mo
infinityai.s1
Ornith 1.0 9B
Perfect on ranger.s1
47,77415568€0.38/h
€215.00/mo
ranger.s1
Qwen3 Coder 30B (AWQ)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,491864169€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
908149€0.59/h
€335.00/mo
infinityai.s1
Qwen3 VL 32B (AWQ)
Perfect on infinityai.s1
32,76840855€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 32B
Perfect on infinityai.s1
32,76841956€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 7B
Perfect on ranger.s1
32,76839351€0.38/h
€215.00/mo
ranger.s1
Qwen3 14B
Perfect on infinityai.s1
29,49133543€0.59/h
€335.00/mo
infinityai.s1
Qwen3 32B
Perfect on sparbox.m2
21,49729141€0.73/h
€420.00/mo
sparbox.m2
Qwen3 4B
Perfect on ranger.s1
40,96062384€0.38/h
€215.00/mo
ranger.s1
Qwen3 4B (2507)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
65,53662283€0.38/h
€215.00/mo
ranger.s1
131,072
+100%
868
+40%
116€0.59/h
€335.00/mo
infinityai.s1
Qwen3 8B
Perfect on infinityai.s1
40,96056974€0.59/h
€335.00/mo
infinityai.s1
Qwen3 Coder 30B (FP8)
Perfect on sparbox.m2
32,768776148€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 32B (FP8)
Perfect on sparbox.m2
13,27028840€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 4B
Perfect on ranger.s1
47,77425263€0.38/h
€215.00/mo
ranger.s1
Qwen3.5 9B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
21,49728346€0.38/h
€215.00/mo
ranger.s1
95,550
+344%
388
+37%
79€0.73/h
€420.00/mo
sparbox.m2
Qwen3.6 27B (FP8)
Perfect on sparbox.m2
32,76824246€0.73/h
€420.00/mo
sparbox.m2
Gemma 4 31B (FP8)
Perfect on sparbox.m2
8,19211742€0.73/h
€420.00/mo
sparbox.m2
GLM 4.6V Flash
Perfect on infinityai.s1
106,16748260€0.59/h
€335.00/mo
infinityai.s1

Kontekst = maksymalnie wykorzystywalne okno kontekstu. Równoległe/Jednokrotne = tokeny/sek. Cennik odzwierciedla najlepszy stosunek ceny do wydajności GPU na model. Cena jest zapłacona z góry; zachowujesz pełny dostęp root.

Zarządzany serwer GPU z wstępnie zainstalowanym vLLM

Trooper.AI daje Ci zarządzany serwer GPU z wstępnie zainstalowanym vLLM, gotowy do obsługi dowolnego otwartego dużego modelu językowego przez szybkie, kompatybilne z OpenAI API. Zamiast spędzać godziny na dobieraniu karty graficznej, instalowaniu sterowników CUDA, kompilacji vLLM i dostosowywaniu flag uruchomieniowych, wybierasz powyższy model i klikasz Start. W ciągu kilku minut otrzymujesz dedykowany serwer GPU hostowany w UE ze już działającym vLLM w dokładnej konfiguracji, którą przetestowaliśmy dla tego modelu – uwzględniono długość kontekstu, równoległość oraz argumenty wiersza poleceń.

Dlaczego serwer z wstępnie zainstalowanym vLLM?

vLLM jest standardowym silnikiem wysokoprzepustowego wnioskowania (inference), ale przygotowanie go do produkcji może być skomplikowane: dopasowywanie wersji sterowników i CUDA, wybór parametrów takich jak --max-num-batched-tokens, --max-num-seqs oraz odpowiedniego okna kontekstowego dla dostępnej pamięci VRAM Twojej karty graficznej, a także potwierdzenie prawidłowego załadowania modelu. Nasz zarządzany serwer GPU z wstępnie zainstalowanym vLLM eliminuje te trudności. Każda konfiguracja na tej stronie pochodzi bezpośrednio z automatycznych testów przeprowadzonych na rzeczywistym sprzęcie, więc rozmieścony przez Ciebie serwer zachowa się dokładnie tak samo jak przetestowana instancja – bez potrzeby eksperymentowania.

Prywatny, hostowany w UE i Twoje własne

Każdy serwer działa na dedykowanych kartach graficznych (bare-metal GPUs) w centrach danych w Niemczech certyfikowanych zgodnie z normą ISO/IEC 27001 i spełniających wymogi GDPR. Masz pełny dostęp root przez SSH, maszynę trwałą oraz prywatne endpointy – twoje zapytania i dane nigdy nie opuszczają Twojego serwera. Ponieważ jest to pełnowartościowy serwer GPU (nie dzielona inferencja), możesz również zainstalować dodatkowe oprogramowanie AI, dokonywać fine-tuningu lub uruchamiać modele obrazowe i audio obok swojego LLM.

Przejrzysty stosunek ceny do wydajności

Dla każdego modelu pokazujemy kartę graficzną z najlepszą relacją ceny do wydajności, przy uczcinych cenach godzinowych i miesięcznych. Możesz sprawdzić rzeczywiste przykłady odpowiedzi dla danego modelu za pomocą Pokaż jakość odpowiedzi, jeszcze przed wdrożeniem, aby znać zarówno prędkość oraz jakość odpowiedzi, za którą płacisz. Płaci się godzinowo podczas eksperymentów lub miesięcznie na potrzeby produkcji – serwer GPU zarządzany z wstępnie zainstalowanym vLLM, który skaluje się wraz z Twoimi wymaganiami.