Uruchom otwarte modele językowe na własnym dedykowanym serwerze z kartą graficzną 🇪🇺 w UE – całkowicie prywatnie, bez udostępniania danych. Każdy model jest testowany na rzeczywistym sprzęcie, dzięki czemu pokazujemy Ci najlepszą pod względem stosunku cena/wydajność kartę graficzną oraz jej zmierzoną szybkość.
Czy już uruchamiasz serwer z kartą graficzną i chcesz obsługiwać na nim model za pomocą vLLM, czy dopiero rozpoczynasz przygodę z prywatną inferencją LLM w hostingach EU — ta usługa Private LLM z jednym kliknięciem jest dla Ciebie.
| Model | Kontekst | Równoległe tok./s | Jeden tok/s | Godzinowo | Miesięcznie | Konfiguracja |
|---|---|---|---|---|---|---|
| Llama 3.3 70B 4-bit Perfect on sparbox.m2 | 12,288 | 68 | 35 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 30B 4-bit Perfect on sparbox.m2 | 84,992 | 877 | 168 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 4-bit Perfect on sparbox.m2 | 69,632 | 396 | 66 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 35B 4-bit Perfect on sparbox.m2 | 62,464 | 747 | 143 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 4-bit Perfect on sparbox.m2 | 17,408 | 390 | 62 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 E2B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 76,800 | 914 | 133 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +52% | 1,160 +27% | 184 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Gemma 4 E4B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 30,720 | 538 | 70 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 95,232 +205% | 737 +37% | 104 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Granite 4.1 8B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 More context, higher speed on infinityai.s1 | 41,984 | 247 | 39 | €0.29/h | €155.00/mo | novatesla.s1 |
| 76,800 +80% | 556 +125% | 76 | €0.70/h | €375.00/mo | sparbox.m2 | |
| 69,632 +62% | 539 +118% | 69 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Llama 3.1 8B Perfect on sparbox.m2 | 95,232 | 621 | 86 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 Perfect on sparbox.m2 | 14,336 | 367 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 multimodal Perfect on sparbox.m2 | 117,760 | 941 | 144 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ministral 3 14B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 20,480 | 429 | 56 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +300% | 623 +45% | 89 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Ministral 3 3B Perfect on sparbox.sm1 | 84,992 | 1,218 | 164 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Mistral 7B Perfect on sparbox.sm1 | 28,672 | 399 | 53 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Llama 3.1 8B 8-bit Perfect on ranger.s1.de More context, higher speed on infinityai.s1 | 20,480 | 69 | 62 | €0.49/h | €260.00/mo | ranger.s1.de |
| 117,760 +449% | 889 +1197% | 115 | €0.62/h | €330.00/mo | infinityai.s1 | |
| GPT OSS 20B Perfect on sparbox.m2 | 117,760 | 739 | 223 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ornith 1.0 9B 4-bit Perfect on ranger.s1.de | 52,224 | 78 | 59 | €0.49/h | €260.00/mo | ranger.s1.de |
| Qwen3 Coder 30B 4-bit Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 25,600 | 886 | 170 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +224% | 949 +7% | 167 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3 VL 32B 4-bit Perfect on sparbox.m2 | 37,888 | 429 | 63 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 32B 4-bit Perfect on sparbox.m2 | 28,672 | 438 | 64 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 7B Perfect on sparbox.sm1 | 28,672 | 400 | 51 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 14B Perfect on sparbox.m2 | 36,864 | 364 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 32B 8-bit Perfect on sparbox.m2 | 18,432 | 297 | 42 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on sparbox.sm1 | 36,864 | 627 | 85 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 4B (2507) Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 58,368 | 626 | 84 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +100% | 918 +47% | 119 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 23,552 | 379 | 49 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 36,864 +54% | 590 +56% | 75 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 Coder 30B 8-bit Perfect on sparbox.m2 | 41,984 | 812 | 153 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 32B 8-bit Perfect on sparbox.m2 | 15,360 | 294 | 41 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 | 69,632 | 436 | 68 | €0.29/h | €155.00/mo | novatesla.s1 |
| 117,760 +69% | 874 +101% | 119 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3.5 9B Perfect on sparbox.m2 | 95,232 | 558 | 82 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 8-bit Perfect on sparbox.m2 | 28,672 | 164 | 47 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 8-bit Perfect on sparbox.m2 | 8,192 | 286 | 43 | €0.70/h | €375.00/mo | sparbox.m2 |
Kontekst = maksymalnie wykorzystywalne okno kontekstu. Równoległe/Jednokrotne = tokeny/sek. Cennik odzwierciedla najlepszy stosunek ceny do wydajności GPU na model. Cena jest zapłacona z góry; zachowujesz pełny dostęp root.
Nie musisz tutaj wybierać modelu – zamów serwer z gołą kartą graficzną i uruchom na nim wszystko, co chcesz, mając pełny dostęp root.
Zamów serwer GPUKilka sekund po kliknięciu Start Twoja prywatna wersja modelu jest dostępna za interfejsem kompatybilnym z OpenAI – śledź przepustowość, zużycie kontekstu i żądania ze swojego panelu sterowania.
Trooper.AI daje Ci zarządzany serwer GPU z wstępnie zainstalowanym vLLM, gotowy do obsługi dowolnego otwartego dużego modelu językowego przez szybkie, kompatybilne z OpenAI API. Zamiast spędzać godziny na dobieraniu karty graficznej, instalowaniu sterowników CUDA, kompilacji vLLM i dostosowywaniu flag uruchomieniowych, wybierasz powyższy model i klikasz Start. W ciągu kilku minut otrzymujesz dedykowany serwer GPU hostowany w UE ze już działającym vLLM w dokładnej konfiguracji, którą przetestowaliśmy dla tego modelu – uwzględniono długość kontekstu, równoległość oraz argumenty wiersza poleceń.
vLLM jest standardowym silnikiem wysokoprzepustowego wnioskowania (inference), ale przygotowanie go do produkcji może być skomplikowane: dopasowywanie wersji sterowników i CUDA, wybór parametrów takich jak --max-num-batched-tokens, --max-num-seqs oraz odpowiedniego okna kontekstowego dla dostępnej pamięci VRAM Twojej karty graficznej, a także potwierdzenie prawidłowego załadowania modelu. Nasz zarządzany serwer GPU z wstępnie zainstalowanym vLLM eliminuje te trudności. Każda konfiguracja na tej stronie pochodzi bezpośrednio z automatycznych testów przeprowadzonych na rzeczywistym sprzęcie, więc rozmieścony przez Ciebie serwer zachowa się dokładnie tak samo jak przetestowana instancja – bez potrzeby eksperymentowania.
Każdy serwer działa na dedykowanych kartach graficznych (bare-metal GPUs) w centrach danych w Niemczech certyfikowanych zgodnie z normą ISO/IEC 27001 i spełniających wymogi GDPR. Masz pełny dostęp root przez SSH, maszynę trwałą oraz prywatne endpointy – twoje zapytania i dane nigdy nie opuszczają Twojego serwera. Ponieważ jest to pełnowartościowy serwer GPU (nie dzielona inferencja), możesz również zainstalować dodatkowe oprogramowanie AI, dokonywać fine-tuningu lub uruchamiać modele obrazowe i audio obok swojego LLM.
Dla każdego modelu pokazujemy kartę graficzną z najlepszą relacją ceny do wydajności, przy uczcinych cenach godzinowych i miesięcznych. Możesz sprawdzić rzeczywiste przykłady odpowiedzi dla danego modelu za pomocą Pokaż jakość odpowiedzi, jeszcze przed wdrożeniem, aby znać zarówno prędkość oraz jakość odpowiedzi, za którą płacisz. Płaci się godzinowo podczas eksperymentów lub miesięcznie na potrzeby produkcji – serwer GPU zarządzany z wstępnie zainstalowanym vLLM, który skaluje się wraz z Twoimi wymaganiami.
Prywatny serwer GPU z wdrożonym modelem LLM daje Ci pełną kontrolę nad maszyną: dostęp na poziomie roota, prywatne API kompatybilne z OpenAI, nieograniczoną liczbę żądań za stałą opłatą przedpłaconą oraz możliwość dopasowywania modeli, wymiany ich lub uruchamiania obciążenia obrazowego i dźwiękowego obok Twojego LLM. Ponieważ GPU jest wyłącznie Twój, przepustowość i długość kontekstu są przewidywalne, a Twoje zapytania nigdy nie opuszczają serwera – idealne dla stabilnego ruchu i rygorystycznych wymagań dotyczących poufności.
Wybierz model z powyższej macierzy i kliknij Start: w ciągu kilku minut otrzymasz serwer GPU hostowany w UE z już uruchomionym vLLM zgodnie z dokładną skonfigurowaną wersją testową — uwzględniony jest rozmiar kontekstu, równoległość oraz flagi uruchomieniowe. Płacisz godzinowo za eksperymentowanie lub miesięcznie dla produkcji, a także możesz dowolnie ulepszyć GPU na większe możliwości kontekstowe lub modele bez ponownej instalacji.
Za każdym prywatnym serwerem GPU z wdrożonym vLLM stoi sprzęt klasy enterprise, poddawany procesowi recyklingu i utrzymywany przez nasz zespół. Na zdjęciu Markus i Jaimie montują klaster NVIDIA A100 w jednym z naszych certyfikowanych centrum kolokacji zgodnych ze standardem ISO/IEC 27001 w Niemczech – dokładnie taki sam typ serwerów GPU, jakie można rozmieścić za pośrednictwem tej strony. Przetwarzamy wysokowydajne komponenty na optymalizowane urządzenia do inferencji, przedłużając tym samym żywotność sprzętu przy jednoczesnej redukcji odpadów elektronicznych. Nie handlujemy pojemnością trzecich stron; posiadamy i eksploatujemy własny sprzęt w centrach danych typu colocation w Niemczech oraz Holandii, co pozwala nam zagwarantować wydajność, bezpieczeństwo oraz rezydentność danych na wszystkich poziomach infrastruktury.
Twój prywatny serwer vLLM udostępnia punkt końcowy w pełni zgodny z formatem interfejsu API OpenAI Chat Completions (//v1/chat/completions). Jeśli Twoja aplikacja już używa OpenAI SDK — dla Pythona, Node.js lub dowolnego klienta HTTP — wystarczy skierować ją na własny serwer; zmiana wymaga jednej linii kodu: aktualizacji adresu bazowego i klucza API. Otrzymasz ten sam schemat żądań i odpowiedzi oraz pełne wsparcie dla strumieniowania, trybu JSON, wywoływania funkcji i wejść multimodalnych. Bez rewizji kodu, bez nowych abstrakcji, bez zamknięcia dostawcy — integracja pozostaje przenośna, a Ty zachowujesz kontrolę.
Szukasz alternatywy dla OpenAI API hostowanej w Europie? Prywatny serwer GPU z modelami językowymi zapewnia równoważną funkcjonalność API Chat Completions wraz z rezydencją danych w UE, stałą ceną przedpłaconą oraz pełnym własnością maszyny.
Ponieważ Twój serwer obsługuje interfejs OpenAI Chat Completions API, możesz go podłączyć niemal do każdego narzędzia AI, środowiska IDE lub platformy automatyzacji — wystarczy wskazać adres podstawowej strony na własnym końcu i dodać swój klucz.
… i wiele więcej — każda aplikacja, agent lub SDK obsługujące kompatybilny z OpenAI endpoint działa gotowe do użycia.