Kør åbne LLMs på din egen dedikerede EU-GPU-server – helt privat, ingen datadeling. Hver model er benchmarket på reel hardware, så vi viser dig den GPU med bedst pris-præstation og dens målte hastighed.
| Model | Kontekst | Parallel t/s | Enkel t/s | Timebaseret | Månedligt | Konfiguration |
|---|---|---|---|---|---|---|
| Llama 3.3 70B Perfect on sparbox.m2 | 14,745 | 72 | 9 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 30B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 170 | 21 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 185 +9% | 24 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3.6 27B (AWQ) Perfect on infinityai.s1 | 65,536 | 103 | 14 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3.6 35B Perfect on infinityai.s1 | 95,550 | 111 | 15 | €0.59/h | €335.00/mo | infinityai.s1 |
| DeepSeek R1 0528 Qwen3 8B Perfect on infinityai.s1 | 85,995 | 592 | 75 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 31B (QAT) Perfect on infinityai.s1 | 16,384 | 146 | 19 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E2B Perfect on infinityai.s1 | 131,072 | 1,105 | 153 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E4B Perfect on infinityai.s1 | 106,167 | 684 | 93 | €0.59/h | €335.00/mo | infinityai.s1 |
| Granite 4.1 8B Perfect on infinityai.s1 | 77,395 | 530 | 69 | €0.59/h | €335.00/mo | infinityai.s1 |
| Llama 3.1 8B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 26,541 | 378 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| 106,167 +300% | 601 +59% | 84 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Phi 4 Perfect on infinityai.s1 | 16,384 | 337 | 44 | €0.59/h | €335.00/mo | infinityai.s1 |
| Phi 4 multimodal instruct Perfect on infinityai.s1 | 117,964 | 947 | 130 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 14B Perfect on infinityai.s1 | 21,497 | 605 | 79 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 3B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 19,347 | 1,221 | 165 | €0.38/h | €215.00/mo | ranger.s1 |
| 85,995 +344% | 1,605 +31% | 215 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Mistral 7B Perfect on infinityai.s1 | 32,768 | 622 | 81 | €0.59/h | €335.00/mo | infinityai.s1 |
| GPT oss 20B Perfect on infinityai.s1 | 131,072 | 701 | 196 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ornith 1.0 9B Perfect on ranger.s1 | 47,774 | 155 | 68 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 Coder 30B (AWQ) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 864 | 169 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 908 | 149 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 VL 32B (AWQ) Perfect on infinityai.s1 | 32,768 | 408 | 55 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 32B Perfect on infinityai.s1 | 32,768 | 419 | 56 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 7B Perfect on ranger.s1 | 32,768 | 393 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 14B Perfect on infinityai.s1 | 29,491 | 335 | 43 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 32B Perfect on sparbox.m2 | 21,497 | 291 | 41 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on ranger.s1 | 40,960 | 623 | 84 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 4B (2507) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 65,536 | 622 | 83 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +100% | 868 +40% | 116 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on infinityai.s1 | 40,960 | 569 | 74 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 Coder 30B (FP8) Perfect on sparbox.m2 | 32,768 | 776 | 148 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 32B (FP8) Perfect on sparbox.m2 | 13,270 | 288 | 40 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on ranger.s1 | 47,774 | 252 | 63 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3.5 9B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 21,497 | 283 | 46 | €0.38/h | €215.00/mo | ranger.s1 |
| 95,550 +344% | 388 +37% | 79 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Qwen3.6 27B (FP8) Perfect on sparbox.m2 | 32,768 | 242 | 46 | €0.73/h | €420.00/mo | sparbox.m2 |
| Gemma 4 31B (FP8) Perfect on sparbox.m2 | 8,192 | 117 | 42 | €0.73/h | €420.00/mo | sparbox.m2 |
| GLM 4.6V Flash Perfect on infinityai.s1 | 106,167 | 482 | 60 | €0.59/h | €335.00/mo | infinityai.s1 |
Kontext = maksimal anvendelig kontekstvindue. Parallel/Enkelt = tokens/sec. Priser afspejler den bedste pris-præstation GPU pr. model. Priser er forudbetalt; du beholder fuld root-adgang.
Trooper.AI giver dig en håndteret GPU-server forinstalleret med vLLM, klar til at servere ethvert åbent stort sprogmodel via en hurtig, OpenAI-kompatibel API. I stedet for at bruge timer på at vælge en GPU, installere CUDA-drivere, kompilere vLLM og justere startflag, vælger du blot et model ovenfor og klikker på Start. På få minutter får du en dedikeret EU-hospederet GPU-server med vLLM allerede kørende i den præcise konfiguration vi har benchmarket for det valgte model – herunder kontekstlængde, parallelisme og kommandolinjeargumenter inkluderet.
vLLM er den branchenormerede højtydende inference engine, men at få det klar til produktion kan være besværligt: at matche driver og CUDA-versioner, vælge --max-num-batched-tokens, --max-num-seqs samt den rette kontekstvindue for din GPUs VRAM, og sikre sig, at modellen faktisk indlæses. Vores administrerede GPU-server med forinstalleret vLLM fjerner dette arbejde. Alle konfigurationsmuligheder på denne side stammer direkte fra automatiserede benchmarktests på den egentlige hardware, så serveren du deplojer opfører sig præcis som testkørslen – ingen gætning.
Hver server kører på dedikerede bare-metal-GPU'er i ISO/IEC 27001-certificerede og GDPR-overholdende tyske datacentre. Du får fuld root-SSH-adgang, en vedvarende maskine samt et privat endpoint – dine prompts og data forlader aldrig din server. Da det er en hel GPU-server (ikke delt inferens), kan du også installere yderligere AI-programmer, finjustere eller køre billede- og lydmodeller sammen med dit LLM.
For hver model viser vi den GPU med bedst pris pr. ydeevne, inklusive ærlige timeløn og månedlige priser. Du kan gennemgå reelle eksempler på svar per model via Vis responskvalitet før implementering, så du ved både hastigheden og kvaliteten af svaret du betaler for. Betal timer til eksperimenter eller måneder til produktion – en administreret GPU-server forinstalleret med vLLM, der skaleres efter dine behov.