Voer open LLMs uit op uw eigen gedediceerde EU-GPU-server – volledig privé, zonder gegevensdeling. Elke model wordt getest op echte hardware, zodat wij u de GPU met het beste prijs-prestatieverhoudingscijfer en zijn gemeten snelheid tonen.
| Model | Context | Parallelle tokens/sec | Enkelvoudige t/s | Per uur | Maandelijks | Configuratie |
|---|---|---|---|---|---|---|
| Llama 3.3 70B Perfect on sparbox.m2 | 14,745 | 72 | 9 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 30B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 170 | 21 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 185 +9% | 24 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3.6 27B (AWQ) Perfect on infinityai.s1 | 65,536 | 103 | 14 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3.6 35B Perfect on infinityai.s1 | 95,550 | 111 | 15 | €0.59/h | €335.00/mo | infinityai.s1 |
| DeepSeek R1 0528 Qwen3 8B Perfect on infinityai.s1 | 85,995 | 592 | 75 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 31B (QAT) Perfect on infinityai.s1 | 16,384 | 146 | 19 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E2B Perfect on infinityai.s1 | 131,072 | 1,105 | 153 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E4B Perfect on infinityai.s1 | 106,167 | 684 | 93 | €0.59/h | €335.00/mo | infinityai.s1 |
| Granite 4.1 8B Perfect on infinityai.s1 | 77,395 | 530 | 69 | €0.59/h | €335.00/mo | infinityai.s1 |
| Llama 3.1 8B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 26,541 | 378 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| 106,167 +300% | 601 +59% | 84 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Phi 4 Perfect on infinityai.s1 | 16,384 | 337 | 44 | €0.59/h | €335.00/mo | infinityai.s1 |
| Phi 4 multimodal instruct Perfect on infinityai.s1 | 117,964 | 947 | 130 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 14B Perfect on infinityai.s1 | 21,497 | 605 | 79 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 3B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 19,347 | 1,221 | 165 | €0.38/h | €215.00/mo | ranger.s1 |
| 85,995 +344% | 1,605 +31% | 215 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Mistral 7B Perfect on infinityai.s1 | 32,768 | 622 | 81 | €0.59/h | €335.00/mo | infinityai.s1 |
| GPT oss 20B Perfect on infinityai.s1 | 131,072 | 701 | 196 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ornith 1.0 9B Perfect on ranger.s1 | 47,774 | 155 | 68 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 Coder 30B (AWQ) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 864 | 169 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 908 | 149 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 VL 32B (AWQ) Perfect on infinityai.s1 | 32,768 | 408 | 55 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 32B Perfect on infinityai.s1 | 32,768 | 419 | 56 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 7B Perfect on ranger.s1 | 32,768 | 393 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 14B Perfect on infinityai.s1 | 29,491 | 335 | 43 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 32B Perfect on sparbox.m2 | 21,497 | 291 | 41 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on ranger.s1 | 40,960 | 623 | 84 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 4B (2507) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 65,536 | 622 | 83 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +100% | 868 +40% | 116 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on infinityai.s1 | 40,960 | 569 | 74 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 Coder 30B (FP8) Perfect on sparbox.m2 | 32,768 | 776 | 148 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 32B (FP8) Perfect on sparbox.m2 | 13,270 | 288 | 40 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on ranger.s1 | 47,774 | 252 | 63 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3.5 9B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 21,497 | 283 | 46 | €0.38/h | €215.00/mo | ranger.s1 |
| 95,550 +344% | 388 +37% | 79 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Qwen3.6 27B (FP8) Perfect on sparbox.m2 | 32,768 | 242 | 46 | €0.73/h | €420.00/mo | sparbox.m2 |
| Gemma 4 31B (FP8) Perfect on sparbox.m2 | 8,192 | 117 | 42 | €0.73/h | €420.00/mo | sparbox.m2 |
| GLM 4.6V Flash Perfect on infinityai.s1 | 106,167 | 482 | 60 | €0.59/h | €335.00/mo | infinityai.s1 |
Context = maximale bruikbare contextvenster. Parallel/Enkelvoudig = tokens/sec. De prijs weerspiegelt de beste kosten-prestatieverhouding van een GPU per model. Prijzen zijn vooraf betaald; je behoudt volledige root-toegang.
Trooper.AI levert je een beheerd GPU-systeem voorgeïnstalleerd met vLLM, klaar om elk open groot taalmodel te bedienen via een snelle, OpenAI-compatibele API. In plaats van uren door te brengen aan het selecteren van een GPU, installeren van CUDA-drivers, compileren van vLLM en afstemmen van opstartparameters, kies je hierboven een model en klik je op Start. Binnen enkele minuten ontvang je een gedediceerde, in de EU gehoste GPU-server waarop vLLM draait met de exacte configuratie die wij voor dat model hebben getest – inclusief contextlengte, parallelisme en opdrachtregelargumenten.
vLLM is de industriestandaard high-throughput inferentiële motor, maar het productieklaar maken ervan kan lastig zijn: afstemmen van driver- en CUDA-versies, kiezen voor --max-num-batched-tokens, --max-num-seqs en het juiste contextvenster voor de VRAM van je GPU, plus valideren dat het model daadwerkelijk laadt. Onze beheerde GPU-server voorgeïnstalleerd met vLLM neemt die werkzaamheden over. Elke configuratie op deze pagina komt rechtstreeks uit geautomatiseerde prestatietests op echte hardware, zodat de server die je ontplooit zich precies gedraagt zoals tijdens de testrun – geen proberen en fouten zoeken.
Elke server draait op bare-metal GPUs in ISO/IEC 27001-gecertificeerde, GDPR-voldoende Duitse datacenters. Je krijgt volledige root-SSH-toegang, een persistente machine en een privé-endpoint – uw prompts en gegevens verlaten nooit uw server. Omdat het om een complete GPU-server gaat (niet gedeelde inferentie), kunt u ook extra AI-software installeren, fijnstellen (fine-tune) of beeld- en audiomodellen naast uw LLM uitvoeren.
Bij elk model tonen we de GPU met het beste prijs-prestatieverhouding, inclusief eerlijke uurtarieven en maandtarieven. Je kunt echte voorbeeldantwoorden per model bekijken via Toon antwoordkwaliteit voordat je deze implementeert, zodat je zowel de snelheid als de kwaliteit van het antwoord waarvoor je betaalt kent. Betaal per uur om te experimenteren of per maand voor productie — een beheerde GPU-server vooraf geïnstalleerd met vLLM die schaalt naar behoefte.