Voer openbare LLMs uit op uw eigen gedediceerde 🇪🇺 EU-GPU-server – volledig privé, geen gegevensdeling. Elk model wordt getest op echte hardware, zodat wij u de GPU met het beste prijs-prestatieverhouding en zijn gemeten snelheid tonen.
Of je al een GPU-server draait en wilt een model erop hosten met vLLM, of je nieuw bent en privégehoste LLM-inferentie binnen de EU wilt uitproberen — deze één-klik Private LLM-service is voor jou.
| Model | Context | Parallelle tokens/sec | Enkelvoudige t/s | Per uur | Maandelijks | Configuratie |
|---|---|---|---|---|---|---|
| Llama 3.3 70B 4-bit Perfect on sparbox.m2 | 12,288 | 68 | 35 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 30B 4-bit Perfect on sparbox.m2 | 84,992 | 877 | 168 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 4-bit Perfect on sparbox.m2 | 69,632 | 396 | 66 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 35B 4-bit Perfect on sparbox.m2 | 62,464 | 747 | 143 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 4-bit Perfect on sparbox.m2 | 17,408 | 390 | 62 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 E2B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 76,800 | 914 | 133 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +52% | 1,160 +27% | 184 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Gemma 4 E4B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 30,720 | 538 | 70 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 95,232 +205% | 737 +37% | 104 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Granite 4.1 8B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 More context, higher speed on infinityai.s1 | 41,984 | 247 | 39 | €0.29/h | €155.00/mo | novatesla.s1 |
| 76,800 +80% | 556 +125% | 76 | €0.70/h | €375.00/mo | sparbox.m2 | |
| 69,632 +62% | 539 +118% | 69 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Llama 3.1 8B Perfect on sparbox.m2 | 95,232 | 621 | 86 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 Perfect on sparbox.m2 | 14,336 | 367 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 multimodal Perfect on sparbox.m2 | 117,760 | 941 | 144 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ministral 3 14B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 20,480 | 429 | 56 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +300% | 623 +45% | 89 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Ministral 3 3B Perfect on sparbox.sm1 | 84,992 | 1,218 | 164 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Mistral 7B Perfect on sparbox.sm1 | 28,672 | 399 | 53 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Llama 3.1 8B 8-bit Perfect on ranger.s1.de More context, higher speed on infinityai.s1 | 20,480 | 69 | 62 | €0.49/h | €260.00/mo | ranger.s1.de |
| 117,760 +449% | 889 +1197% | 115 | €0.62/h | €330.00/mo | infinityai.s1 | |
| GPT OSS 20B Perfect on sparbox.m2 | 117,760 | 739 | 223 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ornith 1.0 9B 4-bit Perfect on ranger.s1.de | 52,224 | 78 | 59 | €0.49/h | €260.00/mo | ranger.s1.de |
| Qwen3 Coder 30B 4-bit Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 25,600 | 886 | 170 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +224% | 949 +7% | 167 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3 VL 32B 4-bit Perfect on sparbox.m2 | 37,888 | 429 | 63 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 32B 4-bit Perfect on sparbox.m2 | 28,672 | 438 | 64 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 7B Perfect on sparbox.sm1 | 28,672 | 400 | 51 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 14B Perfect on sparbox.m2 | 36,864 | 364 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 32B 8-bit Perfect on sparbox.m2 | 18,432 | 297 | 42 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on sparbox.sm1 | 36,864 | 627 | 85 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 4B (2507) Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 58,368 | 626 | 84 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +100% | 918 +47% | 119 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 23,552 | 379 | 49 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 36,864 +54% | 590 +56% | 75 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 Coder 30B 8-bit Perfect on sparbox.m2 | 41,984 | 812 | 153 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 32B 8-bit Perfect on sparbox.m2 | 15,360 | 294 | 41 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 | 69,632 | 436 | 68 | €0.29/h | €155.00/mo | novatesla.s1 |
| 117,760 +69% | 874 +101% | 119 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3.5 9B Perfect on sparbox.m2 | 95,232 | 558 | 82 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 8-bit Perfect on sparbox.m2 | 28,672 | 164 | 47 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 8-bit Perfect on sparbox.m2 | 8,192 | 286 | 43 | €0.70/h | €375.00/mo | sparbox.m2 |
Context = maximale bruikbare contextvenster. Parallel/Enkelvoudig = tokens/sec. De prijs weerspiegelt de beste kosten-prestatieverhouding van een GPU per model. Prijzen zijn vooraf betaald; je behoudt volledige root-toegang.
Je hoeft hier geen model te kiezen – bestel een kaalstaande GPU-server en draai erop wat je wilt, met volledige root-toegang.
Bestel een GPU ServerSeconden na het indrukken van Start staat uw privé-model direct beschikbaar achter een met OpenAI-compatibele endpoint – volg de doorvoer, contextgebruik en verzoeken via uw eigen dashboard.
Trooper.AI levert je een beheerd GPU-systeem voorgeïnstalleerd met vLLM, klaar om elk open groot taalmodel te bedienen via een snelle, OpenAI-compatibele API. In plaats van uren door te brengen aan het selecteren van een GPU, installeren van CUDA-drivers, compileren van vLLM en afstemmen van opstartparameters, kies je hierboven een model en klik je op Start. Binnen enkele minuten ontvang je een gedediceerde, in de EU gehoste GPU-server waarop vLLM draait met de exacte configuratie die wij voor dat model hebben getest – inclusief contextlengte, parallelisme en opdrachtregelargumenten.
vLLM is de industriestandaard high-throughput inferentiële motor, maar het productieklaar maken ervan kan lastig zijn: afstemmen van driver- en CUDA-versies, kiezen voor --max-num-batched-tokens, --max-num-seqs en het juiste contextvenster voor de VRAM van je GPU, plus valideren dat het model daadwerkelijk laadt. Onze beheerde GPU-server voorgeïnstalleerd met vLLM neemt die werkzaamheden over. Elke configuratie op deze pagina komt rechtstreeks uit geautomatiseerde prestatietests op echte hardware, zodat de server die je ontplooit zich precies gedraagt zoals tijdens de testrun – geen proberen en fouten zoeken.
Elke server draait op bare-metal GPUs in ISO/IEC 27001-gecertificeerde, GDPR-voldoende Duitse datacenters. Je krijgt volledige root-SSH-toegang, een persistente machine en een privé-endpoint – uw prompts en gegevens verlaten nooit uw server. Omdat het om een complete GPU-server gaat (niet gedeelde inferentie), kunt u ook extra AI-software installeren, fijnstellen (fine-tune) of beeld- en audiomodellen naast uw LLM uitvoeren.
Bij elk model tonen we de GPU met het beste prijs-prestatieverhouding, inclusief eerlijke uurtarieven en maandtarieven. Je kunt echte voorbeeldantwoorden per model bekijken via Toon antwoordkwaliteit voordat je deze implementeert, zodat je zowel de snelheid als de kwaliteit van het antwoord waarvoor je betaalt kent. Betaal per uur om te experimenteren of per maand voor productie — een beheerde GPU-server vooraf geïnstalleerd met vLLM die schaalt naar behoefte.
Een privé LLM GPU-server geeft je de volledige machine: volledige root-toegang, een privéle eindpunt dat compatibel is met OpenAI, onbeperkte aanvragen tegen een vooraf betaalde vaste tariefstructuur, en de vrijheid om te fijnsturen, modellen uit te wisselen of beeld- en audiowerklasten naast je LLM uit te voeren. Omdat de GPU van jou is, zijn doorvoer en contextlengte voorspelbaar en verlaten je prompts nooit je server – ideaal voor stabiele verkeersstromen en strenge privacy-eisen.
Kies een model uit de bovenstaande matrix en klik op Start: binnen enkele minuten heb je een door de EU gehoste GPU-server met vLLM die al draait volgens de exacte geteste configuratie – inclusief contextlengte, parallelisme en lanceeropties. Betaal per uur om te experimenteren of maandelijks voor productiegebruik, en schaal op naar een grotere GPU wanneer dan ook voor meer context of grotere modellen zonder opnieuw te installeren.
Achter elke privé LLM-GPU-server zit ondernemingsklasse, gerecyclede hardware die door ons eigen team wordt onderhouden. Hier zie je Markus en Jaimie een NVIDIA A100-cluster plaatsen in één van onze ISO/IEC 27001-gecertificeerde colocatiedatacenters in Duitsland – dezelfde klasse GPU-servers als u hier vanaf deze pagina kunt implementeren. Wij recyclen hoogpresterende componenten tot geoptimaliseerde inferentiestations, waardoor de levensduur van de hardware verlengd wordt en afval verminderd. We verkopen geen derde-partijcapaciteit aan; wij bezitten en exploiteren zelf onze hardware in colocatiedatacenters in Duitsland en Nederland, zodat we prestaties, beveiliging en dataresidentie op elk niveau van de stack kunnen garanderen.
Uw privé vLLM-server biedt een eindpunt dat 100% compatibel is met het OpenAI Chat Completions API-formaat (/v1/chat/completions). Als uw applicatie al het OpenAI SDK gebruikt — Python, Node.js of elke andere HTTP-client — hoeft u deze slechts op uw eigen server te richten met één regel wijziging: pas de basis-URL en API-sleutel aan. U behoudt hetzelfde aanvraag- en antwoordschema, inclusief volledige ondersteuning voor streamen, JSON-modus, functie-aanroepen en multimodale invoer. Geen herziening van de code nodig, geen nieuwe abstracties, geen leveranciersgebondenheid — uw integratie blijft draagbaar en u houdt controle.
Op zoek naar een alternatief voor de OpenAI API gehost in Europa? Een privé LLM GPU-server biedt u equivalente Chat Completions API-functionaliteit met EU-dataresidentie, een vast vooraf betaald tarief en volledige eigendom van de machine.
Omdat uw server de OpenAI Chat Completions API spreekt, kunt u deze integreren met vrijwel elk AI-gereedschap, IDE of automatiseringsplatform — wijst u gewoon de basis-URL naar uw eigen eindpunt en voegt u uw sleutel toe. Enkele populaire voorbeelden:
… en nog veel meer — elke app, agent of SDK die een met OpenAI-compatibele endpoint ondersteunt werkt direct.