🔒 Privé LLM-inferentie NIEUW

Voer openbare LLMs uit op uw eigen gedediceerde 🇪🇺 EU-GPU-server – volledig privé, geen gegevensdeling. Elk model wordt getest op echte hardware, zodat wij u de GPU met het beste prijs-prestatieverhouding en zijn gemeten snelheid tonen.

Eénklik vLLM-deploy Volledig privé, geen gegevensdeling Getest op echte EU-hardware
Bekijk modellen & GPUs Huur GPU Server

Of je al een GPU-server draait en wilt een model erop hosten met vLLM, of je nieuw bent en privégehoste LLM-inferentie binnen de EU wilt uitproberen — deze één-klik Private LLM-service is voor jou.

📱➡️🖥️ Deze tabel ziet u het beste en ervaart u op desktopbrowsers.
ModelContextParallelle tokens/secEnkelvoudige t/sPer uurMaandelijksConfiguratie
Llama 3.3 70B 4-bit
Perfect on sparbox.m2
12,2886835€0.70/h
€375.00/mo
sparbox.m2
Qwen3 30B 4-bit
Perfect on sparbox.m2
84,992877168€0.70/h
€375.00/mo
sparbox.m2
Qwen3.6 27B 4-bit
Perfect on sparbox.m2
69,63239666€0.70/h
€375.00/mo
sparbox.m2
Qwen3.6 35B 4-bit
Perfect on sparbox.m2
62,464747143€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 31B 4-bit
Perfect on sparbox.m2
17,40839062€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 E2B
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
76,800914133€0.38/h
€205.00/mo
sparbox.sm1
117,760
+52%
1,160
+27%
184€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 E4B
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
30,72053870€0.38/h
€205.00/mo
sparbox.sm1
95,232
+205%
737
+37%
104€0.70/h
€375.00/mo
sparbox.m2
Granite 4.1 8B
Perfect on novatesla.s1
More context, higher speed on sparbox.m2
More context, higher speed on infinityai.s1
41,98424739€0.29/h
€155.00/mo
novatesla.s1
76,800
+80%
556
+125%
76€0.70/h
€375.00/mo
sparbox.m2
69,632
+62%
539
+118%
69€0.62/h
€330.00/mo
infinityai.s1
Llama 3.1 8B
Perfect on sparbox.m2
95,23262186€0.70/h
€375.00/mo
sparbox.m2
Phi 4
Perfect on sparbox.m2
14,33636750€0.70/h
€375.00/mo
sparbox.m2
Phi 4 multimodal
Perfect on sparbox.m2
117,760941144€0.70/h
€375.00/mo
sparbox.m2
Ministral 3 14B
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
20,48042956€0.38/h
€205.00/mo
sparbox.sm1
84,992
+300%
623
+45%
89€0.70/h
€375.00/mo
sparbox.m2
Ministral 3 3B
Perfect on sparbox.sm1
84,9921,218164€0.38/h
€205.00/mo
sparbox.sm1
Mistral 7B
Perfect on sparbox.sm1
28,67239953€0.38/h
€205.00/mo
sparbox.sm1
Llama 3.1 8B 8-bit
Perfect on ranger.s1.de
More context, higher speed on infinityai.s1
20,4806962€0.49/h
€260.00/mo
ranger.s1.de
117,760
+449%
889
+1197%
115€0.62/h
€330.00/mo
infinityai.s1
GPT OSS 20B
Perfect on sparbox.m2
117,760739223€0.70/h
€375.00/mo
sparbox.m2
Ornith 1.0 9B 4-bit
Perfect on ranger.s1.de
52,2247859€0.49/h
€260.00/mo
ranger.s1.de
Qwen3 Coder 30B 4-bit
Perfect on sparbox.sm1
More context, higher speed on sparbox.m2
25,600886170€0.38/h
€205.00/mo
sparbox.sm1
84,992
+224%
949
+7%
167€0.70/h
€375.00/mo
sparbox.m2
Qwen3 VL 32B 4-bit
Perfect on sparbox.m2
37,88842963€0.70/h
€375.00/mo
sparbox.m2
Qwen2.5 32B 4-bit
Perfect on sparbox.m2
28,67243864€0.70/h
€375.00/mo
sparbox.m2
Qwen2.5 7B
Perfect on sparbox.sm1
28,67240051€0.38/h
€205.00/mo
sparbox.sm1
Qwen3 14B
Perfect on sparbox.m2
36,86436450€0.70/h
€375.00/mo
sparbox.m2
Qwen3 32B 8-bit
Perfect on sparbox.m2
18,43229742€0.70/h
€375.00/mo
sparbox.m2
Qwen3 4B
Perfect on sparbox.sm1
36,86462785€0.38/h
€205.00/mo
sparbox.sm1
Qwen3 4B (2507)
Perfect on sparbox.sm1
More context, higher speed on infinityai.s1
58,36862684€0.38/h
€205.00/mo
sparbox.sm1
117,760
+100%
918
+47%
119€0.62/h
€330.00/mo
infinityai.s1
Qwen3 8B
Perfect on sparbox.sm1
More context, higher speed on infinityai.s1
23,55237949€0.38/h
€205.00/mo
sparbox.sm1
36,864
+54%
590
+56%
75€0.62/h
€330.00/mo
infinityai.s1
Qwen3 Coder 30B 8-bit
Perfect on sparbox.m2
41,984812153€0.70/h
€375.00/mo
sparbox.m2
Qwen3 VL 32B 8-bit
Perfect on sparbox.m2
15,36029441€0.70/h
€375.00/mo
sparbox.m2
Qwen3 VL 4B
Perfect on novatesla.s1
More context, higher speed on sparbox.m2
69,63243668€0.29/h
€155.00/mo
novatesla.s1
117,760
+69%
874
+101%
119€0.70/h
€375.00/mo
sparbox.m2
Qwen3.5 9B
Perfect on sparbox.m2
95,23255882€0.70/h
€375.00/mo
sparbox.m2
Qwen3.6 27B 8-bit
Perfect on sparbox.m2
28,67216447€0.70/h
€375.00/mo
sparbox.m2
Gemma 4 31B 8-bit
Perfect on sparbox.m2
8,19228643€0.70/h
€375.00/mo
sparbox.m2

Context = maximale bruikbare contextvenster. Parallel/Enkelvoudig = tokens/sec. De prijs weerspiegelt de beste kosten-prestatieverhouding van een GPU per model. Prijzen zijn vooraf betaald; je behoudt volledige root-toegang.

Alleen de GPU-server?

Je hoeft hier geen model te kiezen – bestel een kaalstaande GPU-server en draai erop wat je wilt, met volledige root-toegang.

Bestel een GPU Server

Uw vLLM-dashboard, direct na implementatie klaar

Seconden na het indrukken van Start staat uw privé-model direct beschikbaar achter een met OpenAI-compatibele endpoint – volg de doorvoer, contextgebruik en verzoeken via uw eigen dashboard.

vLLM server dashboard shown after deploying a private LLM on Trooper.AI

De top 10 kenmerken van uw privé LLM-GPU-server

Beheerd GPU-server voorgeïnstalleerd met vLLM

Trooper.AI levert je een beheerd GPU-systeem voorgeïnstalleerd met vLLM, klaar om elk open groot taalmodel te bedienen via een snelle, OpenAI-compatibele API. In plaats van uren door te brengen aan het selecteren van een GPU, installeren van CUDA-drivers, compileren van vLLM en afstemmen van opstartparameters, kies je hierboven een model en klik je op Start. Binnen enkele minuten ontvang je een gedediceerde, in de EU gehoste GPU-server waarop vLLM draait met de exacte configuratie die wij voor dat model hebben getest – inclusief contextlengte, parallelisme en opdrachtregelargumenten.

Waarom een voorgeïnstalleerde vLLM-server?

vLLM is de industrie­standaard high-throughput inferentiële motor, maar het productie­klaar maken ervan kan lastig zijn: afstemmen van driver- en CUDA-versies, kiezen voor --max-num-batched-tokens, --max-num-seqs en het juiste contextvenster voor de VRAM van je GPU, plus valideren dat het model daadwerkelijk laadt. Onze beheerde GPU-server voorgeïnstalleerd met vLLM neemt die werkzaamheden over. Elke configuratie op deze pagina komt rechtstreeks uit geautomatiseerde prestatietests op echte hardware, zodat de server die je ontplooit zich precies gedraagt zoals tijdens de testrun – geen proberen en fouten zoeken.

Privé, EU-gelokaliseerd en van jou

Elke server draait op bare-metal GPUs in ISO/IEC 27001-gecertificeerde, GDPR-voldoende Duitse datacenters. Je krijgt volledige root-SSH-toegang, een persistente machine en een privé-endpoint – uw prompts en gegevens verlaten nooit uw server. Omdat het om een complete GPU-server gaat (niet gedeelde inferentie), kunt u ook extra AI-software installeren, fijnstellen (fine-tune) of beeld- en audiomodellen naast uw LLM uitvoeren.

Transparante prijs-prestatieverhouding

Bij elk model tonen we de GPU met het beste prijs-prestatieverhouding, inclusief eerlijke uurtarieven en maandtarieven. Je kunt echte voorbeeldantwoorden per model bekijken via Toon antwoordkwaliteit voordat je deze implementeert, zodat je zowel de snelheid als de kwaliteit van het antwoord waarvoor je betaalt kent. Betaal per uur om te experimenteren of per maand voor productie — een beheerde GPU-server vooraf geïnstalleerd met vLLM die schaalt naar behoefte.

Je Eigen Privé LLM-GPU-Server

Een privé LLM GPU-server geeft je de volledige machine: volledige root-toegang, een privéle eindpunt dat compatibel is met OpenAI, onbeperkte aanvragen tegen een vooraf betaalde vaste tariefstructuur, en de vrijheid om te fijnsturen, modellen uit te wisselen of beeld- en audiowerklasten naast je LLM uit te voeren. Omdat de GPU van jou is, zijn doorvoer en contextlengte voorspelbaar en verlaten je prompts nooit je server – ideaal voor stabiele verkeersstromen en strenge privacy-eisen.

Kies een model uit de bovenstaande matrix en klik op Start: binnen enkele minuten heb je een door de EU gehoste GPU-server met vLLM die al draait volgens de exacte geteste configuratie – inclusief contextlengte, parallelisme en lanceeropties. Betaal per uur om te experimenteren of maandelijks voor productiegebruik, en schaal op naar een grotere GPU wanneer dan ook voor meer context of grotere modellen zonder opnieuw te installeren.

Markus and Jaimie working on an A100 GPU cluster for inference servers

Betrouwbare Hardware, Ontworpen door Specialisten

Achter elke privé LLM-GPU-server zit ondernemingsklasse, gerecyclede hardware die door ons eigen team wordt onderhouden. Hier zie je Markus en Jaimie een NVIDIA A100-cluster plaatsen in één van onze ISO/IEC 27001-gecertificeerde colocatiedatacenters in Duitsland – dezelfde klasse GPU-servers als u hier vanaf deze pagina kunt implementeren. Wij recyclen hoogpresterende componenten tot geoptimaliseerde inferentiestations, waardoor de levensduur van de hardware verlengd wordt en afval verminderd. We verkopen geen derde-partijcapaciteit aan; wij bezitten en exploiteren zelf onze hardware in colocatiedatacenters in Duitsland en Nederland, zodat we prestaties, beveiliging en dataresidentie op elk niveau van de stack kunnen garanderen.

Compatibel met de OpenAI Chat Completions API – Migreer uw AI-stack binnen minuten

Uw privé vLLM-server biedt een eindpunt dat 100% compatibel is met het OpenAI Chat Completions API-formaat (/v1/chat/completions). Als uw applicatie al het OpenAI SDK gebruikt — Python, Node.js of elke andere HTTP-client — hoeft u deze slechts op uw eigen server te richten met één regel wijziging: pas de basis-URL en API-sleutel aan. U behoudt hetzelfde aanvraag- en antwoordschema, inclusief volledige ondersteuning voor streamen, JSON-modus, functie-aanroepen en multimodale invoer. Geen herziening van de code nodig, geen nieuwe abstracties, geen leveranciersgebondenheid — uw integratie blijft draagbaar en u houdt controle.

Op zoek naar een alternatief voor de OpenAI API gehost in Europa? Een privé LLM GPU-server biedt u equivalente Chat Completions API-functionaliteit met EU-dataresidentie, een vast vooraf betaald tarief en volledige eigendom van de machine.

Werkt met de tools die je al gebruikt

Omdat uw server de OpenAI Chat Completions API spreekt, kunt u deze integreren met vrijwel elk AI-gereedschap, IDE of automatiseringsplatform — wijst u gewoon de basis-URL naar uw eigen eindpunt en voegt u uw sleutel toe. Enkele populaire voorbeelden:

Open WebUI
n8n
VS Code (Continue, Cline)
OpenClaw
Cursor
LibreChat
Flowise
Dify
LangChain
LlamaIndex
SillyTavern
Home Assistant

… en nog veel meer — elke app, agent of SDK die een met OpenAI-compatibele endpoint ondersteunt werkt direct.