Exécutez des modèles de langage ouverts (LLMs) sur votre propre serveur GPU dédié 🇪🇺 dans l'UE – entièrement privé, sans partage de données. Chaque modèle est évalué sur du matériel réel, nous vous montrons donc la carte graphique offrant le meilleur rapport prix-rendement et sa vitesse mesurée.
Que vous disposiez déjà d'un serveur GPU et souhaitiez y déployer un modèle avec vLLM, ou que vous débutiez et vouliez explorer l'inférence de modèles de langage privés hébergés en UE – ce service Private LLM en un clic est fait pour vous.
| Modèle | Contexte | Parallèle t/s | Débit simple (t/s) | À l'heure | Mensuel | Configuration |
|---|---|---|---|---|---|---|
| Llama 3.3 70B 4-bit Perfect on sparbox.m2 | 12,288 | 68 | 35 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 30B 4-bit Perfect on sparbox.m2 | 84,992 | 877 | 168 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 4-bit Perfect on sparbox.m2 | 69,632 | 396 | 66 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 35B 4-bit Perfect on sparbox.m2 | 62,464 | 747 | 143 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 4-bit Perfect on sparbox.m2 | 17,408 | 390 | 62 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 E2B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 76,800 | 914 | 133 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +52% | 1,160 +27% | 184 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Gemma 4 E4B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 30,720 | 538 | 70 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 95,232 +205% | 737 +37% | 104 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Granite 4.1 8B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 More context, higher speed on infinityai.s1 | 41,984 | 247 | 39 | €0.29/h | €155.00/mo | novatesla.s1 |
| 76,800 +80% | 556 +125% | 76 | €0.70/h | €375.00/mo | sparbox.m2 | |
| 69,632 +62% | 539 +118% | 69 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Llama 3.1 8B Perfect on sparbox.m2 | 95,232 | 621 | 86 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 Perfect on sparbox.m2 | 14,336 | 367 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 multimodal Perfect on sparbox.m2 | 117,760 | 941 | 144 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ministral 3 14B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 20,480 | 429 | 56 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +300% | 623 +45% | 89 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Ministral 3 3B Perfect on sparbox.sm1 | 84,992 | 1,218 | 164 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Mistral 7B Perfect on sparbox.sm1 | 28,672 | 399 | 53 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Llama 3.1 8B 8-bit Perfect on ranger.s1.de More context, higher speed on infinityai.s1 | 20,480 | 69 | 62 | €0.49/h | €260.00/mo | ranger.s1.de |
| 117,760 +449% | 889 +1197% | 115 | €0.62/h | €330.00/mo | infinityai.s1 | |
| GPT OSS 20B Perfect on sparbox.m2 | 117,760 | 739 | 223 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ornith 1.0 9B 4-bit Perfect on ranger.s1.de | 52,224 | 78 | 59 | €0.49/h | €260.00/mo | ranger.s1.de |
| Qwen3 Coder 30B 4-bit Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 25,600 | 886 | 170 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +224% | 949 +7% | 167 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3 VL 32B 4-bit Perfect on sparbox.m2 | 37,888 | 429 | 63 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 32B 4-bit Perfect on sparbox.m2 | 28,672 | 438 | 64 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 7B Perfect on sparbox.sm1 | 28,672 | 400 | 51 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 14B Perfect on sparbox.m2 | 36,864 | 364 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 32B 8-bit Perfect on sparbox.m2 | 18,432 | 297 | 42 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on sparbox.sm1 | 36,864 | 627 | 85 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 4B (2507) Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 58,368 | 626 | 84 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +100% | 918 +47% | 119 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 23,552 | 379 | 49 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 36,864 +54% | 590 +56% | 75 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 Coder 30B 8-bit Perfect on sparbox.m2 | 41,984 | 812 | 153 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 32B 8-bit Perfect on sparbox.m2 | 15,360 | 294 | 41 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 | 69,632 | 436 | 68 | €0.29/h | €155.00/mo | novatesla.s1 |
| 117,760 +69% | 874 +101% | 119 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3.5 9B Perfect on sparbox.m2 | 95,232 | 558 | 82 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 8-bit Perfect on sparbox.m2 | 28,672 | 164 | 47 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 8-bit Perfect on sparbox.m2 | 8,192 | 286 | 43 | €0.70/h | €375.00/mo | sparbox.m2 |
Contexte = fenêtre de contexte utilisable maximale. Parallèle/Simple = jetons/seconde. Les tarifs reflètent le meilleur rapport performance-prix par modèle de GPU. Les prix sont prépayés ; vous conservez un accès complet en root.
Vous n’êtes pas obligé de choisir un modèle ici – commandez un serveur GPU nu et exécutez ce que vous souhaitez dessus, avec accès complet en root.
Commander un serveur GPUQuelques secondes après avoir cliqué sur Démarrer, votre modèle privé est opérationnel derrière une interface compatible avec l'API d'OpenAI – suivez le débit, la consommation de contexte et les requêtes depuis votre propre tableau de bord.
Trooper.AI vous propose un serveur GPU géré et préinstallé avec vLLM, prêt à servir n'importe quel grand modèle de langage ouvert via une API rapide compatible OpenAI. Plutôt que de passer des heures à choisir une carte graphique, installer les pilotes CUDA, compiler vLLM ou ajuster les drapeaux de lancement, il suffit de sélectionner le modèle ci-dessus puis de cliquer sur Démarrer. En quelques minutes seulement, vous obtenez un serveur dédié hébergé en UE équipé d’un GPU avec vLLM déjà exécutant la configuration optimisée pour ce modèle – incluant longueur du contexte, parallélisme et arguments de ligne de commande testés.
vLLM est le moteur d'inférence haute performance standard du secteur, mais le rendre prêt pour la production peut être fastidieux : il faut correspondre les versions des pilotes et de CUDA, choisir --max-num-batched-tokens, --max-num-seqs ainsi que la bonne fenêtre de contexte en fonction de la mémoire VRAM de votre GPU, puis valider que le modèle se charge effectivement. Notre serveur GPU géré préinstallé avec vLLM élimine cette étape. Chaque configuration sur cette page provient directement de benchmarks automatisés effectués sur du matériel réel ; ainsi, le serveur déployé se comporte exactement comme lors des tests – sans essai-erreur.
Chaque serveur fonctionne sur des GPUs en métal nu dans des centres de données allemands certifiés ISO/IEC 27001 et conformes au RGPD. Vous bénéficiez d’un accès complet en SSH root, d’une machine persistante ainsi que d’un point de terminaison privé – vos requêtes et données ne quittent jamais votre serveur. Comme il s’agit d'un serveur GPU dédié (et non partagé pour l'inférence), vous pouvez également installer un logiciel IA supplémentaire, affiner les modèles ou exécuter des modèles d'image et audio aux côtés de votre LLM.
Pour chaque modèle, nous affichons la carte graphique offrant le meilleur rapport prix/performance, avec des tarifs horaires et mensuels transparents. Vous pouvez consulter des réponses d’exemple réelles par modèle via Afficher la qualité de réponse avant déploiement, afin de connaître à la fois la vitesse et la qualité des réponses pour lesquelles vous payez. Payer à l’heure pour expérimenter ou au mois pour une utilisation en production – un serveur GPU géré préinstallé avec vLLM qui s’adapte à vos besoins.
Un serveur GPU privé dédié pour modèles de langage (LLM) vous donne accès à la totalité de la machine : accès complet en root, une interface compatible avec l'API d'OpenAI, des requêtes illimitées à tarif prépayé fixe, ainsi que la liberté d'affiner les modèles (fine-tuning), d'en changer ou d'exécuter des charges de travail liées aux images et au son parallèlement à votre LLM. Comme le GPU est le vôtre, débit et longueur du contexte sont prévisibles et vos instructions ne quittent jamais votre serveur – idéal pour un trafic régulier et des exigences strictes en matière de confidentialité.
Sélectionnez un modèle dans le tableau ci-dessus et cliquez sur Démarrer : en quelques minutes, vous obtenez un serveur GPU hébergé dans l'UE avec vLLM déjà exécutant la configuration testée exactement — longueur de contexte, parallélisme et drapeaux de lancement inclus. Payer à l'heure pour expérimenter ou mensuellement pour une utilisation en production, puis mettre à niveau vers une carte graphique plus puissante à tout moment pour des contextes ou modèles plus grands sans réinstallation.
Derrière chaque serveur GPU privé pour modèles de langage se trouve un matériel d'entreprise recyclé et optimisé, entretenu par notre propre équipe. Ici, Markus et Jaimie installent un cluster NVIDIA A100 dans l'un de nos centres de colocalisation certifiés ISO/IEC 27001 en Allemagne – la même classe de serveurs GPU que vous déployez depuis cette page. Nous recyclons des composants haute performance pour créer des configurations dédiées à l'inférence, prolongeant ainsi la durée de vie du matériel tout en réduisant les déchets électroniques. Nous ne revendons pas de capacité tierce ; nous possédons et exploitons notre propre infrastructure dans des centres de données en colocalisation situés en Allemagne et aux Pays-Bas, ce qui nous permet de garantir des performances optimales, une sécurité renforcée et le respect de la résidence des données à tous les niveaux.
Votre serveur privé vLLM expose une extrémité qui est à 100 % compatible avec le format de l'API des complétions de chat d'OpenAI (/v1/chat/completions). Si votre application utilise déjà le SDK OpenAI — en Python, Node.js ou tout autre client HTTP —, il suffit de la rediriger vers votre propre serveur : une modification d’une seule ligne suffit : mettez à jour l’URL de base et la clé API. Vous conservez le même schéma de requête et de réponse, ainsi qu’un soutien complet pour le streaming, le mode JSON, les appels de fonction et les entrées multimodales. Aucune réécriture du code, aucune abstraction supplémentaire ni verrouillage fournisseur — votre intégration reste portable et vous gardez le contrôle.
Cherchez-vous une alternative à l'API OpenAI hébergée en Europe ? Un serveur privé avec GPU pour modèles de langage vous offre la même fonctionnalité que l'API Chat Completions, incluant la résidence des données dans l'UE, un tarif prépayé fixe et la pleine propriété de la machine.
Puisque votre serveur supporte l’API OpenAI Chat Completions, vous pouvez le brancher à presque tous les outils d’IA, environnements de développement (IDE) ou plateformes d’automatisation – il suffit de rediriger l’URL de base vers votre propre point d’accès et d’ajouter votre clé. Voici quelques exemples populaires :
… et bien d’autres encore — toute application, agent ou SDK compatible avec une endpoint OpenAI fonctionne directement.