Exécutez des modèles de langage ouverts (LLMs) sur votre propre serveur dédié à GPU en UE — entièrement privé, sans partage de données. Chaque modèle est évalué sur du matériel réel ; nous vous présentons ainsi la carte graphique offrant le meilleur rapport prix-rendement et sa vitesse mesurée.
| Modèle | Contexte | Parallèle t/s | Débit simple (t/s) | À l'heure | Mensuel | Configuration |
|---|---|---|---|---|---|---|
| Llama 3.3 70B Perfect on sparbox.m2 | 14,745 | 72 | 9 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 30B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 170 | 21 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 185 +9% | 24 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3.6 27B (AWQ) Perfect on infinityai.s1 | 65,536 | 103 | 14 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3.6 35B Perfect on infinityai.s1 | 95,550 | 111 | 15 | €0.59/h | €335.00/mo | infinityai.s1 |
| DeepSeek R1 0528 Qwen3 8B Perfect on infinityai.s1 | 85,995 | 592 | 75 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 31B (QAT) Perfect on infinityai.s1 | 16,384 | 146 | 19 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E2B Perfect on infinityai.s1 | 131,072 | 1,105 | 153 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E4B Perfect on infinityai.s1 | 106,167 | 684 | 93 | €0.59/h | €335.00/mo | infinityai.s1 |
| Granite 4.1 8B Perfect on infinityai.s1 | 77,395 | 530 | 69 | €0.59/h | €335.00/mo | infinityai.s1 |
| Llama 3.1 8B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 26,541 | 378 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| 106,167 +300% | 601 +59% | 84 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Phi 4 Perfect on infinityai.s1 | 16,384 | 337 | 44 | €0.59/h | €335.00/mo | infinityai.s1 |
| Phi 4 multimodal instruct Perfect on infinityai.s1 | 117,964 | 947 | 130 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 14B Perfect on infinityai.s1 | 21,497 | 605 | 79 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 3B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 19,347 | 1,221 | 165 | €0.38/h | €215.00/mo | ranger.s1 |
| 85,995 +344% | 1,605 +31% | 215 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Mistral 7B Perfect on infinityai.s1 | 32,768 | 622 | 81 | €0.59/h | €335.00/mo | infinityai.s1 |
| GPT oss 20B Perfect on infinityai.s1 | 131,072 | 701 | 196 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ornith 1.0 9B Perfect on ranger.s1 | 47,774 | 155 | 68 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 Coder 30B (AWQ) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 864 | 169 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 908 | 149 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 VL 32B (AWQ) Perfect on infinityai.s1 | 32,768 | 408 | 55 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 32B Perfect on infinityai.s1 | 32,768 | 419 | 56 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 7B Perfect on ranger.s1 | 32,768 | 393 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 14B Perfect on infinityai.s1 | 29,491 | 335 | 43 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 32B Perfect on sparbox.m2 | 21,497 | 291 | 41 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on ranger.s1 | 40,960 | 623 | 84 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 4B (2507) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 65,536 | 622 | 83 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +100% | 868 +40% | 116 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on infinityai.s1 | 40,960 | 569 | 74 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 Coder 30B (FP8) Perfect on sparbox.m2 | 32,768 | 776 | 148 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 32B (FP8) Perfect on sparbox.m2 | 13,270 | 288 | 40 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on ranger.s1 | 47,774 | 252 | 63 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3.5 9B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 21,497 | 283 | 46 | €0.38/h | €215.00/mo | ranger.s1 |
| 95,550 +344% | 388 +37% | 79 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Qwen3.6 27B (FP8) Perfect on sparbox.m2 | 32,768 | 242 | 46 | €0.73/h | €420.00/mo | sparbox.m2 |
| Gemma 4 31B (FP8) Perfect on sparbox.m2 | 8,192 | 117 | 42 | €0.73/h | €420.00/mo | sparbox.m2 |
| GLM 4.6V Flash Perfect on infinityai.s1 | 106,167 | 482 | 60 | €0.59/h | €335.00/mo | infinityai.s1 |
Contexte = fenêtre de contexte utilisable maximale. Parallèle/Simple = jetons/seconde. Les tarifs reflètent le meilleur rapport performance-prix par modèle de GPU. Les prix sont prépayés ; vous conservez un accès complet en root.
Trooper.AI vous propose un serveur GPU géré et préinstallé avec vLLM, prêt à servir n'importe quel grand modèle de langage ouvert via une API rapide compatible OpenAI. Plutôt que de passer des heures à choisir une carte graphique, installer les pilotes CUDA, compiler vLLM ou ajuster les drapeaux de lancement, il suffit de sélectionner le modèle ci-dessus puis de cliquer sur Démarrer. En quelques minutes seulement, vous obtenez un serveur dédié hébergé en UE équipé d’un GPU avec vLLM déjà exécutant la configuration optimisée pour ce modèle – incluant longueur du contexte, parallélisme et arguments de ligne de commande testés.
vLLM est le moteur d'inférence haute performance standard du secteur, mais le rendre prêt pour la production peut être fastidieux : il faut correspondre les versions des pilotes et de CUDA, choisir --max-num-batched-tokens, --max-num-seqs ainsi que la bonne fenêtre de contexte en fonction de la mémoire VRAM de votre GPU, puis valider que le modèle se charge effectivement. Notre serveur GPU géré préinstallé avec vLLM élimine cette étape. Chaque configuration sur cette page provient directement de benchmarks automatisés effectués sur du matériel réel ; ainsi, le serveur déployé se comporte exactement comme lors des tests – sans essai-erreur.
Chaque serveur fonctionne sur des GPUs en métal nu dans des centres de données allemands certifiés ISO/IEC 27001 et conformes au RGPD. Vous bénéficiez d’un accès complet en SSH root, d’une machine persistante ainsi que d’un point de terminaison privé – vos requêtes et données ne quittent jamais votre serveur. Comme il s’agit d'un serveur GPU dédié (et non partagé pour l'inférence), vous pouvez également installer un logiciel IA supplémentaire, affiner les modèles ou exécuter des modèles d'image et audio aux côtés de votre LLM.
Pour chaque modèle, nous affichons la carte graphique offrant le meilleur rapport prix/performance, avec des tarifs horaires et mensuels transparents. Vous pouvez consulter des réponses d’exemple réelles par modèle via Afficher la qualité de réponse avant déploiement, afin de connaître à la fois la vitesse et la qualité des réponses pour lesquelles vous payez. Payer à l’heure pour expérimenter ou au mois pour une utilisation en production – un serveur GPU géré préinstallé avec vLLM qui s’adapte à vos besoins.