Ejecuta modelos de lenguaje abiertos (LLMs) en tu propio servidor de GPU dedicado 🇪🇺 en la UE — completamente privado y sin compartir datos. Cada modelo se evalúa en hardware real, por lo que te mostramos la GPU con mejor relación precio-rendimiento y su velocidad medida.
Ya sea que ya ejecutes un servidor de GPU y quieras servir un modelo con él usando vLLM, o seas nuevo y desees adentrarte en la inferencia privada de modelos de lenguaje alojados en la UE — este servicio Private LLM de despliegue en un clic es para ti.
| Modelo | ¿Requiere autenticación o está alojado en un repositorio privado? Para modelos públicos este campo puede dejarse vacío. Puede generar un token aquí: Código https://huggingface.co/settings/tokens (el token solo se usa durante la descarga del modelo). max_tokens Define el tamaño máximo de ventana de contexto que debe soportar el servidor. Esto afecta directamente al uso de memoria VRAM. Valores típicos: Context Recommended small models 4096 medium models 8192 long context models 16384+. Nota: Valores más altos aumentan significativamente el consumo de memoria. Si su servidor se queda sin VRAM, reduzca este valor. modelname Identificador del modelo Hugging Face que vLLM debe cargar. Ejemplo: Código mistralai/Mistral-7B-Instruct-v0.2 Otros ejemplos compatibles: Qwen/Qwen2.5-14B-Instruct google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-Instruct. | Paralelo t/s | Tokens por segundo | Por hora | Mensual | Configuración |
|---|---|---|---|---|---|---|
| Llama 3.3 70B 4-bit Perfect on sparbox.m2 | 12,288 | 68 | 35 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 30B 4-bit Perfect on sparbox.m2 | 84,992 | 877 | 168 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 4-bit Perfect on sparbox.m2 | 69,632 | 396 | 66 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 35B 4-bit Perfect on sparbox.m2 | 62,464 | 747 | 143 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 4-bit Perfect on sparbox.m2 | 17,408 | 390 | 62 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 E2B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 76,800 | 914 | 133 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +52% | 1,160 +27% | 184 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Gemma 4 E4B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 30,720 | 538 | 70 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 95,232 +205% | 737 +37% | 104 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Granite 4.1 8B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 More context, higher speed on infinityai.s1 | 41,984 | 247 | 39 | €0.29/h | €155.00/mo | novatesla.s1 |
| 76,800 +80% | 556 +125% | 76 | €0.70/h | €375.00/mo | sparbox.m2 | |
| 69,632 +62% | 539 +118% | 69 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Llama 3.1 8B Perfect on sparbox.m2 | 95,232 | 621 | 86 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 Perfect on sparbox.m2 | 14,336 | 367 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Phi 4 multimodal Perfect on sparbox.m2 | 117,760 | 941 | 144 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ministral 3 14B Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 20,480 | 429 | 56 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +300% | 623 +45% | 89 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Ministral 3 3B Perfect on sparbox.sm1 | 84,992 | 1,218 | 164 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Mistral 7B Perfect on sparbox.sm1 | 28,672 | 399 | 53 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Llama 3.1 8B 8-bit Perfect on ranger.s1.de More context, higher speed on infinityai.s1 | 20,480 | 69 | 62 | €0.49/h | €260.00/mo | ranger.s1.de |
| 117,760 +449% | 889 +1197% | 115 | €0.62/h | €330.00/mo | infinityai.s1 | |
| GPT OSS 20B Perfect on sparbox.m2 | 117,760 | 739 | 223 | €0.70/h | €375.00/mo | sparbox.m2 |
| Ornith 1.0 9B 4-bit Perfect on ranger.s1.de | 52,224 | 78 | 59 | €0.49/h | €260.00/mo | ranger.s1.de |
| Qwen3 Coder 30B 4-bit Perfect on sparbox.sm1 More context, higher speed on sparbox.m2 | 25,600 | 886 | 170 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 84,992 +224% | 949 +7% | 167 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3 VL 32B 4-bit Perfect on sparbox.m2 | 37,888 | 429 | 63 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 32B 4-bit Perfect on sparbox.m2 | 28,672 | 438 | 64 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen2.5 7B Perfect on sparbox.sm1 | 28,672 | 400 | 51 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 14B Perfect on sparbox.m2 | 36,864 | 364 | 50 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 32B 8-bit Perfect on sparbox.m2 | 18,432 | 297 | 42 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on sparbox.sm1 | 36,864 | 627 | 85 | €0.38/h | €205.00/mo | sparbox.sm1 |
| Qwen3 4B (2507) Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 58,368 | 626 | 84 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 117,760 +100% | 918 +47% | 119 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on sparbox.sm1 More context, higher speed on infinityai.s1 | 23,552 | 379 | 49 | €0.38/h | €205.00/mo | sparbox.sm1 |
| 36,864 +54% | 590 +56% | 75 | €0.62/h | €330.00/mo | infinityai.s1 | |
| Qwen3 Coder 30B 8-bit Perfect on sparbox.m2 | 41,984 | 812 | 153 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 32B 8-bit Perfect on sparbox.m2 | 15,360 | 294 | 41 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on novatesla.s1 More context, higher speed on sparbox.m2 | 69,632 | 436 | 68 | €0.29/h | €155.00/mo | novatesla.s1 |
| 117,760 +69% | 874 +101% | 119 | €0.70/h | €375.00/mo | sparbox.m2 | |
| Qwen3.5 9B Perfect on sparbox.m2 | 95,232 | 558 | 82 | €0.70/h | €375.00/mo | sparbox.m2 |
| Qwen3.6 27B 8-bit Perfect on sparbox.m2 | 28,672 | 164 | 47 | €0.70/h | €375.00/mo | sparbox.m2 |
| Gemma 4 31B 8-bit Perfect on sparbox.m2 | 8,192 | 286 | 43 | €0.70/h | €375.00/mo | sparbox.m2 |
Contexto = ventana de contexto máxima utilizable. Paralelo/Individual = tokens/seg. Los precios reflejan la mejor relación calidad-precio por GPU según el modelo. Los precios son prepagos; mantienes acceso total de raíz.
No es necesario que elijas un modelo aquí — ordena un servidor de GPU sin configuración y ejecuta lo que desees en él, con acceso total como root.
Ordenar un servidor con GPUSegundos después de hacer clic en Iniciar, tu modelo privado está activo detrás de un punto final compatible con OpenAI — monitorea el rendimiento, uso del contexto y solicitudes desde tu propio tablero.
Trooper.AI te proporciona un servidor de GPU gestionado preinstalado con vLLM, listo para servir cualquier modelo de lenguaje grande abierto mediante una API rápida compatible con OpenAI. En lugar de pasar horas seleccionando una GPU, instalando controladores CUDA, compilando vLLM y ajustando las banderas de lanzamiento, eliges un modelo arriba y haces clic en Iniciar. En minutos obtienes un servidor dedicado de GPU alojado en la UE con vLLM ya ejecutándose bajo la configuración exacta que hemos optimizado para ese modelo — longitud del contexto, paralelismo e argumentos de línea de comandos incluidos.
vLLM es el motor de inferencia de alto rendimiento estándar en la industria, pero llevarlo a producción requiere ajustes delicados: coincidir versiones del controlador y de CUDA, seleccionar --max-num-batched-tokens, --max-num-seqs y la ventana de contexto adecuada para la VRAM de tu GPU, además de verificar que el modelo se cargue correctamente. Nuestro servidor gestionado de GPU con vLLM preinstalado elimina ese trabajo. Cada configuración en esta página proviene directamente de pruebas automatizadas en hardware real, por lo que el servidor que despliegues funciona exactamente como las ejecuciones probadas — sin ensayos ni errores.
Cada servidor ejecuta en GPUs de metal desnudo (bare-metal) ubicados en centros de datos alemanes certificados bajo la norma ISO/IEC 27001 y conformes con el GDPR. Obtienes acceso completo mediante root SSH, una máquina persistente y un punto de conexión privado — tus consultas y datos nunca abandonan tu servidor. Al ser un servidor dedicado de GPU (sin inferencia compartida), también puedes instalar software adicional de IA, ajustar modelos (fine-tune), o ejecutar modelos para imágenes y audio junto a tu modelo de lenguaje (LLM).
Para cada modelo mostramos la GPU con el mejor precio por rendimiento, con tarifas horarias y mensuales transparentes. Puede revisar respuestas de ejemplo reales por modelo mediante Mostrar calidad de respuesta antes del despliegue, para conocer tanto la velocidad y la calidad de las respuestas que está pagando. Pague por hora para experimentar o mensualmente para producción — un servidor GPU gestionado preinstalado con vLLM que escala según sus necesidades.
Un servidor privado de GPU dedicado para modelos de lenguaje grandes (private LLM GPU server) le da acceso completo al equipo: acceso total como root, un punto de extremo compatible con OpenAI, solicitudes ilimitadas a una tarifa plana prepagada y la libertad de ajustar finamente (fine-tune), intercambiar modelos o ejecutar cargas de trabajo de imágenes y audio junto con su modelo de lenguaje. Al ser suyo el GPU, el rendimiento (throughput) y la longitud del contexto son predecibles, y sus consultas nunca abandonan su servidor — ideal para tráfico constante y requisitos estrictos de privacidad.
Selecciona un modelo de la matriz superior y haz clic en Start: en minutos tendrás un servidor GPU alojado en la UE con vLLM ya ejecutando la configuración benchmarkada exacta — longitud del contexto, paralelismo y banderas de inicio incluidas. Paga por hora para experimentar o mensualmente para producción, y actualiza a una GPU más grande cuando lo necesites para manejar mayor contexto o modelos sin necesidad de reinstalar.
Detrás de cada servidor privado de GPU para modelos de lenguaje está un hardware empresarial reciclado y optimizado, mantenido por nuestro propio equipo. Aquí, Markus y Jamie están instalando un clúster de NVIDIA A100 en uno de nuestros centros de datos en alojamiento compartido certificados bajo la norma ISO/IEC 27001 en Alemania —el mismo tipo de servidores GPU que despliegas desde esta página—. Reciclamos componentes de alto rendimiento transformándolos en equipos especializados para inferencia, prolongando así el ciclo de vida del hardware mientras reducimos los residuos electrónicos (e-waste). No revendemos capacidad ajena; poseemos y operamos nuestra propia infraestructura en centros de datos en alojamiento compartido ubicados en Alemania y Países Bajos, lo que nos permite garantizar rendimiento, seguridad y residencia de datos en todas las capas del stack.
Tu servidor privado vLLM expone un punto de extremo que es 100 % compatible con el formato de la API OpenAI Chat Completions (/v1/chat/completions). Si tu aplicación ya utiliza el SDK de OpenAI — en Python, Node.js o cualquier cliente HTTP —, apuntarlo a tu propio servidor es un cambio de una sola línea: actualiza la URL base y la clave API. Obtienes el mismo esquema de solicitud y respuesta, con soporte completo para transmisión (streaming), modo JSON, llamadas a funciones y entradas multimodales. Sin reescritura del código, sin nuevas abstracciones ni bloqueo por proveedor; así mantienes tu integración portátil y conservas el control.
¿Buscando una alternativa al API de OpenAI alojada en Europa? Un servidor privado con GPU para modelos de lenguaje te ofrece funcionalidad equivalente del Chat Completions API con residencia de datos en la UE, precio prepago fijo y propiedad total de la máquina.
Porque tu servidor es compatible con la API de Chat Completions de OpenAI, puedes integrarlo en casi cualquier herramienta de IA, entorno de desarrollo (IDE) o plataforma de automatización; solo apunta la URL base a tu propio punto final y agrega tu clave. Algunos ejemplos populares:
… y muchos más — cualquier aplicación, agente o SDK que admita un punto de extremo compatible con OpenAI funciona sin necesidad de configuración adicional.