Inferencia Privada de Modelos de Lenguaje

Ejecute modelos de lenguaje grandes abiertos en su propio servidor dedicado con GPU en la UE — completamente privado y sin compartir datos. Cada modelo se evalúa en hardware real para mostrarle la GPU con mejor relación calidad-precio y su velocidad medida.

Modelo¿Requiere autenticación o está alojado en un repositorio privado? Para modelos públicos este campo puede dejarse vacío. Puede generar un token aquí: Código https://huggingface.co/settings/tokens (el token solo se usa durante la descarga del modelo). max_tokens Define el tamaño máximo de ventana de contexto que debe soportar el servidor. Esto afecta directamente al uso de memoria VRAM. Valores típicos: Context Recommended small models 4096 medium models 8192 long context models 16384+. Nota: Valores más altos aumentan significativamente el consumo de memoria. Si su servidor se queda sin VRAM, reduzca este valor. modelname Identificador del modelo Hugging Face que vLLM debe cargar. Ejemplo: Código mistralai/Mistral-7B-Instruct-v0.2 Otros ejemplos compatibles: Qwen/Qwen2.5-14B-Instruct google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-Instruct.Paralelo t/sTokens por segundoPor horaMensualConfiguración
Llama 3.3 70B
Perfect on sparbox.m2
14,745729€0.73/h
€420.00/mo
sparbox.m2
Qwen3 30B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,49117021€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
185
+9%
24€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 27B (AWQ)
Perfect on infinityai.s1
65,53610314€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 35B
Perfect on infinityai.s1
95,55011115€0.59/h
€335.00/mo
infinityai.s1
DeepSeek R1 0528 Qwen3 8B
Perfect on infinityai.s1
85,99559275€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 31B (QAT)
Perfect on infinityai.s1
16,38414619€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E2B
Perfect on infinityai.s1
131,0721,105153€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E4B
Perfect on infinityai.s1
106,16768493€0.59/h
€335.00/mo
infinityai.s1
Granite 4.1 8B
Perfect on infinityai.s1
77,39553069€0.59/h
€335.00/mo
infinityai.s1
Llama 3.1 8B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
26,54137851€0.38/h
€215.00/mo
ranger.s1
106,167
+300%
601
+59%
84€0.73/h
€420.00/mo
sparbox.m2
Phi 4
Perfect on infinityai.s1
16,38433744€0.59/h
€335.00/mo
infinityai.s1
Phi 4 multimodal instruct
Perfect on infinityai.s1
117,964947130€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 14B
Perfect on infinityai.s1
21,49760579€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 3B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
19,3471,221165€0.38/h
€215.00/mo
ranger.s1
85,995
+344%
1,605
+31%
215€0.59/h
€335.00/mo
infinityai.s1
Mistral 7B
Perfect on infinityai.s1
32,76862281€0.59/h
€335.00/mo
infinityai.s1
GPT oss 20B
Perfect on infinityai.s1
131,072701196€0.59/h
€335.00/mo
infinityai.s1
Ornith 1.0 9B
Perfect on ranger.s1
47,77415568€0.38/h
€215.00/mo
ranger.s1
Qwen3 Coder 30B (AWQ)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,491864169€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
908149€0.59/h
€335.00/mo
infinityai.s1
Qwen3 VL 32B (AWQ)
Perfect on infinityai.s1
32,76840855€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 32B
Perfect on infinityai.s1
32,76841956€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 7B
Perfect on ranger.s1
32,76839351€0.38/h
€215.00/mo
ranger.s1
Qwen3 14B
Perfect on infinityai.s1
29,49133543€0.59/h
€335.00/mo
infinityai.s1
Qwen3 32B
Perfect on sparbox.m2
21,49729141€0.73/h
€420.00/mo
sparbox.m2
Qwen3 4B
Perfect on ranger.s1
40,96062384€0.38/h
€215.00/mo
ranger.s1
Qwen3 4B (2507)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
65,53662283€0.38/h
€215.00/mo
ranger.s1
131,072
+100%
868
+40%
116€0.59/h
€335.00/mo
infinityai.s1
Qwen3 8B
Perfect on infinityai.s1
40,96056974€0.59/h
€335.00/mo
infinityai.s1
Qwen3 Coder 30B (FP8)
Perfect on sparbox.m2
32,768776148€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 32B (FP8)
Perfect on sparbox.m2
13,27028840€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 4B
Perfect on ranger.s1
47,77425263€0.38/h
€215.00/mo
ranger.s1
Qwen3.5 9B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
21,49728346€0.38/h
€215.00/mo
ranger.s1
95,550
+344%
388
+37%
79€0.73/h
€420.00/mo
sparbox.m2
Qwen3.6 27B (FP8)
Perfect on sparbox.m2
32,76824246€0.73/h
€420.00/mo
sparbox.m2
Gemma 4 31B (FP8)
Perfect on sparbox.m2
8,19211742€0.73/h
€420.00/mo
sparbox.m2
GLM 4.6V Flash
Perfect on infinityai.s1
106,16748260€0.59/h
€335.00/mo
infinityai.s1

Contexto = ventana de contexto máxima utilizable. Paralelo/Individual = tokens/seg. Los precios reflejan la mejor relación calidad-precio por GPU según el modelo. Los precios son prepagos; mantienes acceso total de raíz.

Servidor GPU gestionado con vLLM preinstalado

Trooper.AI te proporciona un servidor de GPU gestionado preinstalado con vLLM, listo para servir cualquier modelo de lenguaje grande abierto mediante una API rápida compatible con OpenAI. En lugar de pasar horas seleccionando una GPU, instalando controladores CUDA, compilando vLLM y ajustando las banderas de lanzamiento, eliges un modelo arriba y haces clic en Iniciar. En minutos obtienes un servidor dedicado de GPU alojado en la UE con vLLM ya ejecutándose bajo la configuración exacta que hemos optimizado para ese modelo — longitud del contexto, paralelismo e argumentos de línea de comandos incluidos.

¿Por qué un servidor con vLLM preinstalado?

vLLM es el motor de inferencia de alto rendimiento estándar en la industria, pero llevarlo a producción requiere ajustes delicados: coincidir versiones del controlador y de CUDA, seleccionar --max-num-batched-tokens, --max-num-seqs y la ventana de contexto adecuada para la VRAM de tu GPU, además de verificar que el modelo se cargue correctamente. Nuestro servidor gestionado de GPU con vLLM preinstalado elimina ese trabajo. Cada configuración en esta página proviene directamente de pruebas automatizadas en hardware real, por lo que el servidor que despliegues funciona exactamente como las ejecuciones probadas — sin ensayos ni errores.

Privado, alojado en la UE y exclusivo para ti

Cada servidor ejecuta en GPUs de metal desnudo (bare-metal) ubicados en centros de datos alemanes certificados bajo la norma ISO/IEC 27001 y conformes con el GDPR. Obtienes acceso completo mediante root SSH, una máquina persistente y un punto de conexión privado — tus consultas y datos nunca abandonan tu servidor. Al ser un servidor dedicado de GPU (sin inferencia compartida), también puedes instalar software adicional de IA, ajustar modelos (fine-tune), o ejecutar modelos para imágenes y audio junto a tu modelo de lenguaje (LLM).

Precio-rendimiento transparente

Para cada modelo mostramos la GPU con el mejor precio por rendimiento, con tarifas horarias y mensuales transparentes. Puede revisar respuestas de ejemplo reales por modelo mediante Mostrar calidad de respuesta antes del despliegue, para conocer tanto la velocidad y la calidad de las respuestas que está pagando. Pague por hora para experimentar o mensualmente para producción — un servidor GPU gestionado preinstalado con vLLM que escala según sus necesidades.