Ryzen max+ 395/495 (p. ej. AMD Halo Developer Platform) vs NVIDIA DGX Spark vs RTX-PRO-Workstations
*Requisito: TOP PC de escritorio para LLMs grandes (70b+), sistemas multiagente y equipo de trabajo por unos 3000-5000 euros.
Quien compra barato, compra dos veces. Es un viejo refrán, y en esta gama de precios, prefiero no experimentarlo.
Por eso he analizado en detalle qué significa gastar los ahorros en un mini PC que cuesta lo mismo que un buen coche de segunda mano, en lugar de invertir en un servidor de IA que tendría el precio de un Dacia Duster nuevo.
En este artículo dejo fuera todos los “mini PCs baratos”, que quizá tienen su razón de ser en otros contextos, y me concentro únicamente en la capa superior.
Te explico qué tener en cuenta en un servidor de IA y por qué los TOPS y FLOPS a veces no importan nada, solo son marketing.
Todos los mini PCs recomendados también están listados en nuestra tienda AmazonSi no tienes claro cuáles son los diferentes tipos de procesadores (CPU, GPU, TPU, NPU), lee nuestro artículo CPU, GPU, TPU y NPU: Por qué la GPU es tan importante para IA.
Estoy planeando la compra de un servidor IA/homeserver estable que pueda escalar, que ejecute modelos de IA grandes sin problemas y que sea asequible para mí.
Actualmente uno acaba rápidamente en el Ryzen AI Max+ 395 / Ryzen AI Max+ 495 para uso de escritorio, o en los modelos NVIDIA DGX Spark.
Si como yo quieres ejecutar localmente agentes de código, pipelines RAG o simplemente un modelo LLM privado de 70B+, sin recibir una factura de nube cada mes, merece la pena echar un vistazo a esta nueva clase de dispositivos. Pronto llegará el modelo Ryzen AI Max+ 495, pero solo con cambios menores (ver abajo).
El mercado de hardware de IA local se ha movido en 2026: mini PCs Ryzen-AI-Max, NVIDIA DGX Spark, PCs de escritorio clásicos con GPU dedicada e incluso primeras variantes de servidor (Hetzner GEX44) compiten por el mismo público objetivo: desarrolladores/empresas que quieren ejecutar modelos de 70B parámetros y múltiples agentes de IA simultáneamente en casa u oficina. Los precios varían mucho, y las cifras de marketing como los TOPS son a menudo engañosos. Por eso lo repaso sistemáticamente, con criterios de compra concretos, dispositivos y mi recomendación personal al final.
Por qué tiene sentido el hardware de IA local en 2026
Actualmente trabajo como desarrollador de aplicaciones para despachos y estoy programando numerosas aplicaciones de IA e APIs para diversos proveedores compatibles con RGPD. Desafortunadamente, me encuentro constantemente con diseños de API poco elegantes. Por ejemplo, límites bajos de tokens, sin historial de conversación, APIs detrás de sistemas Cloudflare que imponen límites adicionales.
Cuando 50 empleados usan la IA simultáneamente, uno acaba invertiendo tiempo en logging, análisis y debugging. No porque haya errores reales, sino porque tienes que tener en cuenta el diseño de la API. Si conoces nuestro programa de aprendizaje sobre APIs: REST, GraphQL, gRPC, Seguridad y Documentación — IRC-Coding, sabes cómo adaptar las solicitudes de API al límite:
Ver también:
- Implementación de Rate Limiting
- Rate Limiting y Throttling para APIs
El deseo de tener tu propia IA, sin límites de tokens, sin límites de consultas a API, es enorme. Y los costos pueden amortizarse en pocos meses.
Antes de hablar de hardware, un poco sobre la motivación, por si aún estás indeciso. Quien usa regularmente agentes de código o sistemas multiagente paga rápidamente tres dígitos al mes con proveedores cloud. Un mini PC de IA local con suficiente Unified Memory a menudo se amortiza en un año de uso intenso. Se suman privacidad de datos y soberanía, especialmente si trabajas profesionalmente con código fuente o datos de clientes sensibles. Entonces la inferencia local es a menudo la única opción práctica, independientemente del coste.
Los criterios de compra: Qué importa realmente en un mini PC para LLMs locales
He dividido la evaluación en varias categorías. El orden refleja aproximadamente la relevancia para el caso de uso: uso multiagente y operación 24/7.
Si no te importan las explicaciones de evaluación, puedes ir directo a la tabla comparativa
He incluido deliberadamente hardware que estaba ligeramente fuera de los límites financieros, para que puedas hacer una comparación adecuada y tomar la “decisión correcta”.
1. El ancho de banda de memoria supera a los TOPS
El punto más importante y más incomprendido primero. Durante la generación de tokens de un LLM, prácticamente todo el modelo se lee una vez de la memoria para cada token individual. La velocidad en tokens por segundo depende principalmente del ancho de banda de memoria, no de la potencia de cálculo teórica. Los valores de NPU-TOPS promocionados, por ejemplo “126 TOPS”, son prácticamente irrelevantes para la inferencia de LLM, ya que Ollama, llama.cpp y LM Studio ejecutan los modelos a través de la GPU, no de la NPU. Mi primer consejo: nunca compres un mini PC de IA solo por la cifra de TOPS en la caja.
El Ryzen AI Max+ 395, nombre en clave Strix Halo, alcanza alrededor de 256 GB/s de ancho de banda de memoria a través de LPDDR5X de cuatro canales. Este es el cuello de botella central que debes tener en mente en cada comparación.
Explicación:
En LLMs autorregresivos, prácticamente todo el modelo se lee de la memoria para cada token generado, por lo que el ancho de banda de memoria (GB/s) a menudo determina los tokens/s, no la cifra de NPU-TOPS promocionada en la caja. TOPS mide solo la capacidad de cálculo bruta; si los datos no se entregan del RAM/VRAM lo suficientemente rápido o el modelo no cabe en la memoria caché rápida en el chip, las unidades de cálculo quedan ociosas. Por eso, tokens/s reales medidos con modelos/cuantificaciones concretos (p. ej. Llama-2-7B, 4-bit) y el ancho de banda mantenido son criterios de compra más significativos que valores TOPS puros.
Ancho de banda mantenido es la velocidad de transferencia de datos realmente alcanzable de forma constante durante períodos más largos entre memoria y procesador (p. ej. RAM ↔ GPU/SoC), no solo el valor máximo a corto plazo. Refleja condiciones reales con calor, overhead del controlador de memoria, accesos paralelos y comportamiento de caché, es decir, cuántos GB/s puede entregar el sistema de manera sostenida sin limitación térmica u otros cuellos de botella. Para inferencia de LLM, el ancho de banda mantenido es más relevante que el de pico, porque la generación de tokens requiere ancho de banda consistente durante muchas iteraciones sucesivas.
TOPS: Mi afirmación de “prácticamente irrelevantes” suena dura, pero hay escenarios donde la cantidad de TOPS juega un papel:
Los TOPS son importantes cuando los núcleos de cálculo se pueden mantener continuamente abastecidos de datos y la aplicación requiere muchas operaciones simples y masivamente paralelas. Específicamente se aplica a:
- Operaciones de matriz y vector a gran escala: En cargas de trabajo de entrenamiento o inferencia donde el modelo encaja completamente en la memoria caché rápida del chip, los TOPS determinan la potencia de cálculo máxima.
- Modelos en alta precisión: Los cálculos FP32/FP16 se benefician más de alta potencia de cálculo, porque cada elemento requiere más operaciones y el volumen de datos por elemento es mayor.
- Algoritmos con alto rendimiento pero no limitados por memoria: Si los datos se pueden mantener en caché/SRAM de antemano y las unidades de cálculo realizan muchas operaciones por byte cargado, el rendimiento se escala con TOPS.
- Procesamiento de señales, ML de imágenes y video: Aplicaciones en tiempo real como inferencia de imágenes de alta resolución o redes neuronales complejas que se ejecutan en núcleos de tensor especializados usan TOPS directamente.
- NPUs/ASICs dedicados con buena arquitectura de memoria e interconexión: Cuando el hardware ofrece alta capacidad de memoria en chip, pipelines de streaming eficientes y baja latencia entre memoria y cálculo, los TOPS tienen mayor impacto.
En resumen: los TOPS son útiles cuando la arquitectura asegura el abastecimiento de datos y la carga de trabajo realiza muchas operaciones de cálculo por byte de datos. En escenarios de inferencia de LLM limitados por memoria, sin embargo, los GB/s dominan.
2. Tamaño de RAM, configuración para modelos de 70B y entornos multi-agente
En los dispositivos Strix Halo, la memoria RAM está soldada permanentemente y no se puede ampliar posteriormente; la capacidad debe decidirse en el momento de la compra. Para una configuración con un modelo de 70B más varios agentes de codificación en paralelo, no hay forma de evitar 128 GB, así que ni siquiera considero modelos con menos de 128 GB. Los requisitos:
- Un modelo MoE potente (Mixture of Experts) como Qwen3-Coder-Next como agente principal necesita alrededor de 45 GB en cuantización Q4
- Un modelo de razonamiento para depuración, por ejemplo DeepSeek-R1 32B, consume unos 18 GB
- Varios modelos pequeños para tareas individuales en paralelo, como Qwen3 8B, aproximadamente 5 GB cada uno
- Buffer para la caché KV con múltiples conversaciones simultáneas
64 GB de RAM es suficiente de forma cómoda para un modelo único de 30B, pero se queda corto rápidamente en configuraciones multi-agente reales con varios modelos cargados en paralelo.
Cuando analizamos los datos, también queda claro que una tarjeta gráfica de 7000 euros por sí sola no puede manejar estos modelos. La mayoría de tarjetas gráficas NVIDIA tienen quizás 32 GB de VRAM. No es suficiente y el presupuesto ya se ha agotado. Un mini PC puede hacerlo. La idea es que con modelos pequeños la tarjeta gráfica NVIDIA tiene ventaja porque procesa MÁS TOKENS por minuto, pero con modelos grandes cero tokens, porque no puede cargarlos directamente o completamente.
Explicación:
- Un modelo MoE (Mixture of Experts) es una red neuronal que contiene muchas subredes especializadas (Experts), pero para cada entrada solo activa una pequeña selección de estos Experts. De este modo, el modelo completo sigue siendo muy grande (mucha capacidad), mientras que el esfuerzo computacional y la demanda de memoria por predicción siguen siendo bajos, porque solo se ejecutan algunos Experts por token.
3. Refrigeración y carga sostenida, aptitud para 24/7
Importante si el dispositivo debe funcionar continuamente como en mi caso: no te fijes en la potencia máxima de las hojas de especificaciones, sino en la cifra de potencia sostenida. Los dispositivos orientados al consumidor pueden reducir el rendimiento de forma audible bajo carga continua desde el punto de vista térmico, mientras que los dispositivos de clase estación de trabajo incorporan más masa de disipador y control de ventiladores más estable. Una fuente de alimentación integrada adecuadamente dimensionada, por ejemplo 320 W en lugar de una externa ajustada al mínimo, también es una buena señal de diseño térmico bien pensado.
4. Red y capacidad de clustering
Para configuraciones multi-agente en la red local o para futuros expansiones de cluster son relevantes dos cosas:
- 10GbE en lugar de 2.5 GbE si varios servicios o contenedores deben servirse a través de la red
- USB4 v2 con 80 Gbps para acoplamiento directo de dos dispositivos en un cluster
Algunos fabricantes como Minisforum promocionan explícitamente la capacidad de clustering de su serie MS-S1-Max con cifras verificables, más detalles en seguida. En la mayoría de mini PCs de consumidor, en cambio, “cluster” es puro marketing sin validación real.
5. Ecosistema de software, ROCm versus CUDA
Un aspecto que a menudo se pasa por alto en los asesoramientos de compra: el soporte de ROCm de AMD para la arquitectura GPU Strix Halo, internamente llamada gfx1151, es aún relativamente nuevo. La situación de controladores mejoró significativamente en 2026, pero el ecosistema CUDA de NVIDIA sigue siendo más maduro y ampliamente compatible. Si trabajas mucho con PyTorch, fine-tuning o kernels CUDA especializados, debes considerarlo.
6. Expandibilidad, marca y soporte
Un slot PCIe x16, no presente en todos los dispositivos, permite ampliaciones posteriores, como instalar una tarjeta de red adicional. Con marcas sin nombre sin historial en mantenimiento de firmware, sería cauteloso en un dispositivo de productividad 24/7, el riesgo de fallo en operación continua supera rápidamente los ahorros frente a una marca establecida.
Un punto de expandibilidad a menudo pasado por alto: un puerto OCuLink existente, o uno retrofiteado mediante adaptador M.2, permite conectar posteriormente una tarjeta gráfica NVIDIA externa como complemento. Más detalles en seguida en la sección dedicada al enfoque híbrido.
MoE supera a Dense: la conclusión más importante para la selección de modelos en Strix Halo
Porque el ancho de banda de memoria es el cuello de botella, los modelos Mixture of Experts con pocos parámetros activos por token se ejecutan en hardware Strix Halo desproporcionadamente más rápido que modelos densos de tamaño total comparable. En la práctica en un dispositivo de 128 GB significa:
| Rol | Recomendación | Requisito de RAM (Q4) |
|---|---|---|
| Agente de codificación principal | Qwen3-Coder-Next (MoE) | aprox. 45 GB |
| Razonamiento/Depuración | DeepSeek-R1 32B Distill | aprox. 18 GB |
| Tareas individuales rápidas | Qwen3 8B | aprox. 5 GB por instancia |
| Alternativa Dense, si se desea | Llama 3.3 70B | aprox. 40 GB, pero notablemente más lento |
Consejo práctico: en lugar de cargar cinco a siete modelos diferentes en paralelo, es más eficiente en memoria utilizar un modelo a través de un servidor con procesamiento de solicitudes paralelas, como llama.cpp-server, vLLM u Ollama con múltiples slots, para varias sesiones de agentes simultáneas. Un segundo modelo solo vale la pena si realmente se necesita una calidad de modelo diferente, por ejemplo para tareas intensivas en razonamiento.
Pero incluso con equipos de agentes de IA, vale la pena enfocarse en la máxima cantidad de vRAM y memoria compartida. Es posible que en paralelo quieras ejecutar un equipo de desarrollo: Por ejemplo:
- Modelo de codificación
- Modelo de lenguaje general
- Modelo de embedding
- Reranker
- Modelo de visión. En un caso importante no querrás usar un modelo extremadamente pequeño solo porque no hay más memoria disponible.
Mini PCs Ryzen AI Max+ 395 en comparación (clase 128 GB)
Aquí la selección concreta, evaluada según los criterios anteriores. Casi todos los dispositivos utilizan el mismo chip, Ryzen AI Max+ 395 con Radeon 8060S, las diferencias están en refrigeración, red, capacidad de clustering y soporte de marca. Para la comparación, también se incluyen NVIDIA DGX Spark, AMD Halo Developer Platform y un Apple Mac mini M4 Pro en la lista.
Todos los mini PCs y servidores de IA recomendados también están listados en nuestra tienda de Amazon (enlace de afiliado)
| Dispositivo | RAM/SSD | Red | Cluster | Evaluación |
|---|---|---|---|---|
| Minisforum MS-S1 Max | 64GB/2TB | 2x 10GbE, USB4 v2 con 80 Gbps | Sí, probado por fabricante, cluster de 2 nodos para modelos de 235B, 4 nodos para DeepSeek-R1 671B | Mejor opción de clustering, slot PCIe x16, fuente de 320 W diseñada para carga continua, formato rackeable 2U. En 128 GB la clara recomendación si está disponible |
| GMKtec EVO-X2 (128GB) | 128GB/2TB | 2.5GbE, USB4 | No, solo USB4 estándar | La más distribuida, experiencia sólida en comunidad, pero audible bajo carga continua y más cálida que clase estación de trabajo |
| GMKtec EVO-X3 (128GB), enlace de Amazon próximamente | 128GB/2TB hasta 4TB | 2.5GbE, USB4, OCuLink con PCIe 4.0 x4 | No, pero OCuLink permite conexión eGPU | Sucesor del EVO-X2 con puerto OCuLink nativo para GPUs externas, tres perfiles de potencia (54W, 85W, 120W, pico 140W) con refrigeración dual-fan, desde 3.600 USD (2 TB) o 3.849 USD (4 TB), lanzamiento 6 de julio de 2026, aún sin amplia experiencia práctica |
| HP Workstation Z2 G1a Mini | 128GB/2TB | 1GbE más 2.5GbE, sin 10GbE | No | Calidad empresarial, buen concepto de refrigeración y seguridad de garantía, pero red insuficiente para escenario de clustering, precio relativamente alto |
| Corsair AI Workstation 300 | 128GB/4TB | 2.5GbE, placa base idéntica a EVO-X2 | No | Buena construcción, pero sin ventaja técnica sobre GMKtec para este escenario de uso |
| Thdeukoty Ryzen AI Max+ 395 | 128GB/2TB | 10GbE indicado | incierto | Marca sin nombre sin reportes de pruebas verificables, en operación continua 24/7 un riesgo que personalmente no asumiría |
| NVIDIA DGX Spark (No es Ryzen) | 128GB Unified Memory | ConnectX-7, acoplamiento de cluster | Sí, hasta dos dispositivos combinados en 256 GB | Ecosistema CUDA maduro, soporte nativo NVFP4, precio alto, arquitectura ARM limita software de escritorio. Buena alternativa si el soporte de software es más importante que la compatibilidad x86 |
| Apple Mac mini M4 Pro (No es Ryzen) | máx. 24GB | Estándar | No | Para modelos de 70B y operación multi-agente no es relevante debido a la baja capacidad de RAM |
La alternativa técnica al Ryzen AI Max+ 395 / 495: NVIDIA DGX Spark (GB10 Grace Blackwell)
El NVIDIA DGX Spark es la opción natural frente a los mini-PCs Strix Halo (AMD Halo Developer Platform), porque también ofrece 128 GB de Unified Memory en un factor de forma desktop, solo que equipado con el superchip GB10, una CPU Grace con 20 núcleos ARM más GPU Blackwell, en lugar de x86.
Especificaciones técnicas del NVIDIA DGX Spark: 128 GB LPDDR5X Unified Memory, aproximadamente 273 GB/s de ancho de banda de memoria, prácticamente el mismo rango que Strix Halo y no significativamente más rápido, hasta 1 PetaFLOP de rendimiento en FP4 con sparsity, conectividad ConnectX-7 para acoplar dos dispositivos en 256 GB de memoria combinada para modelos de hasta 405 mil millones de parámetros, DGX OS basado en Ubuntu.
El DGX Spark tiene un precio a partir de aproximadamente 4.700 euros.
Ventajas respecto a Strix Halo: El ecosistema CUDA es considerablemente más maduro que ROCm, hay soporte nativo NVFP4 para inferencia de 4 bits, acoplamiento oficial de clúster mediante red de alta velocidad en lugar de un puente USB4 improvisado, y mantenimiento de software profesional por parte de NVIDIA.
Desventajas: El ancho de banda de memoria es apenas superior al de Strix Halo a pesar de los impresionantes números de PetaFLOP, por lo que un modelo denso de 70B tampoco es una maravilla de velocidad en el DGX Spark, ya que la velocidad de decodificación está limitada por ancho de banda, no por poder computacional. La arquitectura ARM también implica limitaciones con software de escritorio clásico; para uso mixto de escritorio y trabajo con IA, un mini-PC x86 es más práctico. Además, el precio del DGX Spark es significativamente superior a la mayoría de alternativas Strix Halo con especificaciones de RAM comparables.
NVIDIA DGX Spark:
Si quieres mantener explícitamente el ecosistema NVIDIA o trabajar con NVIDIA NIM y Blueprints, obtienes aquí un paquete de software maduro. Para “uso de escritorio más agentes de IA locales” como en nuestro escenario inicial, a menudo un mini-PC x86 Strix Halo resulta la opción más pragmática en la práctica.
La tercera opción: PC de escritorio con tarjeta gráfica NVIDIA dedicada
La alternativa clásica sigue siendo un PC de escritorio con tarjeta gráfica RTX. Aquí la capacidad de VRAM de la GPU es el factor decisivo, porque a diferencia de los sistemas con Unified Memory, la VRAM es un límite duro:
- RTX 5090, 32 GB GDDR7, aproximadamente 1.792 GB/s de ancho de banda: Significativamente más rápida que Strix Halo en todo lo que cabe en 32 GB. Un modelo de 70B en Q4 ya necesita alrededor de 35 a 40 GB, superando así la capacidad. Para modelos de hasta aproximadamente 30B, la RTX 5090 es la opción más rápida; para 70B necesitarás cuantización agresiva con pérdida de calidad u otra solución.
- RTX PRO 6000 Blackwell, 96 GB GDDR7 con ECC, mismo ancho de banda que la 5090: Aquí cabe un modelo de 70B en Q4 con más de 50 GB de margen para contexto y múltiples usuarios simultáneos. La memoria ECC además protege contra errores silenciosos de memoria en operación continua durante muchas horas. Una estación de trabajo completa con esta tarjeta típicamente cuesta entre 20.000 y más de 30.000 dólares estadounidenses para configuraciones de dos tarjetas, una categoría completamente diferente a los mini-PCs.
El compromiso decisivo: un desktop con GPU dedicada es notablemente más rápido que cualquier sistema Unified Memory cuando los modelos caben completamente en VRAM, porque GDDR7 ofrece un ancho de banda significativamente superior a LPDDR5X. El precio es una limitación dura en el tamaño del modelo para la RTX 5090 o un presupuesto enormemente mayor para la RTX PRO 6000. Para agentes de código con necesidades de modelo moderadas de hasta aproximadamente 30B, donde la velocidad bruta importa, un desktop con RTX 5090 es una alternativa seria al mini-PC. Para modelos de 70B dentro del presupuesto de dispositivos Strix Halo, Unified Memory sigue siendo el camino más pragmático.
Consejo: Los dispositivos Strix Halo también pueden recibir una tarjeta gráfica y beneficiarse de ambos lados.
La variante servidor: sistemas en rack con Ryzen AI Max+ 395
Si realmente planeas para múltiples usuarios o un equipo más grande, eventualmente surge la pregunta por una solución de rack adecuada. Aquí vale la pena una breve evaluación, porque el mercado aún es escaso.
El Ryzen AI Max+ 395 es actualmente algo inusual, porque es realmente una APU de estación de trabajo, no un chip servidor clásico. AMD lo posiciona como una estación de trabajo de IA compacta con hasta 128 GB de Unified Memory (perspectivamente hasta 192 GB en el PRO 495).
He examinado brevemente el ASRock Rack, ya que me lo encontré durante mi investigación. Lo que muchos probablemente han visto de ASRock Rack es la ASRock Industrial AI BOX-A395. Sin embargo, no es un servidor de rack 19 pulgadas clásico, sino una estación de trabajo compacta de factor de forma pequeño en carcasa de aluminio con dimensiones 200 x 100 x 232 mm, pensada para uso empresarial y edge. Equipamiento: el mismo Ryzen AI Max+ 395, hasta 128 GB LPDDR5X, 10GbE más 2.5GbE, dos puertos USB4, TPM 2.0 y BIOS redundante para mayor seguridad operativa. Para un rack de servidor en sentido clásico, el dispositivo no está construido; es mejor entenderlo como una variante de escritorio particularmente robusta y apta para empresas.
Una razón real para esto: el Ryzen AI Max+ 395 es un System-on-Chip soldado, no un procesador de socket. Las placas madre servidoras clásicas de ASRock Rack para AM5 (con AMD EPYC 4004/4005 o Ryzen 7000/8000/9000) están construidas para CPUs de socket. Strix Halo simplemente no cabe, porque no existe una versión de socket del chip. Por eso probablemente pasará un tiempo antes de que un fabricante de servidores establecido como ASRock Rack ofrezca una placa base 1U o 2U real específicamente para este chip.
La única opción que conozco realmente pensada para montaje en rack 19 pulgadas es el mencionado Minisforum MS-1 Max. El fabricante publicita explícitamente el dispositivo con cuatro modos operacionales conmutables, incluyendo un modo “Rack” propio, una bandeja de carcasa extraíble para mantenimiento y un conector para control compartido de encendido y apagado de múltiples unidades en una configuración de clúster. Para quienes realmente quieran operar múltiples unidades Ryzen AI Max en un rack, esta es actualmente la solución más práctica, sin necesidad de recurrir a servidores EPYC o Xeon clásicos con consumo de energía y precio significativamente mayores.
PERO sin ser una verdadera alternativa de servidor: Para una verdadera alternativa de servidor, yo miraría en estas direcciones:
Excurso: plataformas alternativas de servidores de IA para interesados
Si quieres alquilar servidores de IA dedicados, encontrarás más detalles en Alquilar servidores de IA: análisis de costo-beneficio.
Variante 1: Servidores NVIDIA con mucha VRAM Ejemplos:
NVIDIA RTX 6000 Ada
- 48 GB VRAM
- ECC
- CUDA
- muy buena compatibilidad con IA
NVIDIA L40S
- 48 GB VRAM
- Tarjeta servidor
- muy eficiente
- optimizada para inferencia
NVIDIA H100/H200
- 80 GB / 141 GB HBM
- Clase empresarial
- muy caro
La ventaja:
El software es excelente.
La desventaja:
Si quieres llegar a 128 GB o 192 GB de memoria, necesitarás varias tarjetas.
Ejemplo:
Server RTX 6000 Ada 48 GB + RTX 6000 Ada 48 GB = 96 GB VRAM
Variante 2: AMD Instinct Server
Este sería el contrapunto directo de AMD.
Por ejemplo:
AMD Instinct MI300X
- 192 GB HBM3
- ancho de banda extremadamente alto
- desarrollado para grandes modelos de IA
Técnicamente se ajusta mejor a la idea:
“Quiero mantener modelos grandes localmente en memoria.”
Pero:
- Hardware de servidor
- alto consumo de energía
- significativamente más caro
- no está diseñado como escritorio
Variante 3: Threadripper Pro + GPU
Probablemente sea la alternativa de workstation más interesante.
Ejemplo:
AMD Threadripper Pro
+
<AdSlot position="article-middle" />
256 GB o 512 GB RAM
+
NVIDIA GPU
Por ejemplo:
- Threadripper Pro 7975WX
- Threadripper Pro 7995WX
Ventajas:
- muchos núcleos de CPU
- RAM ECC
- muchas PCIe-Lanes
- múltiples GPUs posibles
Arquitectura:
Workstation
Threadripper Pro
|
+-- RTX 6000 Ada
|
+-- RTX 6000 Ada
|
+-- NVMe Speicher
Esto sería una verdadera “workstation de servidor de IA”.
Variante 4: Apple Mac Studio para comparar
Interesante porque sigue el mismo concepto:
Unified Memory
Ejemplo:
Apple M3/M4 Ultra:
- hasta 512 GB Unified Memory
Ventaja:
- modelos muy grandes posibles
- extremadamente eficiente
Desventaja:
- ecosistema de software de IA limitado
- menos flexible que Linux
Como ves, un servidor no es una alternativa real en este rango de precio.
Un análisis detallado de costo-beneficio lo encontrarás en KI-Server mieten: lohnt sich ein dedizierter AI-Server?.
¿Quieres instalar una tarjeta gráfica RTX en una mini-PC con Ryzen AI Max y te preguntas si así combinas lo mejor de ambos mundos? Sí, pero veamos qué significa realmente OCuLink…
El enfoque híbrido OCuLink en detalle: qué significa realmente la conexión 4x
Los mini-PC de IA más potentes pueden, como se mencionó arriba, también incorporar una tarjeta gráfica NVIDIA para proporcionar suficiente VRAM y potencia GPU a través de la GPU.
Como esto genera confusión constantemente, aquí hay una explicación más detallada sobre qué hay detrás del conector OCuLink y dónde está la limitación real.
OCuLink es, en esencia, nada más que un cable que lleva una conexión PCIe hacia el exterior. En la mayoría de mini-PC Strix-Halo, ya sea integrados nativamente o equipados posteriormente a través de un cable adaptador M.2-a-OCuLink, hay cuatro PCIe 4.0-Lanes disponibles, es decir “x4”. Una tarjeta gráfica de escritorio típica en una PC utiliza normalmente 16 lanes, es decir “x16”. Esto significa que el puerto OCuLink solo recibe una cuarta parte del ancho de banda PCIe realmente disponible, aproximadamente 8 GB/s en ambas direcciones con PCIe 4.0 x4, en comparación con alrededor de 32 GB/s con una conexión x16 completa.
Si eso representa un cuello de botella real depende del tipo de carga de trabajo, y aquí es donde suele haber confusión: ¿eres jugador o desarrollador de IA?
Durante el entrenamiento o fine-tuning, es realmente un problema notable. Allí los gradientes y activaciones deben enviarse constantemente entre la memoria de CPU y GPU, y la estrecha conexión x4 ralentiza este intercambio de datos significativamente.
En inferencia pura, es decir, chatear clásicamente con un modelo local u operar un agente de codificación, las cosas se ven diferentes. Una vez que el modelo se carga completamente en la VRAM de la tarjeta gráfica externa, durante la generación real de tokens apenas hay nada que pasar por el enlace PCIe. Solo los resultados intermedios relativamente pequeños entre capas individuales y los tokens de entrada y salida viajan por la conexión. Los benchmarks de la comunidad confirman esto: en inferencia pura, una conexión OCuLink está prácticamente dentro del margen de error de una tarjeta gráfica integrada internamente.
La situación es diferente si un modelo no cabe completamente en el VRAM de la tarjeta externa y debe descargarse parcialmente en la memoria de CPU, el llamado layer-offloading. Entonces los datos se mueven realmente entre la memoria de CPU y GPU con cada token, y la conexión x4 ralentiza notablemente. Para tu caso de uso significa en la práctica: si un modelo cabe completamente en la tarjeta NVIDIA conectada, apenas pierdes rendimiento con OCuLink. Tan pronto como quieras ejecutar un modelo más grande que el VRAM de la tarjeta y deba dividirse, la APU con su propia Unified Memory generalmente es la mejor opción que un setup de offloading sobre OCuLink.
Un segundo punto que a menudo se pasa por alto es una limitación de BIOS en muchas placas Strix-Halo: las tarjetas gráficas AMD conectadas externamente se limitan fijas a 120 watts independientemente del modelo de tarjeta. Las tarjetas NVIDIA no se ven afectadas según los reportes actuales de la comunidad, lo que hace que el enfoque híbrido con una GPU externa sea prácticamente una solución específica de NVIDIA. Una prueba práctica documentada con una RTX 5090 conectada vía OCuLink en un dispositivo Strix-Halo mostró alrededor de un tercio más rápida generación de tokens en comparación con la APU pura, y casi el doble de velocidad en procesamiento de prompt, es decir, una ganancia real y notable a pesar de la estrecha conexión x4.
Esto significa: la limitación 4x suena peor de lo que es en la práctica para inferencia pura. Solo se vuelve relevante cuando entrenas, haces fine-tuning o ejecutas modelos más grandes que el VRAM de la tarjeta externa. Para el día a día como máquina de agente de codificación, el enfoque híbrido es una opción seria, no un parche. Pero, por supuesto, no compras una tarjeta gráfica tan cara solo para usarla al 100%. Además de las razones técnicas, está la cuestión del ego o la confianza.
Comparación directa: Mini-PC vs. NVIDIA DGX Spark vs. PC de escritorio con GPU
| Strix-Halo-Mini-PC (128GB) | NVIDIA DGX Spark | Escritorio con RTX 5090 | Escritorio con RTX PRO 6000 | |
|---|---|---|---|---|
| Precio | aprox. 2.700 a 4.700 € | aprox. 4.700 $ | aprox. 3.000 a 4.000 € (tarjeta) | a partir de aprox. 20.000 $ (sistema) |
| Tamaño máx. de modelo | 70B+ cómodo | hasta 200B, 405B en cluster | hasta aprox. 30B practicable | 70B cómodo |
| Ancho de banda de memoria | ~256 GB/s | ~273 GB/s | ~1.792 GB/s | ~1.792 GB/s |
| Ecosistema | ROCm, joven, en crecimiento | CUDA, maduro | CUDA, maduro | CUDA, maduro, con ECC |
| Aptitud para escritorio diario | Muy buena, x86, Windows/Linux | Limitada, ARM | Muy buena | Muy buena |
| Idoneidad 24/7 | Buena con modelos de workstation | Buena, bajo consumo | Condicional, sin ECC | Muy buena, ECC, clase workstation |
Mi recomendación actual para comprar un Mini-PC con IA
Para el escenario de “uso de escritorio más flujos de trabajo multi-agente locales con modelos de 70B y agentes de codificación”, elegiría un único Ryzen AI Max+ 395 Mini-PC con 128 GB de RAM. La opción de cluster solo tiene sentido cuando realmente necesites entrar en la clase de modelos de 235B+, algo que la mayoría de configuraciones multi-agente no requieren.
Pero la idea de expandir un sistema es mucho más atractiva que tener que reemplazarlo por completo.
Dentro de los dispositivos Strix Halo, prefiero el Minisforum MS-S1 Max por su concepto de refrigeración bien pensado, conectividad 10GbE y expansión de cluster y rack opcional validada por el fabricante, en caso de que quieras mejorar más adelante.
El GMKtec EVO-X2 es la alternativa sólida y más ampliamente disponible si el Minisforum de 128 GB no está en stock en este momento. El nuevo GMKtec EVO-X3 merece una mirada si el puerto OCuLink nativo para futuras expansiones con eGPU es más importante para ti que la capacidad de clustering, aunque esperaría algunos meses más para pruebas independientes en el mundo real antes de recomendarlo para operación en producción 24/7. El dispositivo acaba de ser presentado hace unos días.
Evitaría marcas sin nombre y sin historial de pruebas en un dispositivo que funciona todo el día. Las he incluido en el enlace de la tienda de Amazon, pero la diferencia de precio es pequeña, por lo que merece la pena apuntar a los fabricantes principales.
DGX Spark y las workstations RTX-PRO-6000 son la opción correcta para casos especiales como requisito obligatorio de CUDA, necesidades empresariales o modelos muy grandes. Para el caso de uso típico del desarrollador con modelos de 70B y agentes de codificación, la relación precio-rendimiento de un Mini-PC Strix Halo es difícil de superar actualmente.
Para quienes, como yo, no pueden decidirse entre un Mini-PC y un escritorio NVIDIA, el enfoque híbrido OCuLink es en mi opinión el punto medio más interesante para 2026. Aprovechar todas las ventajas y decidir con seguridad: Empieza en pequeño con Unified Memory puro, y más adelante, si es necesario, actualiza con una RTX 4090 usada o una RTX 5090 nueva para los modelos más rápidos y pequeños, mientras los grandes modelos de 70B continúan ejecutándose a través de la memoria de la APU. Esta es actualmente mi configuración.
Aviso de transparencia: Este artículo contiene enlaces de afiliado de Amazon. Si compras a través de estos enlaces, es posible que reciba una comisión de Amazon. Esto no te genera costos adicionales.
AMD Ryzen AI Max+ 395, plataforma AMD Halo Developer y el nuevo Ryzen AI Max+ PRO 495, qué hay detrás
NVIDIA presentó DGX Spark. AMD no solo respondió con un nuevo procesador, sino que también lanzó su propia plataforma para desarrolladores, la plataforma AMD Halo Developer, que se basa en el Ryzen AI Max+ 395.
Sin embargo, siempre surge la misma pregunta.
¿Hay diferencia entre el AMD Ryzen AI Max+ 395 y la plataforma AMD Halo Developer?
La respuesta corta es: sí.
El Ryzen AI Max+ 395 es el procesador real, más precisamente una APU. Combina CPU, GPU y NPU en un solo chip.
La plataforma AMD Halo Developer, en cambio, es un Mini-PC completo que ya incluye este procesador.
Es comparable a un procesador Intel Core. El procesador en sí es solo un componente. Solo cuando se combina con placa base, memoria, SSD y carcasa se forma un sistema completo. Dado que el Mini-PC de la plataforma AMD Halo Developer es prácticamente imposible de comprar en Europa, la alternativa es el Minisforum MS-S1 Max de 128 GB.
Ryzen AI Max+ 395
| Característica | Especificaciones |
|---|---|
| CPU | 16 núcleos, 32 hilos |
| Arquitectura | Zen 5 |
| GPU integrada | Radeon 8060S |
| Compute Units GPU | 40 |
| NPU | XDNA 2 |
| Rendimiento IA | 55 TOPS NPU |
| TDP | 45 a 120 vatios |
Plataforma AMD Halo Developer
La plataforma para desarrolladores ya incluye todo lo necesario para una estación de trabajo de IA.
| Componente | Especificaciones |
| Procesador | Ryzen AI Max+ 395 |
| Memoria RAM | 128 GB LPDDR5X Unified Memory |
| SSD | 2 TB |
| Red | Ethernet Gigabit 10 |
| WLAN | WiFi 7 |
| Sistema Op. | Windows o Linux |
El rendimiento computacional real proviene del Ryzen AI Max+ 395. La plataforma Developer es simplemente el sistema de referencia completo de AMD.
El nuevo Ryzen AI Max+ PRO 495
Las cosas se pusieron interesantes con la presentación del nuevo Ryzen AI Max+ PRO 495.
A primera vista, parece una nueva generación. Observando más de cerca las especificaciones técnicas, se nota que AMD publicó más bien una actualización.
| Característica | PRO 395 | PRO 495 |
| Núcleos CPU | 16 | 16 |
| Hilos | 32 | 32 |
| Boost | 5,1 GHz | 5,2 GHz |
| Frecuencia base | 3,0 GHz | 3,1 GHz |
| Caché L3 | 64 MB | 64 MB |
| GPU | Radeon 8060S | Radeon 8065S |
| Compute Units | 40 | 40 |
| Frecuencia GPU | 2900 MHz | 3000 MHz |
| NPU | 55 TOPS | 55 TOPS |
| Unified Memory | hasta 128 GB | hasta 192 GB |
Cuáles son las diferencias
La CPU y GPU funcionan a frecuencias ligeramente más altas.
En la práctica, según la aplicación, esto debería resultar en alrededor del tres al cinco por ciento de rendimiento adicional.
La diferencia real está en otro lugar completamente.
El Ryzen AI Max+ PRO 495 soporta hasta 192 GB de Unified Memory.
Precisamente este punto podría ser mucho más interesante para modelos de IA locales que las tasas de reloj un poco más altas.
Por qué la memoria es tan importante
Muchos piensan primero en más potencia de CPU o una GPU más rápida.
Sin embargo, con modelos de lenguaje locales, la memoria disponible suele ser lo que determina cuáles se pueden cargar completamente.
Como orientación general:
| Unified Memory | Casos de uso típicos |
| 64 GB | Modelos de 7B a aproximadamente 32B |
| 128 GB | Modelos de 70B y cuantizaciones mayores |
| 192 GB | Modelos mucho más grandes o varios simultáneamente |
Especialmente con Ollama, este punto juega un rol mucho más importante que 100 MHz adicionales de frecuencia de CPU.
¿Hay precios para la variante de 192 GB?
Todavía no.
AMD ha presentado el procesador. Sin embargo, los sistemas concretos con 192 GB de Unified Memory aún están en fase de anuncio.
La plataforma AMD Developer conocida hasta ahora con 128 GB cuesta alrededor de 4.000 dólares estadounidenses.
Realísticamente, un sistema con 192 GB debería rondar entre 4.800 y 5.500 euros, dependiendo del fabricante.
Linux o Windows
La pregunta sobre el sistema operativo surgió de manera natural en la conversación.
Aunque AMD ofrece la Developer Platform tanto para Windows como para Linux, Linux probablemente sea la opción más interesante para muchos desarrolladores.
Las razones incluyen:
- mejor soporte de ROCm
- Docker funciona sin virtualización adicional
- uso de contenedores más sencillo
- entorno de desarrollo nativo
- menos overhead
Windows sigue siendo relevante si necesitas software que solo está disponible allí o si ya usas WSL2 como parte de tu flujo de trabajo.
¿Para quién es interesante un sistema así?
Un caso de uso posible podría verse así:
- Ollama
- Windsurf
- OpenWebUI
- Docker
- MCP Server
- Qdrant o Milvus
- múltiples agentes locales
Los agentes se benefician especialmente cuando varios modelos pueden mantenerse en memoria simultáneamente.
Por ejemplo:
- Modelo de codificación
- modelo de lenguaje general
- modelo de embedding
- reranker
- modelo de visión
Con 192 GB de Unified Memory, no tendrías que cambiar constantemente entre modelos.
¿Pueden reemplazar los modelos locales a Claude?
Una pregunta interesante de la discusión fue cómo se comparan los modelos locales con Claude Sonnet u Claude Opus.
La respuesta no es del todo simple.
Actualmente, Claude Sonnet y Opus siguen siendo de los modelos más potentes disponibles.
Sin embargo, los modelos locales de 70B han avanzado enormemente.
| Tarea | Claude | Modelo local 70B |
| Codificación | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Refactorización | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Arquitectura | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Contenido | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Alemán | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
*Opinión personal
La brecha se ha reducido significativamente en comparación con hace unos pocos años. Pero siendo honesto, ya obtengo muy buenos resultados con modelos SWE1.7 simples.
Un flujo de trabajo realista
Muchas personas probablemente no renunciarán completamente a los modelos en la nube.
Un enfoque híbrido parece lo más sensato en este momento.
- Los modelos locales manejan la mayor parte del trabajo diario.
- Claude u otros modelos en la nube se usan solo para tareas particularmente complejas.
Así puedes combinar bien la privacidad de datos, los costos y la calidad.
El Ryzen AI Max+ PRO 495 no es una generación completamente nueva, sino más bien una evolución cuidadosa del PRO 395.
Las frecuencias un poco más altas pasarán prácticamente desapercibidas en el uso diario.
El verdadero avance está en el soporte de hasta 192 GB de Unified Memory.
Especialmente para aplicaciones locales de IA con Ollama, agentes, Windsurf y varios modelos cargados simultáneamente, este punto podría marcar la diferencia decisiva.
Personalmente, me interesa menos si el procesador se ha vuelto un tres por ciento más rápido.
Lo que realmente me atrae es la pregunta de qué nuevas posibilidades surgen cuando 192 GB de Unified Memory están disponibles por primera vez en una workstation compacta.
Preguntas frecuentes
¿Cuál es la principal ventaja del Ryzen AI Max+ 395 para IA local?
El Ryzen AI Max+ 395 ofrece hasta 128 GB de Unified Memory, que CPU y GPU comparten. Esto permite mantener modelos de lenguaje grandes como 70B en cuantización Q4 directamente en memoria, sin necesidad de una tarjeta gráfica separada.
¿Bastan 128 GB de RAM para modelos de 70B?
Sí. Un modelo de 70B en Q4 necesita aproximadamente 40 a 45 GB de memoria. Con 128 GB de Unified Memory tienes suficiente margen para contexto, múltiples modelos cargados y sesiones de agentes simultáneas.
¿Por qué el ancho de banda de memoria es más importante que los TOPS en LLMs?
Durante la generación de tokens, prácticamente todo el modelo se lee una sola vez desde memoria. La velocidad de decodificación depende principalmente del ancho de banda de memoria, no de la potencia computacional teórica. Los valores de NPU-TOPS son casi irrelevantes para la inferencia pura de LLM.
¿Cuál es la diferencia entre el Ryzen AI Max+ 395 y el 495?
El 495 es una evolución cuidadosa con núcleos de CPU y GPU con frecuencias un poco más altas. El verdadero avance es el soporte de hasta 192 GB de Unified Memory en lugar de los 128 GB anteriores.
¿Es el NVIDIA DGX Spark una alternativa mejor?
El DGX Spark destaca por su ecosistema CUDA maduro, NVFP4 nativo y acoplamiento de clúster oficial. Sin embargo, su ancho de banda de memoria apenas supera al de Strix Halo, y la arquitectura ARM limita el software de escritorio clásico. Para uso de escritorio puro más IA local, un mini PC x86 es a menudo más práctico.
¿Puedo conectar una tarjeta gráfica NVIDIA a mini PCs Strix Halo?
Sí, a través de OCuLink o un adaptador M.2 a OCuLink. Dispondrás de cuatro carriles PCIe 4.0 (x4). Para inferencia pura, la diferencia de velocidad con respecto a la conexión interna x16 prácticamente no se nota.
¿Cuál es el mejor mini PC recomendado para flujos de trabajo multi-agentes?
Para el escenario “escritorio más multi-agentes locales con modelos de 70B”, recomiendo el Minisforum MS-S1 Max con 128 GB por su refrigeración, 10GbE y opción de clúster. El GMKtec EVO-X2 es la alternativa más ampliamente disponible.
¿Vale la pena un clúster de dos dispositivos Ryzen AI Max?
Un clúster solo tiene sentido a partir de la clase de modelos de 235B+, por ejemplo para DeepSeek-R1 671B. Para modelos típicos de 70B o MoE más pequeños, un dispositivo único de 128 GB es generalmente suficiente.
¿Linux o Windows para el Ryzen AI Max+ 395?
Ambos son posibles. Linux ofrece la máxima flexibilidad para herramientas de IA como Ollama y llama.cpp, mientras que Windows es más cómodo para el uso de escritorio diario con software habitual.
¿Cuánto cuesta un mini PC de IA decente con 128 GB?
Un sistema Strix Halo sólido con 128 GB cuesta generalmente entre 3.000 y 5.000 euros, dependiendo del fabricante y la configuración. El NVIDIA DGX Spark comienza en aproximadamente 4.700 euros.
Más información: Si quieres comenzar directamente con sistemas multi-agentes en tu PC de IA local, encontrarás una visión general práctica en Multi-Agenten-Frameworks: LangGraph, CrewAI und OpenClaw im Vergleich.


