Ryzen max+ 395/495 (например, AMD Halo Developer Platform) vs NVIDIA DGX Spark vs RTX-PRO-Workstations
Требование: мощный настольный ПК для больших LLM (70B+), мультиагентных систем, бюджет 3000-5000 евро.
Кто дёшево покупает, два раза платит. В этом ценовом диапазоне я этого избежать хочу.
Поэтому я тщательно разобрался, что значит потратить сбережения на мини-ПК стоимостью подержанного автомобиля вместо инвестирования в AI-сервер, цена которого равна новому Dacia Duster.
В этой статье я исключу все “дешёвые мини-ПК”, которые могут иметь своё место, и сосредоточусь только на топовом сегменте. Я объясню, на что обращать внимание при выборе AI-сервера и почему TOPS и FLOPS зачастую не имеют значения, а это просто маркетинг.
Все рекомендуемые мини-ПК собраны в нашем Amazon-магазинеЕсли вы не уверены в различиях между типами процессоров (CPU, GPU, TPU, NPU), прочитайте нашу статью CPU, GPU, TPU и NPU: Почему GPU так важна для AI.
Я планирую купить стабильный AI-сервер для дома, который можно масштабировать, легко запускать большие AI-модели и остаться в рамках бюджета.
Сейчас выбор быстро сужается до Ryzen AI Max+ 395 / Ryzen AI Max+ 495 для настольного использования или моделей NVIDIA DGX Spark.
Если, как и я, вы хотите локально запускать кодирующих агентов, RAG-пайплайны или просто приватную LLM-модель 70B+ без ежемесячных счётов за облако, этот класс устройств стоит внимания. В ближайшее время появится модель Ryzen AI Max+ 495, но с минимальными изменениями (см. ниже).
В 2026 году рынок локального AI-оборудования активизировался: мини-ПК Ryzen AI Max, NVIDIA DGX Spark, классические настольные ПК с выделенной GPU и даже первые серверные варианты (Hetzner GEX44) конкурируют за одну аудиторию, а именно разработчиков/компании, которые хотят запускать 70B-параметрические модели и несколько AI-агентов одновременно дома или в офисе. Цены значительно варьируются, и маркетинговые цифры типа TOPS часто вводят в заблуждение. Поэтому я разберу это систематически, с конкретными критериями покупки, устройствами и личной рекомендацией в конце.
Почему локальное AI-оборудование имеет смысл в 2026
Я работаю разработчиком приложений в юридических фирмах и сейчас программирую множество AI-приложений и API для различных GDPR-совместимых провайдеров. К сожалению, постоянно натыкаюсь на неудачный дизайн API. Например, низкие лимиты токенов, отсутствие истории диалогов, API за системами Cloudflare, которые добавляют собственные лимиты.
Когда 50 сотрудников одновременно используют AI, вы сначала занимаетесь логированием, анализом и отладкой. Не потому что есть реальные ошибки, а потому что нужно учитывать дизайн API. Кто знаком с нашим курсом API: REST, GraphQL, gRPC, Security и Documentation, тот знает, как подстраивать запросы под лимиты:
см. также - API Rate Limiting Implementation
- Rate Limiting и Throttling для API
Желание собственного AI без лимитов токенов, без лимитов запросов очень велико, и расходы окупаются часто за несколько месяцев.
Прежде чем переходить к оборудованию, кратко о мотивации, если вы ещё не определились. Кто регулярно использует кодирующих агентов или мультиагентные системы, быстро платит трёхзначные суммы в месяц облачным провайдерам. Локальный AI мини-ПК с достаточным Unified Memory окупается при интенсивном использовании часто за год. Добавляем защиту данных и суверенитет, особенно если вы работаете с конфиденциальным исходным кодом или данными клиентов. Тогда локальная инференция часто единственный практичный вариант, независимо от стоимости.
Критерии покупки: на что действительно обращать внимание при выборе мини-ПК для локальных LLM
Я разбил оценку на несколько категорий. Порядок примерно отражает релевантность для применения в мультиагентных системах и круглосуточной работе.
Кому объяснения критериев не интересны, может сразу перейти к таблице сравнения.
Я намеренно включил оборудование, немного выходящее за финансовые границы, чтобы сделать приличное сравнение и принять “правильное решение”.
1. Пропускная способность памяти важнее TOPS
Самый важный и самый неправильно понимаемый пункт. При генерации каждого токена в LLM всю модель практически полностью читают из памяти. Скорость в токенах в секунду зависит в первую очередь от пропускной способности памяти, а не от теоретической вычислительной мощности. Часто рекламируемые значения NPU-TOPS, например “126 TOPS”, для LLM-инференции почти не имеют значения, так как Ollama, llama.cpp и LM Studio запускают модели через GPU, а не через NPU. Мой первый совет: никогда не покупайте AI мини-ПК только ради цифры TOPS на упаковке.
Ryzen AI Max+ 395, кодовое имя Strix Halo, обеспечивает примерно 256 GB/s пропускной способности памяти через четырёхканальный LPDDR5X. Это центральное узкое место, которое нужно иметь в виду при любом сравнении.
Объяснение:
В авторегрессивных LLM для каждого сгенерированного токена практически всю модель читают из памяти, поэтому пропускная способность памяти (GB/s) часто определяет tokens/s, а не рекламируемое на упаковке значение NPU-TOPS. TOPS измеряет только сырую вычислительную мощность, если данные поступают недостаточно быстро из RAM/VRAM или модель не помещается в быстрый встроенный буфер, вычислительные блоки остаются неработающими. Поэтому реально измеренные tokens/s с конкретными моделями/квантизациями (например, Llama-2-7B, 4-bit) и устойчивая пропускная способность более надёжные критерии покупки, чем чистые значения TOPS.
Sustained Bandwidth (устойчивая пропускная способность) обозначает фактически достижимую в течение долгого времени постоянную скорость передачи данных между памятью и процессором (например, RAM ↔ GPU/SoC), а не только кратковременный пиковый показатель (peak). Она отражает реальные условия с нагревом, затратами контроллера памяти, параллельными обращениями и поведением кэша, то есть сколько GB/s система может доставлять стабильно без дросселирования или узких мест. Для LLM-инференции устойчивая пропускная способность важнее, чем пиковая, потому что генерация токенов требует одинаковую пропускную способность на протяжении многих последовательных проходов.
TOPS: Мои слова “почти не имеют значения” звучат жёстко, но есть сценарии, где количество TOPS играет роль:
TOPS важны, когда вычислительные ядра постоянно снабжаются данными и приложение требует много простых, массово-параллельных операций. Конкретно это применимо к:
- Матричные и векторные операции в большом масштабе: при обучении или инференции, когда модель полностью находится в быстром встроенном буфере, TOPS определяют максимальную вычислительную мощность.
- Модели в высокой точности: расчёты FP32/FP16 выигрывают от высокой вычислительной мощности, потому что на элемент приходится больше операций и объём данных на элемент больше.
- Высокопроизводительные, не связанные памятью алгоритмы: если данные предварительно хранятся в кэше/SRAM и вычислительные блоки выполняют много операций на загруженный байт, производительность масштабируется с TOPS.
- Обработка сигналов, ML для изображений и видео: приложения реального времени типа инференции для высокого разрешения или сложные нейросети на специализированных Tensor Cores напрямую используют высокие TOPS.
- Специализированные NPU/ASIC с хорошей архитектурой памяти и взаимосвязей: если оборудование имеет большую встроенную память, эффективные конвейеры потоков и низкую задержку между памятью и вычислениями, TOPS работают лучше.
Короче: TOPS полезны, когда архитектура обеспечивает снабжение данными и рабочая нагрузка выполняет много вычислительных операций на байт данных. В сценариях LLM-инференции, связанных с памятью, доминируют GB/s.
2. Объем оперативной памяти, размерность для 70B-моделей и мультиагентные установки
В устройствах Strix Halo вся оперативная память припаяна намертво и не подлежит модернизации, поэтому объем нужно выбирать окончательно при покупке. Для установки с одной 70B-моделью плюс несколько параллельных coding-агентов без 128 GB не обойтись, поэтому я вообще не рассматриваю модели меньше 128GB. Вот требования:
- Мощная MoE-модель (Mixture of Experts) вроде Qwen3-Coder-Next как основной агент требует в Q4-квантизации около 45 GB
- Модель для reasoning и отладки, например DeepSeek-R1 32B, занимает примерно 18 GB
- Несколько небольших моделей для параллельных отдельных задач, скажем Qwen3 8B, по примерно 5 GB каждая
- Буфер для KV-cache при нескольких одновременных диалогах
64 GB оперативной памяти достаточно для одной 30B-модели, но в настоящих мультиагентных установках с несколькими одновременно загруженными моделями быстро становится тесно.
Если посмотреть на цифры, становится ясно, что одна видеокарта стоимостью 7000 евро не справится с такими моделями в одиночку. Большинство видеокарт NVIDIA имеют разве что 32GB VRAM. Этого недостаточно, и бюджет уже исчерпан. Mini-PC способен это потянуть. Суть такова: на небольших моделях видеокарта NVIDIA имеет преимущество, потому что обрабатывает БОЛЬШЕ ТОКЕНОВ в минуту, но на больших моделях 0 токенов, потому что не может их полностью загрузить.
Объяснение:
- MoE-модель (Mixture of Experts) это нейросеть, содержащая множество специализированных подсетей (Experts), но для каждого входа активирует только небольшое их подмножество. Так модель в целом остаётся очень большой (большая ёмкость), а вычислительная нагрузка и использование памяти на одно предсказание остаются низкими, поскольку на каждый токен задействуются лишь несколько Experts.
3. Охлаждение и работа под нагрузкой, сутки напролёт
Важно, если устройство, как у меня, должно работать постоянно: смотрите не на пиковую потребляемую мощность в техспеке, а на параметр Sustained Power. Consumer-ориентированные устройства под постоянной нагрузкой заметно снижают частоту и нагреваются, в то время как устройства класса Workstation имеют больше охлаждающих поверхностей и более стабильное управление вентиляторами. Встроенный адекватный блок питания, например 320 W вместо натянутого внешнего, тоже хороший знак продуманного теплового дизайна.
4. Сеть и возможность кластеризации
Для мультиагентных установок в локальной сети или для дальнейшего расширения кластера релевантны два момента:
- 10GbE вместо 2.5GbE, если несколько сервисов или контейнеров должны работать в сети
- USB4 v2 с 80 Gbps для прямого связывания двух устройств в кластер
Некоторые производители вроде Minisforum явно рекламируют способность кластеризации своей серии MS-S1 Max с конкретными цифрами, об этом речь пойдёт дальше. У большинства consumer mini-PC “кластер” это чистое маркетинговое заявление без настоящей валидации.
5. Программное обеспечение, ROCm против CUDA
Момент, который часто упускают в консультациях по покупкам: поддержка AMDs ROCm для GPU-архитектуры Strix Halo, внутренне называемой gfx1151, ещё относительно молода. Ситуация с драйверами значительно улучшилась в 2026 году, но CUDA-экосистема NVIDIA остаётся более зрелой и широко поддерживаемой. Если вы много работаете с PyTorch, fine-tuning или специальными CUDA-ядрами, учитывайте это.
6. Расширяемость, марка и поддержка
PCIe-x16-слот, присутствующий не на всех устройствах, позволяет позже установить, например, дополнительную сетевую карту. С no-name брендами без истории обновления прошивок я был бы осторожен при выборе production-устройства на 24/7, риск отказа в постоянной работе быстро превосходит экономию от менее известного производителя.
Часто упускаемый момент расширяемости: наличие OCuLink-порта, или установленный через M.2-адаптер, позволяет позже подключить внешнюю видеокарту NVIDIA как дополнение. Об этом подробнее в отдельном разделе про гибридный подход.
MoE против Dense: ключевой вывод для выбора моделей на Strix Halo
Поскольку пропускная способность памяти это узкое место, Mixture-of-Experts-модели с малым числом активных параметров на токен работают на Strix Halo непропорционально быстрее, чем плотные модели сопоставимого общего размера. На практике с 128GB-устройством это означает:
| Роль | Рекомендация | RAM (Q4) |
|---|---|---|
| Основной coding-агент | Qwen3-Coder-Next (MoE) | около 45 GB |
| Reasoning/отладка | DeepSeek-R1 32B Distill | около 18 GB |
| Быстрые отдельные задачи | Qwen3 8B | около 5 GB за экземпляр |
| Dense-альтернатива, если нужна | Llama 3.3 70B | около 40 GB, но заметно медленнее |
Практический совет: вместо того чтобы одновременно загружать пять-семь разных моделей, эффективнее запустить одну модель через сервер с параллельной обработкой запросов, например llama.cpp-Server, vLLM или Ollama с несколькими слотами, для нескольких одновременных сессий агентов. Вторая модель окупается только если действительно нужна другая качество, скажем для задач, требующих reasoning.
Но и при работе команд AI-агентов стоит уделять внимание максимальному объёму vRAM или общей памяти. Возможно, захочется параллельно запускать команду разработки: Например:
- Coding-модель
- общеязыковая модель
- модель эмбеддингов
- Reranker
- Vision-модель В таком случае не стоит выбирать экстремально малую модель только потому, что памяти больше нет.
Ryzen AI Max+ 395 Mini PC в сравнении (класс 128GB)
Конкретный выбор, оценённый по указанным выше критериям. Почти все устройства используют один и тот же чип, Ryzen AI Max+ 395 с Radeon 8060S, различия в охлаждении, сети, способности кластеризации и поддержке производителя. Для сравнения в список также включены NVIDIA DGX Spark, AMD Halo Developer Platform и Apple Mac mini M4 Pro.
Все рекомендуемые AI mini-PC и серверы также указаны в нашем Amazon-магазине (Affiliate-Link)
| Устройство | RAM/SSD | Сеть | Кластер | Оценка |
|---|---|---|---|---|
| Minisforum MS-S1 Max | 64GB/2TB | 2x 10GbE, USB4 v2 с 80 Gbps | Да, протестировано производителем, 2-Node-кластер для 235B-моделей, 4-Node для DeepSeek-R1 671B | Лучший вариант для кластера, PCIe-x16-слот, 320W-БП рассчитан на постоянную работу, 2U-rackfähig. В 128GB явный лидер, если доступен |
| GMKtec EVO-X2 (128GB) | 128GB/2TB | 2.5GbE, USB4 | Нет, только стандартный USB4 | Самый распространённый, хороший опыт сообщества, но под постоянной нагрузкой шумит и нагревается сильнее класса Workstation |
| GMKtec EVO-X3 (128GB), Amazon-ссылка следует | 128GB/2TB до 4TB | 2.5GbE, USB4, OCuLink с PCIe 4.0 x4 | Нет, но OCuLink позволяет подключить внешний GPU | Преемник EVO-X2 с родным OCuLink-портом для внешних GPU, три профиля питания (54W, 85W, 120W, пик 140W) с двойным охлаждением, от 3600 USD (2 TB) или 3849 USD (4 TB), старт продаж 6 июля 2026, ещё без широкого опыта применения |
| HP Workstation Z2 G1a Mini | 128GB/2TB | 1GbE плюс 2.5GbE, без 10GbE | Нет | Business-качество, хорошее охлаждение и гарантийная надёжность, но сеть слабовата для кластерного сценария, цена сравнительно высока |
| Corsair AI Workstation 300 | 128GB/4TB | 2.5GbE, та же плата что и EVO-X2 | Нет | Хорошая сборка, но технически никакого преимущества перед GMKtec для данного сценария |
| Thdeukoty Ryzen AI Max+ 395 | 128GB/2TB | указан 10GbE | неясно | No-name бренд без проверяемых тестов, при 24/7-работе это риск, на который я бы лично не пошёл |
| NVIDIA DGX Spark (Не Ryzen… ) | 128GB Unified Memory | ConnectX-7, кластер-связь | Да, до двух устройств на 256 GB совместно | Зрелое CUDA-экосистема, нативная NVFP4-поддержка, высокая цена, ARM-архитектура ограничивает desktop-ПО. Хорошая альтернатива, если поддержка ПО важнее x86-совместимости |
| Apple Mac mini M4 Pro (Не Ryzen… ) | максимум 24GB | стандартная | Нет | Для 70B-моделей и мультиагентной работы неактуально из-за малого объёма RAM |
Техническая альтернатива Ryzen AI Max+ 395 / 495: NVIDIA DGX Spark (GB10 Grace Blackwell)
NVIDIA DGX Spark — это очевидная альтернатива компактным ПК на базе Strix Halo (AMD Halo Developer Platform), потому что он также предлагает 128 GB Unified Memory в компактном форм-факторе, только с суперчипом GB10 вместо x86. GB10 состоит из 20-ядерного процессора Grace (ARM-архитектура) и GPU Blackwell.
Технические характеристики NVIDIA DGX Spark: 128 GB LPDDR5X Unified Memory с пропускной способностью около 273 GB/s — примерно в той же категории, что и Strix Halo, но не кардинально быстрее. Вычислительная производительность доходит до 1 PetaFLOP для FP4 с использованием sparsity. Два процессора можно объединить через ConnectX-7-Networking, получив 256 GB общей памяти для моделей до 405 миллиардов параметров. Поставляется с DGX OS на базе Ubuntu.
Стоимость начинается примерно с 4.700 евро и выше.
Преимущества перед Strix Halo: CUDA-экосистема намного более зрелый, чем ROCm. Есть нативная поддержка NVFP4 для 4-битной инференции. Возможность официально объединять несколько устройств через высокоскоростную сеть вместо USB4. Профессиональная поддержка и обслуживание со стороны NVIDIA.
Недостатки: Пропускная способность памяти остаётся почти такой же, как у Strix Halo, несмотря на впечатляющую пиковую производительность. Поэтому плотная модель на 70B не станет чудом скорости на DGX Spark — speed-up на этапе декодирования ограничен пропускной способностью, а не вычислительной мощностью. ARM-архитектура также означает несовместимость с классическим настольным ПО. Если вам нужен универсальный компьютер для работы помимо AI-задач, x86-мини-ПК практичнее. Цена DGX Spark значительно выше большинства альтернатив на базе Strix Halo при сопоставимом объёме памяти.
NVIDIA DGX Spark:
Если вы специально хотите работать в экосистеме NVIDIA или использовать NVIDIA NIM и Blueprints, здесь вы получите полнофункциональное решение. Для сценария типа “настольная работа + локальные AI-агенты”, который мы рассматривали изначально, x86-мини-ПК на базе Strix Halo часто оказывается практичнее.
Третий вариант: настольный ПК с выделенной видеокартой NVIDIA
Классический подход остаётся актуальным: настольный ПК с видеокартой RTX. Здесь критическое значение имеет объём видеопамяти GPU, так как это жёсткое ограничение, в отличие от систем с Unified Memory.
- RTX 5090, 32 GB GDDR7, пропускная способность около 1.792 GB/s: заметно быстрее Strix Halo для всего, что влезает в 32 GB. Но модель 70B в Q4 требует примерно 35-40 GB, что превышает объём. Для моделей до 30B RTX 5090 — более быстрое решение. Для 70B нужна агрессивная квантизация с потерей качества или другой подход.
- RTX PRO 6000 Blackwell, 96 GB GDDR7 с ECC, та же пропускная способность, что у 5090: 70B-модель в Q4 уместится с запасом в 50+ GB для контекста и одновременных пользователей. ECC-память защищает от скрытых ошибок при круглосуточной работе. Полная рабочая станция с такой картой обычно стоит 20.000-30.000+ долларов США, особенно в конфигурации с двумя картами — совсем другой бюджет.
Ключевой компромисс: настольный ПК с выделенной GPU заметно быстрее любой системы с Unified Memory, если модель полностью помещается в видеопамяти. GDDR7 имеет намного большую пропускную способность, чем LPDDR5X. Цена — либо жёсткий лимит по размеру модели (RTX 5090), либо намного больший бюджет (RTX PRO 6000). Для coding-агентов с умеренными требованиями к модели (до примерно 30B), где важна сырая скорость, настольный ПК с RTX 5090 — серьёзная альтернатива. Для 70B-моделей в рамках бюджета Strix Halo Unified Memory остаётся практичнее.
Совет: даже компактные ПК на базе Strix Halo можно расширить добавлением видеокарты и использовать обе платформы вместе.
Вариант на базе сервера: стоечные системы с Ryzen AI Max+ 395
Если вы планируете решение для нескольких пользователей или команды, рано или поздно встанет вопрос о настоящей стоечной системе. Стоит немного разобраться, потому что рынок здесь ещё молодой.
Ryzen AI Max+ 395 — необычный выбор в контексте серверов, так как это рабочая станция-APU, а не классический серверный процессор. AMD позиционирует её как компактную AI-рабочую станцию с до 128 GB Unified Memory (в PRO 495 потенциально до 192 GB).
Я изучил ASRock Rack в ходе своих исследований.
Многие знают ASRock Industrial AI BOX-A395. Но это не классический 19-дюймовый серверный шкаф, а компактная Small-Form-Factor-рабочая станция в алюминиевом корпусе размером 200 x 100 x 232 mm, предназначенная для Enterprise и Edge. Конфигурация включает тот же Ryzen AI Max+ 395, до 128 GB LPDDR5X, 10GbE плюс 2.5GbE, два USB4-порта, TPM 2.0 и резервное BIOS для повышенной надёжности. Это не построено для классического серверного стойки — скорее это особо надёжный, готовый к enterprise-применению вариант настольной системы.
Причина проста: Ryzen AI Max+ 395 — это паяный System-on-Chip, не сокетный процессор. Классические серверные материнские платы ASRock Rack для AM5 (с AMD EPYC 4004/4005 или Ryzen 7000/8000/9000) рассчитаны на сокетные CPU. Strix Halo туда просто не встанет, так как нет сокетной версии чипа. Поэтому пройдёт ещё время, прежде чем такие производители, как ASRock Rack, выпустят настоящую 1U или 2U плату специально для этого чипа.
Единственный известный мне вариант, действительно рассчитанный на монтаж в 19-дюймовый стеллаж, — это уже упомянутый Minisforum MS-1 Max. Производитель явно позиционирует устройство с четырьмя переключаемыми режимами работы, включая отдельный “Rack”-режим, выдвижным корпусом для обслуживания и разъёмом для синхронного включения/выключения нескольких устройств в кластере. Для тех, кто действительно хочет запустить несколько Ryzen AI Max-систем в стойке, это сейчас наиболее практичное решение без необходимости переходить на классические EPYC или Xeon-серверы с их высоким потреблением энергии и стоимостью.
НО не настоящая серверная альтернатива: Для исправдовой серверной альтернативы я бы рекомендовал посмотреть в эти направления:
Справка: альтернативные AI-серверные платформы
Если хотите арендовать выделенный AI-сервер, подробнее см. KI-Server mieten: Kosten-Nutzen-Analyse.
Вариант 1: NVIDIA-серверы с большим объёмом VRAM Примеры:
NVIDIA RTX 6000 Ada
- 48 GB VRAM
- ECC
- CUDA
- отличная AI-поддержка
NVIDIA L40S
- 48 GB VRAM
- Серверная карта
- очень эффективна
- оптимизирована под инференцию
NVIDIA H100/H200
- 80 GB / 141 GB HBM
- Enterprise-класс
- очень дорого
Преимущество:
Программная часть отличная.
Недостаток:
Если тебе нужно 128 GB или 192 GB памяти, придётся использовать несколько карт.
Пример:
Server RTX 6000 Ada 48 GB + RTX 6000 Ada 48 GB = 96 GB VRAM
Вариант 2: AMD Instinct Server
Это прямой конкурент от AMD.
Например:
AMD Instinct MI300X
- 192 GB HBM3
- исключительная ширина полосы пропускания
- разработана для больших моделей AI
С технической точки зрения это гораздо лучше подходит для задачи:
“Я хочу держать большие модели локально в памяти.”
Но есть минусы:
- серверное оборудование
- высокое энергопотребление
- значительно дороже
- не предназначена для настольного использования
Вариант 3: Threadripper Pro + GPU
Вероятно, самый интересный вариант рабочей станции.
Пример:
AMD Threadripper Pro
+
<AdSlot position="article-middle" />
256 GB или 512 GB RAM
+
NVIDIA GPU
Например:
- Threadripper Pro 7975WX
- Threadripper Pro 7995WX
Преимущества:
- множество ядер CPU
- ECC RAM
- много PCIe-линий
- возможность установить несколько GPU
Конфигурация:
Workstation
Threadripper Pro
|
+-- RTX 6000 Ada
|
+-- RTX 6000 Ada
|
+-- NVMe Speicher
Получается настоящая “AI-серверная рабочая станция”.
Вариант 4: Apple Mac Studio для сравнения
Интересен тем, что основан на похожей идее:
Unified Memory
Пример:
Apple M3/M4 Ultra:
- до 512 GB Unified Memory
Преимущество:
- возможно работать с очень большими моделями
- исключительно эффективно
Недостаток:
- ограниченная экосистема AI-ПО
- менее гибко, чем Linux
Как видим, сервер в этом ценовом сегменте не является реальной альтернативой.
Детальное сравнение стоимости и пользы найдёшь в KI-Server mieten: lohnt sich ein dedizierter AI-Server?.
Ты хочешь установить NVIDIA GPU в MiniPC с Ryzen AI Max и задаёшься вопросом, удастся ли тебе объединить преимущества обоих подходов? Да, но давай посмотрим, что OCuLink на самом деле означает…
Гибридный подход OCuLink в деталях: что на самом деле означает 4x-подключение
Top AI MiniPC, как уже было сказано, могут вмещать NVIDIA GPU, чтобы получить достаточно VRAM и GPU-мощности.
Поскольку это постоянно вызывает путаницу, вот более подробное объяснение того, что стоит за OCuLink-портом и где находится реальное ограничение.
OCuLink в сущности это просто кабель, который выводит PCIe-соединение наружу. На большинстве Strix-Halo-MiniPC, встроенном или модернизированном через адаптер M.2-к-OCuLink, доступно четыре PCIe-4.0-линии, сокращённо “x4”. Обычная настольная GPU в ПК использует, в свою очередь, 16 линий, “x16”. Это означает, что OCuLink-порт получает только четверть возможной пропускной способности PCIe, примерно 8 GB/s в обе стороны при PCIe 4.0 x4, против около 32 GB/s при полной x16-подключении.
Является ли это реальным узким местом, зависит от типа рабочей нагрузки, и именно здесь часто возникает путаница: ты геймер или разработчик AI?
При обучении или fine-tuning это действительно заметная проблема. Там постоянно нужно отправлять градиенты и активации туда-сюда между памятью CPU и GPU, и узкая x4-подключение значительно замедляет этот обмен данными.
При чистой инференции, то есть при обычном общении с локальной моделью или использовании coding-агента, ситуация иная. Когда модель один раз полностью загружена в VRAM внешней GPU, во время непосредственной генерации токенов практически ничего не должно идти по PCIe-каналу. По соединению передаются только относительно небольшие промежуточные результаты между слоями и входные/выходные токены. Бенчмарки от сообщества это подтверждают: при чистой инференции OCuLink-подключение практически совпадает по производительности с внутренней GPU в пределах погрешности измерения.
Ситуация немного иная, когда модель не помещается целиком в VRAM внешней карты и часть её должна быть выгружена в системную память - так называемое layer-offloading. Тогда при каждом генерируемом токене данные действительно передаются между памятью CPU и GPU, и x4-подключение заметно тормозит. Для твоего применения это означает практически следующее: если модель полностью поместится на подключённую NVIDIA-карту, ты почти ничего не потеряешь из-за OCuLink. Как только ты захочешь использовать модель, которая больше чем VRAM карты и должна быть разделена, APU со своей Unified Memory обычно оказывается лучше, чем offloading-setup через OCuLink.
Второй момент, который часто упускают, это BIOS-ограничение на многих Strix-Halo-платах: внешние AMD-графические карты там независимо от модели жёстко ограничены 120 Ватт. NVIDIA-карты по сообщениям сообщества этим не затронуты, что делает гибридный подход с внешней GPU практически NVIDIA-специфичным решением. Документированный практический тест с RTX 5090, подключённой через OCuLink к Strix-Halo-устройству, показал по сравнению с чистой APU примерно треть более быструю генерацию токенов и почти в два раза более быструю обработку промпта, то есть реальный, заметный прирост несмотря на узкое x4-подключение.
Это означает следующее: ограничение 4x звучит хуже, чем оно есть на практике для чистой инференции. Оно становится актуальным только тогда, когда ты занимаешься обучением, fine-tuning или запускаешь модели, которые больше чем VRAM внешней карты. Для повседневного использования в качестве coding-agent машины гибридный подход это серьёзный вариант, а не костыль. Но, конечно, ты покупаешь столь дорогую графическую карту, чтобы использовать её на 100%. Помимо технических соображений, здесь также играет роль вопрос самоуважения и доверия.
Прямое сравнение: MiniPC vs. NVIDIA DGX Spark vs. Desktop-GPU-PC
| Strix-Halo-Mini-PC (128GB) | NVIDIA DGX Spark | Desktop с RTX 5090 | Desktop с RTX PRO 6000 | |
|---|---|---|---|---|
| Цена | около 2.700 до 4.700 € | около 4.700 $ | около 3.000 до 4.000 € (карта) | от около 20.000 $ (система) |
| Макс. размер модели | 70B+ комфортно | до 200B, 405B в кластере | до около 30B практично | 70B комфортно |
| Ширина полосы памяти | ~256 GB/s | ~273 GB/s | ~1.792 GB/s | ~1.792 GB/s |
| Экосистема | ROCm, молодая, растёт | CUDA, зрелая | CUDA, зрелая | CUDA, зрелая, с ECC |
| Пригодность для настольного использования | Очень хорошо, x86, Windows/Linux | Ограничена, ARM | Очень хорошо | Очень хорошо |
| Пригодность для 24/7 | Хорошо для рабочих станций | Хорошо, низкое потребление | Условно, без ECC | Очень хорошо, ECC, класс рабочей станции |
Моя текущая рекомендация по покупке AI Mini-PC
Для сценария “настольное использование плюс локальные многоагентные рабочие процессы с моделями 70B и кодирующими агентами” я выбрал бы один Ryzen AI Max+ 395 Mini-PC с 128 GB RAM. Кластерная конфигурация имеет смысл только если вам действительно нужны модели класса 235B+, что для большинства многоагентных установок не требуется. Но идея расширения системы гораздо приятнее, чем необходимость её замены.
Среди устройств Strix Halo я отдаю предпочтение Minisforum MS-S1 Max благодаря продуманной системе охлаждения, подключению 10GbE и опциональному, валидированному производителем расширению для кластера и стойки на случай, если вам потом понадобится апгрейд.
GMKtec EVO-X2 — это надёжная альтернатива с более широкой доступностью, если Minisforum с 128 GB временно недоступен. Новенький GMKtec EVO-X3 стоит внимания, если для вас нативный OCuLink порт для будущего расширения eGPU важнее, чем возможность кластеризации, но я бы всё же подождал пару недель независимых тестов в боевых условиях перед использованием в 24/7 продакшене. Устройство было представлено всего несколько дней назад.
От no-name брендов без истории тестирования я бы воздержался для устройства, работающего круглосуточно. Я включил их в подборку магазина Amazon, но ценовая разница небольшая, поэтому имеет смысл остановиться на топовых производителях.
DGX Spark и RTX-PRO-6000-Workstations — правильный выбор для особых случаев типа обязательности CUDA, требований Enterprise или очень больших моделей. Для типичного use-case разработчика с моделями 70B и кодирующими агентами соотношение цены и производительности Mini-PC на базе Strix Halo в настоящий момент трудно превзойти.
Если вы, как я, не можете решить или выбрать между Mini-PC и NVIDIA Desktop, то на мой взгляд гибридный подход на OCuLink — самый интересный компромисс для 2026 года. Использовать все преимущества и выбирать уверенно: Начните с чистого Unified Memory, а при необходимости позже добавьте подержанную RTX 4090 или новую RTX 5090 для более быстрых, компактных моделей, пока большие 70B модели работают через память APU. Это текущая моя конфигурация.
Примечание о прозрачности: Эта статья содержит партнёрские ссылки Amazon. Если вы будете заказывать через эти ссылки, я могу получить комиссию от Amazon. Для вас это не влечёт никаких дополнительных затрат!
AMD Ryzen AI Max+ 395, AMD Halo Developer Platform и новый Ryzen AI Max+ PRO 495, что за этим стоит?
NVIDIA представила DGX Spark. AMD ответила не только новым процессором, но и собственной платформой разработчика — AMD Halo Developer Platform, построенной на базе Ryzen AI Max+ 395.
При этом постоянно возникает один и тот же вопрос.
В чём отличие между AMD Ryzen AI Max+ 395 и AMD Halo Developer Platform?
Краткий ответ: да, оно есть.
Ryzen AI Max+ 395 — это собственно процессор, точнее APU. Он объединяет CPU, GPU и NPU на одном кристалле.
AMD Halo Developer Platform — это завершённый Mini PC, который уже содержит именно этот процессор.
Это аналогично процессору Intel Core. Сам процессор — это только компонент. Полноценная система получается только вместе с материнской платой, памятью, SSD и корпусом. Поскольку Mini PC AMD Halo Developer Platform практически недоступен в Европе, приходится переходить на Minisforum MS-S1 Max 128GB.
Ryzen AI Max+ 395
| Характеристика | Спецификация |
|---|---|
| CPU | 16 ядер, 32 потока |
| Архитектура | Zen 5 |
| интегрированная GPU | Radeon 8060S |
| GPU Compute Units | 40 |
| NPU | XDNA 2 |
| AI производительность | 55 TOPS NPU |
| TDP | 45 до 120 Ватт |
AMD Halo Developer Platform
Developer Platform содержит всё необходимое для AI рабочей станции.
| Компонент | Спецификация |
| Процессор | Ryzen AI Max+ 395 |
| Оперативная память | 128 GB LPDDR5X Unified Memory |
| SSD | 2 TB |
| Сеть | 10 Gigabit Ethernet |
| WLAN | WiFi 7 |
| Операционная система | Windows или Linux |
Собственно вычислительная мощность поступает от Ryzen AI Max+ 395. Developer Platform — это просто полная эталонная система от AMD.
Новый Ryzen AI Max+ PRO 495
Интересным стало появление нового Ryzen AI Max+ PRO 495.
На первый взгляд это похоже на новое поколение. Посмотрев подробнее на технические характеристики, видно, что AMD выпустила скорее refresh.
| Характеристика | PRO 395 | PRO 495 |
| CPU ядра | 16 | 16 |
| Потоки | 32 | 32 |
| Boost | 5,1 GHz | 5,2 GHz |
| Базовая частота | 3,0 GHz | 3,1 GHz |
| L3 Cache | 64 MB | 64 MB |
| GPU | Radeon 8060S | Radeon 8065S |
| Compute Units | 40 | 40 |
| GPU частота | 2900 MHz | 3000 MHz |
| NPU | 55 TOPS | 55 TOPS |
| Unified Memory | до 128 GB | до 192 GB |
Где различия?
CPU и GPU получили небольшой прирост тактовой частоты.
На практике это будет означать примерно три-пять процентов производительности в зависимости от приложения.
Реальное различие в совсем другом месте.
Ryzen AI Max+ PRO 495 поддерживает до 192 GB Unified Memory.
Именно этот момент может быть гораздо интереснее для локальных AI моделей, чем немного более высокие тактовые частоты.
Почему оперативная память так важна?
Многие сначала думают о большей мощности CPU или более быстрой GPU.
Однако для локальных языковых моделей часто именно доступная память определяет, какие модели вообще можно полностью загрузить.
В качестве грубого ориентира:
| Unified Memory | Типичные сценарии использования |
| 64 GB | модели от 7B до примерно 32B |
| 128 GB | модели 70B и более высокие уровни квантизации |
| 192 GB | существенно более крупные модели или несколько моделей одновременно |
Особенно для Ollama этот фактор играет гораздо большую роль, чем 100 MHz дополнительной частоты CPU.
Есть ли уже цены на вариант с 192 GB?
Пока нет.
AMD представила процессор. Однако конкретные системы с 192 GB Unified Memory пока находятся только на стадии объявления.
Известная пока AMD Developer Platform с 128 GB стоит примерно 4000 US Dollar.
Реалистично система с 192 GB должна стоить где-то между 4800 и 5500 евро в зависимости от производителя.
Linux или Windows?
Во время обсуждения возник вопрос о выборе операционной системы.
Хотя AMD позиционирует Developer Platform для Windows и Linux, для большинства разработчиков Linux окажется интереснее.
Причины:
- лучшая поддержка ROCm
- Docker работает без дополнительной виртуализации
- более простое использование контейнеров
- нативная среда разработки
- меньше затрат на ресурсы
Windows остаётся привлекательным, если вам нужны программы, доступные только на этой системе, или если WSL2 уже встроена в ваш рабочий процесс.
Для кого такая система интересна?
Типичный сценарий использования может выглядеть так:
- Ollama
- Windsurf
- OpenWebUI
- Docker
- MCP Server
- Qdrant или Milvus
- несколько локальных агентов
Агенты особенно выигрывают, когда в памяти одновременно находятся несколько моделей.
Например:
- модель для кодирования
- модель общего назначения
- модель для embeddings
- reranker
- модель компьютерного зрения
При 192 ГБ Unified Memory не потребуется постоянно переключаться между моделями.
Могут ли локальные модели заменить Claude?
На обсуждении возник интересный вопрос о том, как локальные модели конкурируют с Claude Sonnet или Claude Opus.
Ответ не очень простой.
Сегодня Claude Sonnet и Opus остаются одними из самых мощных доступных моделей.
Однако локальные 70B модели существенно сократили разрыв.
| Задача | Claude | Локальная 70B модель |
| Кодирование | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Рефакторинг | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Архитектура | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Контент | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
| Немецкий | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐☆ |
*Личное мнение
Расстояние существенно сократилось по сравнению с несколькими годами назад. Но откровенно говоря, даже с простыми SWE1.7 моделями я получаю очень хорошие результаты.
Реалистичный рабочий процесс
Многие, вероятно, не откажутся полностью от облачных моделей.
Гибридный подход сейчас кажется наиболее разумным.
- Локальные модели берут на себя основную часть ежедневной работы.
- Claude или другие облачные модели используются только для особенно сложных задач.
Таким образом удаётся хорошо сбалансировать приватность, стоимость и качество.
Ryzen AI Max+ PRO 495 не совсем новое поколение, а скорее осторожное развитие PRO 395.
Немного более высокие тактовые частоты в повседневной работе почти не заметны.
Основной прогресс кроется в поддержке до 192 ГБ Unified Memory.
Именно этот момент может стать решающим отличием для локальных KI-приложений с Ollama, агентами, Windsurf и несколькими одновременно загруженными моделями.
Лично меня интересует не столько то, что процессор стал на три процента быстрее.
Намного интереснее вопрос, какие новые возможности открываются, когда в компактной рабочей станции впервые доступны 192 ГБ Unified Memory.
Часто задаваемые вопросы
Какое главное преимущество Ryzen AI Max+ 395 для локального KI?
Ryzen AI Max+ 395 предлагает до 128 ГБ Unified Memory, доступной как для CPU, так и для GPU. Это позволяет размещать крупные языковые модели вроде 70B в Q4-квантизации прямо в оперативной памяти без отдельной видеокарты.
Достаточно ли 128 ГБ памяти для 70B-моделей?
Да. 70B-модель в Q4 требует примерно 40-45 ГБ памяти. При 128 ГБ Unified Memory остаётся достаточный буфер для контекста, нескольких загруженных моделей и одновременных сессий агентов.
Почему для LLM пропускная способность памяти важнее, чем TOPS?
При генерации токенов вся модель практически один раз считывается из памяти. Скорость декодирования зависит в первую очередь от пропускной способности памяти, а не от теоретической вычислительной мощности. Значения NPU-TOPS для чистого LLM-инференса практически не имеют значения.
В чём отличие Ryzen AI Max+ 395 от 495?
495 представляет осторожное развитие с немного более высокими тактовыми частотами CPU и GPU ядер. Настоящий прогресс заключается в поддержке до 192 ГБ Unified Memory вместо прежних 128 ГБ.
Является ли NVIDIA DGX Spark лучшей альтернативой?
DGX Spark преуспевает благодаря зрелой экосистеме CUDA, встроенной поддержке NVFP4 и официальному объединению в кластер. Однако его пропускная способность памяти едва ли превышает Strix Halo, и ARM-архитектура ограничивает использование классического настольного ПО. Для чистой десктопной работы с локальным KI часто практичнее x86 мини-ПК.
Можно ли подключить видеокарту NVIDIA к мини-ПК Strix Halo?
Да, через OCuLink или адаптер M.2 в OCuLink. При этом доступны четыре полосы PCIe 4.0 (x4). Для чистого инференса разница в скорости по сравнению с внутренней привязкой x16 практически незаметна.
Какой мини-ПК лучше всего рекомендовать для workflows с несколькими агентами?
Для сценария “десктоп плюс локальные мультиагенты с 70B-моделями” я рекомендую Minisforum MS-S1 Max с 128 ГБ благодаря охлаждению, 10GbE и опциональной поддержке кластеризации. GMKtec EVO-X2 является более доступной альтернативой.
Имеет ли смысл кластер из двух устройств Ryzen AI Max?
Кластер окупается только начиная с класса моделей 235B+, например для DeepSeek-R1 671B. Для типичных 70B или более компактных MoE-моделей обычно достаточно одного 128-ГБ устройства.
Linux или Windows для Ryzen AI Max+ 395?
Возможны оба варианта. Linux предоставляет наибольшую гибкость для KI-инструментов вроде Ollama и llama.cpp, в то время как Windows удобнее для повседневной работы с обычным программным обеспечением.
Сколько стоит приличный KI-мини-ПК с 128 ГБ?
Надёжная система на базе Strix Halo с 128 ГБ обычно стоит между 3000 и 5000 евро в зависимости от производителя и оснащения. NVIDIA DGX Spark начинается примерно с 4700 евро.
Дополнительно: Если вы хотите сразу начать работать с многоагентными системами на локальном KI-ПК, в статье Multi-Agenten-Frameworks: LangGraph, CrewAI und OpenClaw im Vergleich найдёте практический обзор.


