NVIDIA Blackwell Workstation

NVIDIA RTX PRO 6000 Blackwell

Интеллект без границ. Профессиональная платформа с 96 ГБ GDDR7. Рекордная эффективность инференса LLM для ваших задач.

Архитектура Blackwell: Прыжок в эпоху ИИ-агентов

Blackwell — это первая архитектура, созданная NVIDIA специально для масштабирования генеративного ИИ. Второе поколение Transformer Engine нативно поддерживает формат FP4, что позволяет моделям работать до 2.2 раз быстрее без потери точности.

Для инженеров и дата-сайентистов в Казахстане это означает возможность деплоя систем уровня Llama 3.3 (70B), Qwen 3.6 (72B) или Qwen 3.8-27B локально, сохраняя полную конфиденциальность данных.

  • 🚀 96 ГБ GDDR7: Удвоенный объем памяти для самых тяжелых контекстов.
  • 1.5 PetaFLOPs: Пиковая ИИ-производительность в одном слоте.
  • 💎 GDDR7: Пропускная способность памяти до 2.5 ТБ/с для мгновенного отклика.

96 ГБ Памяти

96 ГБ VRAM позволяют держать в памяти модели класса 70B–72B (например, Qwen 3.6 72B или Llama 3.3 70B под FP8/INT8 квантованием) на одной видеокарте.

FP4 Precision

Новый стандарт вычислений: в 2 раза больше данных в памяти при сохранении производительности.

ROI Лидер

Стоимость одного токена на 30% ниже, чем при использовании облачных инстансов H100.

Форм-фактор под любой сценарий

Workstation Edition

Workstation Edition

Активное охлаждение. Золотой стандарт для тихих R&D отделов и локальной разработки.

Server Edition

Server Edition

Пассивный дизайн. Спроектирована для высокоплотных серверных стоек с мощным продувом.

Max-Q Edition

Max-Q Workstation

Энергоэффективность. Позволяет ставить до 8 GPU в рамках одной системы без перегрева.

ServeTheHome (STH)

«RTX 6000 Blackwell — это фактический убийца H100 в задачах локального инференса. Больше памяти и лучший ROI для бизнеса».

Reddit LocalLLaMA

«96 ГБ VRAM меняют всё. Теперь мы запускаем Llama 3.3 70B / Qwen 3.6 72B на одной карте без потерь. Это новый золотой стандарт».

Производительность инференса LLM

Скорость генерации (Llama 3.3 70B / Qwen 3.6 72B, токенов/сек)

* Скорость инференса на одного пользователя.

Эффективность владения (TCO / ROI)

Стоимость владения за 1 млн токенов (к облаку H100)

* Относительный индекс затрат (чем ниже, тем выгоднее).

Конфигурации и варианты применения RTX PRO 6000 Blackwell

Сравнение различных архитектурных подходов для локального запуска больших языковых моделей (LLM) и задач машинного обучения в зависимости от масштаба компании.

Класс решения Характеристики Целевые задачи и инференс Llama 3.3 70B Технические особенности
Кастомный ПК Базовый уровень 2x GeForce RTX 5090 32GB
VRAM: 64 ГБ GDDR7 (суммарно)
TDP: ~1200 Вт
Неудобно для крупных моделей

Модель Llama 3.3 70B / Qwen 3.6 72B (INT8) требует от 78 ГБ VRAM, поэтому не помещается в 64 ГБ памяти. Приходится запускать сжатые 4-битные квантования (с потерей точности) или выносить часть слоев на CPU, что снижает скорость до <2-3 токенов/сек. Подходит для мелких моделей (8B/13B/27B).

Нет физического NVLink. Драйверы потребительских карт блокируют vGPU (виртуальное разделение). Задачи нельзя легко распараллелить — деление ресурсов идет по принципу «одна задача — одна физическая карта», что требует сложной настройки CUDA-конвейера (Tensor Parallelism). Риск перегрева в ПК.
Рабочая станция Сбалансированное 1x RTX PRO 6000 Blackwell
VRAM: 96 ГБ GDDR7
TDP: 600 Вт (Workstation Edition)
Оптимально для одной LLM

Квантованная модель (Llama 3.3 70B / Qwen 3.6 72B INT8) полностью умещается в VRAM одной карты. Выдает стабильные 15–20 токенов/сек. Система работает плавно и без задержек.

Готовое бесшумное решение для офиса «из коробки». Нативная поддержка Ollama, vLLM и TensorRT-LLM без костылей и сложного кода. Подключается к обычной розетке 220V, не требует серверной комнаты.
Сервер 2U Корпоративный класс 2x RTX PRO 6000 Blackwell
VRAM: 192 ГБ GDDR7 (суммарно)
TDP: 2x 300 Вт (Max-Q) или 2x 600 Вт
Многопоточный инференс

Позволяет запускать Llama 3.3 70B в чистом формате FP16 без сжатия или ускорять инференс до 40+ токенов/сек при INT8 тензорном распараллеливании. Подходит для дообучения (QLoRA) и запуска ИИ-агентов.

Установка в стойку ЦОД или серверную комнату. Контролируемый тепловой пакет (Max-Q исполнение на 300 Вт). Полная отказоустойчивость, поддержка удаленного управления IPMI, горячая замена дисков и блоков питания.
Сервер 4U+ Supercomputing 8x RTX PRO 6000 Blackwell
VRAM: 768 ГБ GDDR7 (суммарно)
TDP: до 4800 Вт (только GPU)
Параллельные 70B потоки / MoE

Разработан для высоконагруженных систем инференса, запуска нескольких параллельных копий Llama 3.3 70B / Qwen 3.6 72B или распределенной работы с Llama 4 Scout. Обеспечивает отказоустойчивость и максимальную скорость генерации при сотнях одновременных запросов.

Шина PCIe Gen5 с максимальной пропускной способностью между картами. Резервируемые блоки питания от 3000 Вт до 6000 Вт (требуется 3-фазное питание). Размещается исключительно в ЦОД.
Внимание покупателям

Остерегайтесь серого импорта и фальсификата на рынке GPU

Дефицит и восстановленные чипы

Рынок ускорителей NVIDIA Blackwell испытывает острый дефицит. Под видом новых карт нередко предлагаются восстановленные (refurbished) чипы после тяжелого майнинга, перепаянные компоненты памяти или старые платы с перепрошитым модифицированным BIOS.

Экспортный контроль и таможня

Графические процессоры RTX PRO 6000 относятся к технологиям двойного назначения и подлежат строгому экспортному контролю. Импорт в РК требует лицензий, оформления ГТД и валютного контроля. «Серый» ввоз ведет к конфискации оборудования или потере гарантии.

Endpoint осуществляет исключительно легальные прямые поставки профессионального оборудования в Республику Казахстан с полным пакетом необходимых документов и предоставляет официальную авторизованную гарантию.

💡 Возможность отдельного приобретения GPU

Графические ускорители NVIDIA RTX PRO 6000 Blackwell доступны к заказу как в виде отдельных комплектующих для интеграции в ваши серверы, так и в составе готовых конфигураций рабочих станций и серверов Endpoint. Наша компания осуществляет прямые поставки с полным пакетом закрывающих документов (работа с НДС) и предоставляет официальную гарантию на территории Республики Казахстан.

Сравнение: RTX PRO 6000 vs 5000 Blackwell

Хотите узнать, как флагманская RTX PRO 6000 (96GB) сопоставляется с младшей RTX PRO 5000 (48GB / 72GB)? Читайте наше подробное аналитическое исследование с графиками производительности инференса, расчетом совокупной стоимости владения (TCO) и окупаемости (ROI).

Часто задаваемые вопросы о NVIDIA RTX PRO 6000 Blackwell

NVIDIA RTX PRO 6000 Blackwell базируется на новой графической архитектуре Blackwell. Она оснащена вторым поколением тензорных ядер Transformer Engine, которые аппаратно ускоряют вычисления в форматах FP4 и FP6. Это обеспечивает двухкратное превосходство в скорости инференса и обучения больших языковых моделей (LLM) по сравнению с RTX 6000 Ada Generation при аналогичном энергопотреблении.

Карта оснащается 96 ГБ сверхбыстрой видеопамяти GDDR7 с поддержкой кода коррекции ошибок (ECC), что в два раза больше, чем у карт предыдущего поколения (48 ГБ у RTX 6000 Ada). Такой объем памяти позволяет загружать тяжелые нейросети, работать со сверхразрешением в 3D-рендеринге и выполнять сложные симуляции без необходимости разбивать данные на части.

Нет, физический разъем NVLink отсутствует в профессиональных видеокартах серий Ada Lovelace и Blackwell. Объединение ресурсов нескольких карт в системе для распределенных вычислений и запуска больших ИИ-моделей осуществляется программно на уровне фреймворков (PyTorch, DeepSpeed, TensorRT-LLM) через шину PCIe Gen 5.

Каждая видеокарта RTX PRO 6000 Blackwell имеет TDP около 300-600 Вт. Для стабильной работы рабочей станции с 2 или 4 такими картами требуется блок питания мощностью от 1300 Вт до 3200 Вт серверного класса, качественная вентиляция корпуса и поддержка материнской платы с достаточным количеством линий PCIe 5.0 x16. Компания Endpoint предлагает полностью собранные и протестированные под нагрузкой конфигурации рабочих станций.