Большой тест локальных нейросетей и моделей ИИ (LLM): Рейтинг, скорость и требования к серверам | Endpoint
✓ Ссылка скопирована в буфер обмена!
Открытое исследование инженеров Endpoint

Большой тест локальных нейросетей и моделей ИИ: Качество, скорость и задачи

Субъективный и практический тест 17 открытых моделей ИИ и локальных нейросетей (от 8.5B до 228B параметров) по 22 боевым сценариям: DevOps, генерация кода, аудит безопасности, 1С-администрирование, анализ длинного контекста (60k) и Tool Use на инференс-сервере llama.cpp.

Endpoint R&D Lab
Живой рейтинг

База знаний и рейтинг моделей

Мы непрерывно тестируем новые версии открытых нейросетей, замеряем реальную скорость инференса и делимся инженерными выводами. Пользуйтесь результатами для выбора моделей и конфигураций серверов.

Моделей: 17 LLM
Сценариев: 22 теста
Инференс: llama.cpp
Платформа: M3 Ultra
Август 2026 • R&D Lab
Лидер по качеству
4.25 / 5.0
Gemma 4 31B IT (Q8)
Высшая точность в коде и инструкциях
Лидер по скорости
117.3 t/s
GPT-OSS 20B (Q4)
Максимальная скорость вывода
Лучший баланс
4.09 | 93.1 t/s
Gemma 4 26B MTP (Q8)
Опережает 120B при 93 токенах/сек
Масштаб теста
17 LLM / 22 теста
Реальные бизнес-кейсы
DevOps, 1С, RAG 60k, Tool Use

Качество vs Скорость: Парадокс размера модели

По оси X — скорость генерации (токенов/сек), по оси Y — итоговый балл качества (из 5.0). Размер пузыря отражает размерность нейросети (число параметров в миллиардах, B).

💡 Наведите на пузырь, чтобы увидеть название модели, баллы, скорость и размерность (число параметров).
Gemma 4 Qwen DeepSeek MiniMax GPT-OSS

🔍 Главный инженерный инсайт: Почему размер не равен интеллекту?

Наш тест наглядно опровергает распространенный миф о том, что «чем больше параметров у модели, тем она качественнее решает задачи». Модели компактного и среднего класса (Gemma 4 31B и Gemma 4 26B) набрали средний балл 4.09–4.25, уверенно опередив таких гигантов, как MiniMax 228B (3.72 балла) и Qwen 122B (3.40 балла).

При этом гиганты требуют от 112 до 237 ГБ памяти и работают на скорости 38–41 токенов/с, в то время как Gemma 4 26B A4B MTP требует всего 27 ГБ RAM и выдает ошеломляющие 93.1 токенов/с благодаря архитектуре Multi-Token Prediction (MTP).

В каких задачах какие LLM показывают лучший результат

Выберите категорию, чтобы увидеть рейтинг моделей и инженерные комментарии по специфике задач:

Рейтинг моделей: Все категории (Общий средний балл)

Общий зачет

Общая картина

По совокупности 22 тестов лидирует Gemma 4 31B IT Q8 с баллом 4.25. Второе место занимает Gemma 4 26B A4B MTP Q8 (4.09 балла), которая благодаря спекулятивному выводу превосходит конкурентов по скорости в 4.5 раза.

Топ-3 модели в этой дисциплине:
  1. Gemma 4 31B IT Q8 — 4.25
  2. Gemma 4 26B A4B MTP Q8 — 4.09
  3. Gemma 4 31B IT QAT MTP — 4.08

Метрики скорости инференса и потребление памяти

Сравнение скорости генерации (t/s выход), скорости обработки промпта (t/s вход) и требуемого объема VRAM/RAM:

Скорость генерации (Tokens/sec Выход)

Скорость обработки промпта (Tokens/sec Вход)

Полная таблица результатов всех 17 моделей

Кликните по заголовку для сортировки или воспользуйтесь живым поиском:

Показано моделей: 17 из 17
№ ⬍ Модель ⬍ Квант ⬍ RAM (GB) ⬍ t/s Выход ⬍ Think % ⬍ Итог / 5.0 ⬍ Код ⬍ DevOps ⬍ 1С ⬍ 60k Лог ⬍ Tool Use ⬍
1 gemma4_31b_it_q8 Q8_0 31.0 ГБ 19.0 33.4% 4.25 4.60 3.71 3.58 3.36 3.84
2 gemma4_26b_a4b_mtp_q8 Q8_0 27.0 ГБ 93.1 37.3% 4.09 4.34 3.72 3.06 1.90 4.80
3 gemma4_31b_it_qat_mtp Q4_0 (QAT) 17.0 ГБ 23.3 32.9% 4.08 4.52 3.72 3.70 3.60 3.82
4 gemma4_26b_a4b_q8_us Q8_0 26.0 ГБ 83.5 37.8% 3.97 4.55 3.49 2.77 2.71 4.83
5 deepseek_v4_flash_0731_q8kxl UD-Q8_K_XL 162.0 ГБ 29.3 31.3% 3.92 4.32 3.35 2.66 2.79 4.60
6 qwen36_35b_a3b_q8 Q8_0 37.0 ГБ 76.6 41.6% 3.87 3.96 3.14 2.10 3.41 4.49
7 gemma4_26b_uncensored_q8 Q8_K_P 27.0 ГБ 79.2 37.8% 3.87 3.52 3.34 2.36 2.86 4.50
8 qwen36_35b_a3b_lora_q8 Q8_0 + LoRA 37.0 ГБ 61.8 40.5% 3.85 3.55 2.99 1.84 3.19 4.64
9 qwen38_27b_bf16 BF16 51.0 ГБ 12.8 28.2% 3.80 3.96 3.13 2.49 3.13 4.75
10 gemma4_12b_it_mtp_bf16 BF16 24.0 ГБ 54.0 38.3% 3.79 3.72 3.51 3.24 0.07 4.11
11 qwen36_35b_a3b_mtp_q8 Q8_0 38.0 ГБ 90.8 42.0% 3.73 4.01 2.90 2.42 2.65 4.24
12 minimax27_q6_k_xl UD-Q6_K_XL 237.0 ГБ 41.9 23.4% 3.72 4.01 3.18 2.59 2.69 3.92
13 qwen38_27b_bf16_mtp BF16 51.0 ГБ 22.8 27.3% 3.65 3.71 2.96 2.56 2.71 4.72
14 gpt_oss_120b_q6 UD-Q6_K_XL 63.0 ГБ 82.0 22.8% 3.58 4.45 3.04 2.46 2.21 4.37
15 qwen35_122b_us_q8_0 Q8_0 130.0 ГБ 38.1 42.1% 3.40 3.73 2.78 2.28 2.12 3.59
16 minimax_abliterated_q4 Q4_K_M 112.0 ГБ 50.7 23.1% 3.28 2.04 3.52 2.33 2.60 3.82
17 gpt_oss_20b_q4 Q4_K_M 11.0 ГБ 117.3 34.7% 3.17 4.21 2.71 2.04 0.62 3.69

Разбор и вердикты инженеров по каждой модели

Сильные и слабые стороны, лучшие и худшие тесты, а также рекомендации по внедрению:

Аппаратный стенд тестирования и 22 боевых сценария

Полная прозрачность и воспроизводимость: конфигурация тестового сервера и описание практических задач:

Тестовый стенд

Аппаратная конфигурация и сервер инференса

⚡ Сервер инференса
llama.cpp
Нативная компиляция с Metal API, поддержка MTP и спекулятивного декодирования токенов.
🖥 Аппаратная платформа (Hardware)
Apple Mac Studio (Mac15,14)
Процессор: Apple M3 Ultra
CPU Cores: 28 ядер (20 Performance + 8 Efficiency)
⚙️ Операционная система (OS)
macOS 26.1 (Build 25B78)
Ядро: Darwin 25.1.0
Локация / Timezone: UTC+5 (Almaty, Казахстан)

Группа A & B: Стиль и Скрипты

  • A1 Стиль ответа: Четкость формулировок без лишней "воды".
  • A2 Отступы YAML: Валидность синтаксиса конфигураций k8s/ansible.
  • B1 Bash safe script: Безопасность shell-скриптов с `set -euo pipefail`.

Группа C & D: Архитектура и Баги

  • C1-C2: Поиск тонких багов в bash и ACL правилах HAProxy.
  • D1-D2: Диагностика сетей Docker и аварийного падения PostgreSQL.
  • D3-D6: GlusterFS deadlock, Jinja tool-call, Redis сокеты.

Группа E, K & G: RAG, 1С и Агенты

  • E1 Контекст 60k: Поиск критической ошибки в огромном лог-файле.
  • K1-K2 1С: Диагностика кластера RAC и связки Apache + SELinux.
  • G1-G2 Tool Use: Безопасный выбор функций и отказ от опасных вызовов.

Часто задаваемые вопросы по выбору и запуску локальных LLM

Краткие и точные ответы инженеров на ключевые вопросы по выбору открытых нейросетей:

Абсолютным лидером по совокупному качеству стала модель Gemma 4 31B IT (Q8) со средним баллом 4.25 из 5.0. Она продемонстрировала наивысшую точность в генерации кода (4.60), следовании инструкциям (5.0) и ревью архитектуры (4.24).

Максимальную скорость вывода показала модель GPT-OSS 20B (Q4)117.3 токенов/сек. Однако в категории сбалансированных моделей с высоким качеством побеждает Gemma 4 26B A4B MTP (Q8) со скоростью 93.1 токенов/сек и оценкой 4.09 балла благодаря технологии Multi-Token Prediction.

Нет, результаты нашего масштабного исследования из 22 тестов опровергают эту гипотезу. Модели среднего размера на 26B и 31B параметров (Gemma 4) набрали 4.09–4.25 балла, уверенно превзойдя гигантские модели MiniMax 228B (3.72 балла) и Qwen 122B (3.40 балла), требующие свыше 130–237 ГБ памяти.

В специализированных тестах по 1С-администрированию лидерами стали Gemma 4 31B IT QAT MTP (3.70 балла) и Gemma 4 31B IT Q8 (3.58 балла). Большинство остальных моделей (включая Qwen и MiniMax) провалили тесты из-за галлюцинаций в синтаксисе параметров утилиты `rac`.

В стресс-тесте E1 на поиск критической аварии среди 60k токенов логов лидируют Gemma 4 31B IT QAT MTP (3.60 балла) и Qwen 3.6 35B Q8 (3.41 балла). Модели с малым или нестабильным контекстом (Gemma 12B, GPT-OSS 20B) показали оценку ниже 0.6 балла.

Тестирование проводилось инженерами R&D лаборатории Endpoint на рабочей станции Apple Mac Studio (Apple M3 Ultra, 28 CPU ядер, Metal API) под управлением macOS 26.1 с использованием сервера инференса llama.cpp.

Требования к памяти варьируются от 11 ГБ (для легких моделей вроде GPT-OSS 20B Q4) и 17–31 ГБ (для лидеров рейтинга Gemma 4 31B/26B) до 130–237 ГБ (для сверхтяжелых моделей Qwen 122B и MiniMax 228B).
🛡️ Авторское право Endpoint Цитирование только со ссылкой на первоисточник

Правила цитирования и использования данных

Все материалы исследования, сводные таблицы и результаты замеров принадлежат R&D лаборатории Endpoint. Разрешается свободное цитирование фрагментов данных в аналитических обзорах, отраслевых отчетах, публикациях и презентациях при обязательном указании авторства и наличии прямой активной ссылки на первоисточник. Присвоение результатов и публикация без указания авторства запрещены.

Markdown (для статей и блогов)
[Большой тест локальных LLM: Рейтинг 17 моделей (Endpoint)](https://endpoint.kz/best-local-llm/)
BibTeX (для научных публикаций)
@misc{endpoint2026llm,
  author = {Endpoint R&D Lab},
  title = {Local LLM Benchmark 2026: Speed, Quality and Practical SRE Tasks},
  year = {2026},
  url = {https://endpoint.kz/best-local-llm/}
}
💡 Подбор сервера или рабочей станции под выбранную LLM

Планируете развернуть одну из протестированных моделей локально? Инженеры Endpoint бесплатно рассчитают необходимую конфигурацию GPU (NVIDIA RTX PRO 6000, RTX PRO 5000 или H200 NVL), объем памяти и серверную платформу под ваш бюджет и нагрузку.