Субъективный и практический тест 17 открытых моделей ИИ и локальных нейросетей (от 8.5B до 228B параметров) по 22 боевым сценариям: DevOps, генерация кода, аудит безопасности, 1С-администрирование, анализ длинного контекста (60k) и Tool Use на инференс-сервере llama.cpp.
Мы непрерывно тестируем новые версии открытых нейросетей, замеряем реальную скорость инференса и делимся инженерными выводами. Пользуйтесь результатами для выбора моделей и конфигураций серверов.
По оси X — скорость генерации (токенов/сек), по оси Y — итоговый балл качества (из 5.0). Размер пузыря отражает размерность нейросети (число параметров в миллиардах, B).
Наш тест наглядно опровергает распространенный миф о том, что «чем больше параметров у модели, тем она качественнее решает задачи». Модели компактного и среднего класса (Gemma 4 31B и Gemma 4 26B) набрали средний балл 4.09–4.25, уверенно опередив таких гигантов, как MiniMax 228B (3.72 балла) и Qwen 122B (3.40 балла).
При этом гиганты требуют от 112 до 237 ГБ памяти и работают на скорости 38–41 токенов/с, в то время как Gemma 4 26B A4B MTP требует всего 27 ГБ RAM и выдает ошеломляющие 93.1 токенов/с благодаря архитектуре Multi-Token Prediction (MTP).
Выберите категорию, чтобы увидеть рейтинг моделей и инженерные комментарии по специфике задач:
По совокупности 22 тестов лидирует Gemma 4 31B IT Q8 с баллом 4.25. Второе место занимает Gemma 4 26B A4B MTP Q8 (4.09 балла), которая благодаря спекулятивному выводу превосходит конкурентов по скорости в 4.5 раза.
Сравнение скорости генерации (t/s выход), скорости обработки промпта (t/s вход) и требуемого объема VRAM/RAM:
Кликните по заголовку для сортировки или воспользуйтесь живым поиском:
Сильные и слабые стороны, лучшие и худшие тесты, а также рекомендации по внедрению:
Полная прозрачность и воспроизводимость: конфигурация тестового сервера и описание практических задач:
Краткие и точные ответы инженеров на ключевые вопросы по выбору открытых нейросетей:
Все материалы исследования, сводные таблицы и результаты замеров принадлежат R&D лаборатории Endpoint. Разрешается свободное цитирование фрагментов данных в аналитических обзорах, отраслевых отчетах, публикациях и презентациях при обязательном указании авторства и наличии прямой активной ссылки на первоисточник. Присвоение результатов и публикация без указания авторства запрещены.
[Большой тест локальных LLM: Рейтинг 17 моделей (Endpoint)](https://endpoint.kz/best-local-llm/)
@misc{endpoint2026llm,
author = {Endpoint R&D Lab},
title = {Local LLM Benchmark 2026: Speed, Quality and Practical SRE Tasks},
year = {2026},
url = {https://endpoint.kz/best-local-llm/}
}
Планируете развернуть одну из протестированных моделей локально? Инженеры Endpoint бесплатно рассчитают необходимую конфигурацию GPU (NVIDIA RTX PRO 6000, RTX PRO 5000 или H200 NVL), объем памяти и серверную платформу под ваш бюджет и нагрузку.