LOCAL AI / GUIDE
Bonsai 27B · простое объяснение

Локальная нейросеть.
Без облака.

Bonsai 27B — большая языковая модель, которую можно запустить прямо на своём компьютере. Она читает твой запрос, обрабатывает его и генерирует ответ на твоём железе. Интернет для самой генерации не нужен.

Главное: название «27B» звучит страшно, но Bonsai использует очень компактное представление весов. Поэтому для неё не обязательно покупать топовую видеокарту.
01 / Как это работает

Как работает модель

Она не «ищет готовый ответ в интернете». Модель вычисляет, какой следующий кусочек текста должен появиться после твоего запроса.

01

Ты пишешь запрос

Например: «Объясни мне, что такое Docker простыми словами».

02

Текст превращается в токены

Компьютер разбивает текст на небольшие элементы, с которыми умеет работать модель.

03

Модель считает

Видеокарта выполняет огромное количество математических операций над параметрами модели.

04

Появляется ответ

Модель последовательно выбирает следующие токены. Поэтому ответ появляется постепенно.

02 / Железо

Что в компьютере действительно важно?

Для быстрого ответа ключевыми ресурсами являются вычислительная мощность GPU и достаточный объём видеопамяти.

Приоритет комплектующих

Не все детали компьютера одинаково влияют на скорость LLM.

ВидеокартаОсновная вычислительная работаОЧЕНЬ ВАЖНО
VRAMЗдесь хранятся модель и рабочая памятьОЧЕНЬ ВАЖНО
ОперативкаНужна системе и моделям при загрузкеВАЖНО
ПроцессорОсобенно важен, если часть модели считает CPUСРЕДНЕ
SSDУскоряет запуск и загрузку моделейМАЛО

Сколько ресурсов требуется модели?

Потребление памяти зависит прежде всего от способа хранения модели и выбранной точности.

1-bitВес модели ≈ 3.5–4 ГБ
Ternary / Q2Вес модели ≈ 6.7–7 ГБ
4-bitВес модели ≈ 16 ГБ
Вывод: для Bonsai 27B 12 ГБ VRAM уже дают рабочий запас для компактных вариантов. 24 ГБ — большой запас и возможность использовать более тяжёлые модели.
03 / Ускорение

Как сделать так, чтобы она отвечала быстрее

Сначала убираем очевидные узкие места, а уже потом начинаем экспериментировать с настройками.

GPU

Держать модель на видеокарте

Чем больше вычислений выполняет GPU, тем меньше приходится ждать CPU. Для NVIDIA используется CUDA.

VR

Не переполнять VRAM

Если памяти не хватает, приходится переносить часть работы в RAM. Это может заметно замедлить генерацию.

CTX

Не делать огромный контекст без причины

Чем больше текста модель должна держать в памяти, тем больше расход VRAM и вычислений.

KV

Использовать экономный KV-cache

Кэш контекста занимает память. Более компактный формат кэша позволяет держать длинные диалоги.

SD

Speculative decoding

Маленькая модель предлагает несколько токенов, а основная проверяет их. В подходящих сценариях это ускоряет генерацию.

2×

Две видеокарты — не всегда быстрее

Две дешёвые карты полезны для параллельных задач или нескольких моделей. Для одного запроса обмен между GPU может съесть часть выгоды.

04 / Сборки

Что собрать на разные бюджеты

Цены ориентировочные: российский рынок видеокарт и особенно вторичка сильно меняются. Здесь важнее понять принцип сборки, чем цепляться за конкретные 2–3 тысячи рублей.

≈ 100 тыс.≈ 200 тыс.≈ 300 тыс.≈ 500 тыс.
Бюджетная≈ 100 000 ₽
Начальная конфигурация для локального запуска языковой модели и небольшого числа одновременных запросов.
~95–110k ₽ориентир
GPURTX 3060 12 GB — в первую очередь смотреть вторичку
CPU / RAMRyzen 7 7700 + 32–64 GB DDR5
ОстальноеB650, NVMe 1 TB, БП 650–750 W
Универсальная≈ 200 000 ₽
Универсальная конфигурация с большим запасом видеопамяти для более тяжёлых моделей и увеличенного контекста.
~180–210k ₽ориентир
GPURTX 3090 24 GB — выгоднее искать б/у
CPU / RAMRyzen 9 7900 + 64 GB DDR5
ОстальноеB650, NVMe 2 TB, качественный БП 850 W+
Мощная≈ 300 000 ₽
Производительная рабочая станция для нескольких моделей, параллельных задач и интенсивной нагрузки.
~280–330k ₽ориентир
GPURTX 5080 16 GB или выгодная 24 GB б/у карта
CPU / RAMRyzen 9 7900/9950X + 64–128 GB
Остальное2–4 TB NVMe, хороший БП, мощное охлаждение
AI workstation≈ 500 000 ₽
Высокопроизводительная рабочая станция для корпоративного применения: LLM, RAG, генерация контента и параллельные AI-задачи.
~450–550k ₽очень зависит от GPU
GPURTX 5090 32 GB
CPU / RAMRyzen 9 9950X + 128 GB DDR5
ОстальноеX870/X870E, NVMe 4 TB, БП 1200 W+
Главный принцип выбора: если твоя единственная цель — Bonsai 27B, не обязательно тратить 500 тысяч. В районе 100 тысяч уже можно собрать рабочую машину. Около 200 тысяч появляется большой запас по VRAM. 300–500 тысяч имеют смысл, если ПК будет использоваться и для других тяжёлых моделей.
05 / Для новичка

Чем отличается 12 ГБ от 24 ГБ?

Это один из самых важных моментов перед покупкой видеокарты.

ВариантЧто это означаетДля чего подходит
12 GB VRAMМодель должна быть достаточно компактной, чтобы вместе с рабочей памятью поместиться в видеопамять.Компактные языковые модели, базовые AI-задачи и небольшой поток запросов.
16 GB VRAMБольше свободы, но некоторые большие модели всё ещё придётся ужимать или частично переносить в RAM.Средние модели, изображения, RAG, эксперименты.
24 GB VRAMБольшой запас для локальных LLM. Можно запускать гораздо более тяжёлые 4-bit модели.Большие LLM, длиннее контекст, несколько серьёзных сценариев.
32 GB+Уже начинается территория универсальных AI-станций.Очень большие модели, тяжёлый контекст, несколько моделей и другие AI-задачи.
06 / Итог

Рекомендации для корпоративной инфраструктуры

Начальный уровень

RTX 3060 12 GB + Ryzen 7 + 32/64 GB RAM. Подходит для развёртывания одной компактной модели и небольшого количества пользователей.

Около 200 тыс. ₽

RTX 3090 24 GB б/у + Ryzen 9 + 64 GB RAM. Подходит для более тяжёлых моделей, увеличенного контекста и нескольких параллельных задач.

Источники

Откуда цифры

Требования и особенности Bonsai: Bonsai Demo · модели: Hugging Face. Цены в документе — ориентиры российского рынка, а не фиксированный прайс.