Локальная нейросеть.
Без облака.
Bonsai 27B — большая языковая модель, которую можно запустить прямо на своём компьютере. Она читает твой запрос, обрабатывает его и генерирует ответ на твоём железе. Интернет для самой генерации не нужен.
Как работает модель
Она не «ищет готовый ответ в интернете». Модель вычисляет, какой следующий кусочек текста должен появиться после твоего запроса.
Ты пишешь запрос
Например: «Объясни мне, что такое Docker простыми словами».
Текст превращается в токены
Компьютер разбивает текст на небольшие элементы, с которыми умеет работать модель.
Модель считает
Видеокарта выполняет огромное количество математических операций над параметрами модели.
Появляется ответ
Модель последовательно выбирает следующие токены. Поэтому ответ появляется постепенно.
Что в компьютере действительно важно?
Для быстрого ответа ключевыми ресурсами являются вычислительная мощность GPU и достаточный объём видеопамяти.
Приоритет комплектующих
Не все детали компьютера одинаково влияют на скорость LLM.
Сколько ресурсов требуется модели?
Потребление памяти зависит прежде всего от способа хранения модели и выбранной точности.
Как сделать так, чтобы она отвечала быстрее
Сначала убираем очевидные узкие места, а уже потом начинаем экспериментировать с настройками.
Держать модель на видеокарте
Чем больше вычислений выполняет GPU, тем меньше приходится ждать CPU. Для NVIDIA используется CUDA.
Не переполнять VRAM
Если памяти не хватает, приходится переносить часть работы в RAM. Это может заметно замедлить генерацию.
Не делать огромный контекст без причины
Чем больше текста модель должна держать в памяти, тем больше расход VRAM и вычислений.
Использовать экономный KV-cache
Кэш контекста занимает память. Более компактный формат кэша позволяет держать длинные диалоги.
Speculative decoding
Маленькая модель предлагает несколько токенов, а основная проверяет их. В подходящих сценариях это ускоряет генерацию.
Две видеокарты — не всегда быстрее
Две дешёвые карты полезны для параллельных задач или нескольких моделей. Для одного запроса обмен между GPU может съесть часть выгоды.
Что собрать на разные бюджеты
Цены ориентировочные: российский рынок видеокарт и особенно вторичка сильно меняются. Здесь важнее понять принцип сборки, чем цепляться за конкретные 2–3 тысячи рублей.
Чем отличается 12 ГБ от 24 ГБ?
Это один из самых важных моментов перед покупкой видеокарты.
| Вариант | Что это означает | Для чего подходит |
|---|---|---|
| 12 GB VRAM | Модель должна быть достаточно компактной, чтобы вместе с рабочей памятью поместиться в видеопамять. | Компактные языковые модели, базовые AI-задачи и небольшой поток запросов. |
| 16 GB VRAM | Больше свободы, но некоторые большие модели всё ещё придётся ужимать или частично переносить в RAM. | Средние модели, изображения, RAG, эксперименты. |
| 24 GB VRAM | Большой запас для локальных LLM. Можно запускать гораздо более тяжёлые 4-bit модели. | Большие LLM, длиннее контекст, несколько серьёзных сценариев. |
| 32 GB+ | Уже начинается территория универсальных AI-станций. | Очень большие модели, тяжёлый контекст, несколько моделей и другие AI-задачи. |
Рекомендации для корпоративной инфраструктуры
Начальный уровень
RTX 3060 12 GB + Ryzen 7 + 32/64 GB RAM. Подходит для развёртывания одной компактной модели и небольшого количества пользователей.
Около 200 тыс. ₽
RTX 3090 24 GB б/у + Ryzen 9 + 64 GB RAM. Подходит для более тяжёлых моделей, увеличенного контекста и нескольких параллельных задач.
Откуда цифры
Требования и особенности Bonsai: Bonsai Demo · модели: Hugging Face. Цены в документе — ориентиры российского рынка, а не фиксированный прайс.