← Все статьи

ПК для локальной нейросети: сколько видеопамяти нужно LLM 8B, 32B и 70B

автор
Мастерская GSPC, Москва
чтение
10 мин
опубликовано
29 сентября 2026
обновлено
29 сентября 2026

ПК для локальной нейросети выбирают по видеопамяти: в неё должны влезть вес модели и контекст разговора. Модель 8B в сжатии Q4 весит 4,9–5,2 ГБ и с контекстом 32K живёт на карте 16 ГБ с запасом. Модель 32B весит 20 ГБ и с тем же контекстом занимает 28 ГБ — это RTX 5090 с её 32 ГБ. Модель 70B весит 43 ГБ и не помещается даже в RTX 5090: нужна вторая карта или часть слоёв в оперативной памяти. Веса взяты из библиотеки Ollama, контекст посчитан по паспортам моделей, а компьютер для ИИ и игр собирается вокруг той же видеокарты.

по теме:Компьютер для ИИ купить в Москве →

цифры разбора

43 ГБ
вес LLM 70B в сжатии Q4 — больше одной RTX 5090
28 ГБ
модель 32B с контекстом 32K
32 ГБ
видеопамять RTX 5090

Вес моделей — библиотека Ollama (Q4_K_M), кэш контекста — расчёт по паспортам моделей на Hugging Face, память карты — спецификация NVIDIA. Это паспортные данные, не замер стенда.

01

Как считать видеопамять: вес модели плюс контекст

Локальную модель держат дома те, кто не хочет отправлять переписку, документы и код в чужое облако и платить за токены. Отвечает она быстро, пока вся лежит в видеопамяти. Поэтому ПК для LLM мы начинаем с арифметики. Мы считаем видеопамять по файлу модели и длине контекста, а не по названию видеокарты.

Первое слагаемое — вес модели. Буква B в названии означает миллиарды параметров: 8B — это восемь миллиардов чисел, которые карта держит в памяти. В полной точности, по 32 бита на параметр, Llama 3.1 8B весит 32,1 ГБ, а Llama 3.1 70B — 280,9 ГБ, по таблице llama.cpp, открытой программы для запуска моделей. Дома модели запускают в сжатом виде: формат Q4_K_M хранит 4,9 бита на параметр, и та же 70B весит уже 43,1 ГБ.

Сжатие ещё и ускоряет ответ. Каждый новый токен требует прочитать веса из памяти, и чем меньше байтов, тем быстрее. В той же документации llama.cpp Llama 3.1 8B в Q4_K_M пишет 72 токена в секунду, а в 16-битном формате F16 — 29 на той же машине. Это соотношение, а не обещание скорости на вашем компьютере.

Второе слагаемое — контекст, то есть сколько текста модель помнит в одном разговоре. Под него карта держит отдельный кэш, и он растёт с каждым токеном. Третье слагаемое — буфер вычислений и рабочий стол Windows, под них мы закладываем сверху 1–2 ГБ.

Файл модели в выбранном сжатии — это минимум видеопамяти только под веса. Если модель не влезла целиком, часть слоёв уходит в оперативную память и ответ идёт медленнее.

02

Сколько видеопамяти нужно LLM 8B, 14B, 32B и 70B

В таблице — вес популярных открытых моделей по библиотеке Ollama и кэш контекста на 32K токенов. Кэш мы посчитали по паспорту каждой модели на Hugging Face — файлу config.json с числом слоёв и размером блоков внимания, по 16 бит на число. Это расчёт, не замер стенда.

Ollama по умолчанию скачивает модель в сжатии Q4_K_M. Именно эти гигабайты человек получает, когда ставит модель обычной командой. Q8_0 — сжатие мягче: 8,5 бита на параметр, качество ближе к исходнику, а вес почти вдвое больше.

Контекст 32K выбирают под работу с длинными документами и кодом. По умолчанию Ollama открывает 4096 токенов, поэтому при первом запуске модель занимает меньше, чем потом в работе с документами.

Последний столбец — наш вывод из суммы веса и кэша. Буфер вычислений в сумму не входит, поэтому вариант «впритык» на практике требует урезать контекст.

МодельВес Q4_K_MВес Q8_0Кэш 32KQ4 + 32KВо что влезает
8B — Llama 3.1, Qwen34,9–5,2 ГБ8,5–8,9 ГБ4–4,5 ГБ8,9–9,7 ГБ12 ГБ, на 16 ГБ — с запасом
14B — Qwen2.5, Qwen39,0–9,3 ГБ16 ГБ5–6 ГБ14,3–15 ГБ16 ГБ впритык, 32 ГБ свободно
32B — Qwen2.5, Qwen320 ГБ35 ГБ8 ГБ28 ГБ32 ГБ — RTX 5090
70B — Llama 3.143 ГБ75 ГБ10 ГБ53 ГБне в одну карту: две по 32 ГБ или часть в ОЗУ
03

Длинный контекст добавляет к модели 4–10 ГБ

Кэш контекста растёт вместе с разговором: каждый токен занимает место в видеопамяти. У Llama 3.1 8B это 128 КБ на токен, у моделей 32B — 256 КБ, у Llama 70B — 320 КБ. На 32K токенов выходит 4, 8 и 10 ГБ соответственно.

Относительно веса длинный контекст сильнее всего бьёт по маленьким моделям. Llama 3.1 8B по карточке Ollama умеет держать 128K токенов, и на такой длине кэш занимает 16 ГБ — в три с лишним раза больше самой модели в Q4. Модель весом 4,9 ГБ с полным контекстом уже не помещается в карту на 16 ГБ.

Второй множитель — одновременные запросы. По документации Ollama контекст умножается на число параллельных запросов: 2K контекста на четыре запроса превращаются в 8K. Машина, которая отвечает трём сотрудникам сразу, держит в памяти три кэша.

Кэш можно сжать. По умолчанию Ollama хранит его в 16 битах (f16), а при включённом Flash Attention переменная OLLAMA_KV_CACHE_TYPE переводит его в q8_0. По документации это примерно половина памяти с очень малой потерей точности. Формат q4_0 занимает четверть, но потери заметнее на длинном контексте. Для модели 32B это разница между 8 и 4 ГБ на 32K токенов. Настройка общая для всех моделей на машине, поэтому мы проверяем её на той модели, с которой вы будете работать.

04

Какая видеокарта под какую модель: 12, 16 и 32 ГБ

12 ГБ стоят на RTX 5070 по спецификации NVIDIA. Этого хватает модели 8B в Q4 с контекстом 32K: вместе выходит 8,9–9,7 ГБ. Модель 14B на такой карте живёт только с коротким контекстом.

16 ГБ стоят на RTX 5070 Ti и RTX 5080. На них 8B работает даже в мягком сжатии Q8 с контекстом 32K — это 12,5–13,4 ГБ. Модель 14B в Q4 с тем же контекстом занимает 14,3–15 ГБ, и это впритык: с буфером вычислений и браузером рядом контекст придётся урезать. Модель 32B в Q4 весит 20 ГБ и в 16 ГБ целиком не ложится.

32 ГБ по паспорту NVIDIA у RTX 5090 — вдвое больше, чем у RTX 5080. На ней модель 32B в Q4 с контекстом 32K занимает 28 ГБ и оставляет 4 ГБ запаса. Модель 32B в Q8 весит 35 ГБ и уже не влезает, 70B в Q4 — тем более. Машины с этой картой собраны в подборке с RTX 5090.

Скорость ответа в токенах мы не обещаем. Она зависит от модели, контекста и версии программы, а своих замеров по каждой модели у нас нет. Порядок выбора простой: сначала модель целиком ложится в память, потом карты сравнивают по скорости.

Генерация держит карту на полной мощности часами, поэтому блок питания берём не ниже требования NVIDIA к системе: 750 Вт для RTX 5070 Ti, 850 Вт для RTX 5080 и 1000 Вт для RTX 5090. Сама RTX 5090 по паспорту берёт до 575 Вт. NVIDIA считает этот минимум для машины с Ryzen 9 9950X, так что с другим процессором и второй картой цифра меняется.

Мы считаем видеопамять по файлу модели и длине контекста, а не по названию видеокарты.

Мастерская Golden Sample PCs
05

Модель 70B дома: вторая карта или оперативная память

Llama 3.1 70B в Q4 весит 43 ГБ, с контекстом 32K — 53 ГБ. Одна RTX 5090 на 32 ГБ её не держит, и путей остаётся два.

Первый путь — часть модели в оперативной памяти. Ollama раскладывает слои сама, а команда ollama ps показывает долю, например «48%/52% CPU/GPU». Это значит, что почти половина модели лежит в оперативной памяти и считается процессором. Ответ идёт медленнее, потому что обычная оперативная память отдаёт данные медленнее видеопамяти. Под такой режим ставим 96–128 ГБ оперативной памяти; все машины с RTX 5090 на витрине собраны с 96 ГБ DDR5. Скорость 70B на них мы не замеряли и цифр не называем.

Второй путь — две видеокарты. По документации Ollama модель, которая не помещается в одну карту, раскладывается по всем доступным. Две карты по 32 ГБ дают 64 ГБ, и 70B в Q4 с контекстом 32K ложится целиком. Модель, которая влезает в одну карту, Ollama грузит на одну, так что вторая карта нужна именно под 70B или под вторую модель рядом. Та же документация предупреждает: на одной карте быстрее, потому что меньше данных идёт по шине PCIe. Две RTX 5090 по паспорту NVIDIA — это до 1150 Вт только на видеокарты, поэтому блок питания, корпус и обдув для такой машины считаем отдельным проектом. С чего начинается расчёт питания, мы разобрали в ответе какой блок питания нужен для RTX 5090.

Сжатие кэша и короткий контекст 70B в одну карту не укладывают. В q8_0 кэш на 32K занимает 5 ГБ вместо 10, а контекст 8K в f16 — 2,5 ГБ. Но сами веса 70B в Q4 весят 43 ГБ, и с контекстом 8K выходит 45,5 ГБ — всё равно больше одной карты. Об этом мы говорим до сборки, а не после.

06

Компьютер для ИИ и игр: что меняется в сборке

Одна машина закрывает и нейросеть, и игры, потому что обе задачи держит одна видеокарта. В играх запас RTX 5090 виден в высоком разрешении: по обзору Tom's Hardware на стенде с Ryzen 7 9800X3D она быстрее RTX 4090 на 25% в 4K и на 3% в 1080p. Для ИИ-станции мы добавляем оперативную память от 64 ГБ, быстрый NVMe от 2 ТБ под веса и продув под многочасовую нагрузку. Диск заполняется быстро: по одной модели 8B, 14B, 32B и 70B в Q4 — это уже 77 ГБ.

Пока модель целиком в видеопамяти, процессор нейросеть почти не нагружает. Он нужен играм. Ryzen 7 9800X3D — восемь ядер и 96 МБ кэша L3 против 36 МБ у Core Ultra 9 285K. В играх 1080p он быстрее 285K на 13% по замеру TechPowerUp и на 24% по Hardware Unboxed в 45 играх, обе серии с RTX 4090. В 4K с RTX 5090 разница между всеми процессорами в тесте TechPowerUp — порядка 10%: упор уходит в видеокарту.

Честно про Intel: в рабочих задачах 285K быстрее 9800X3D на 22% по сводному индексу TechPowerUp, а в простое Intel экономнее (Tom's Hardware). Если машина днём компилирует код или считает данные на процессоре, восьми ядер мало. Тогда берём Ryzen 9 9950X3D — 16 ядер и 128 МБ L3. По замеру Tom's Hardware он в играх идёт вровень с 9800X3D, а в многопотоке на 11% быстрее 285K.

Во всех машинах с RTX 5090 на витрине стоит Ryzen 9 9950X3D2 — первый X3D с дополнительным кэшем на обоих кристаллах, 192 МБ L3. В играх он равен 9950X3D по замеру Tom's Hardware, выигрыш — в рабочих задачах: 4% в многопотоке и до 25% в задачах data science. AMD обещает до 13% в ИИ и симуляциях против 9950X3D — это цифра производителя, не независимый замер.

07

Что на витрине и как мы собираем ПК для локальной нейросети

Машины с RTX 5090 на витрине сейчас от 949 000 ₽, все три — на Ryzen 9 9950X3D2 с 96 ГБ DDR5. Они держат модели 32B целиком, а 70B — с частью слоёв в оперативной памяти. С картой на 16 ГБ на витрине сейчас машины с RTX 5080 — от 399 990 ₽ и машины с RTX 5070 Ti — от 249 990 ₽, они стоят в подборке RTX 5070 и 5070 Ti. Это полка моделей 8B и 14B, а RTX 5070 на 12 ГБ из той же подборки — полка моделей 8B. Наличие уточняйте в Telegram.

Под заказ считаем от задачи. ПК для нейросетей начинается с вопроса, какую модель, в каком сжатии и с каким контекстом вы хотите держать. Дальше — сумма из таблицы выше плюс запас, и уже под неё подбираем карту, оперативную память и блок питания. Сборка бесплатна при покупке комплектующих у нас, из ваших — от 9 990 ₽.

Перед выдачей машина проходит 48 часов стресс-тестов, для ИИ-станции в прогон входит многочасовая генерация. Так видно перегрев памяти карты и просадки блока питания, которые короткий бенчмарк не покажет. Гарантия на сборку — до 3 лет, точный срок называем при покупке. Общий порядок выбора карты — память, шина, процессор — мы разобрали в статье какая видеокарта нужна для нейросетей.

итог мастерской

Видеопамять под LLM считают как вес модели плюс контекст: 8B живёт на 16 ГБ, 32B — на 32 ГБ RTX 5090, 70B в одну карту не помещается. Компьютер для ИИ и игр собираем вокруг карты с запасом памяти и Ryzen X3D под игры.

Цифры — со стенда мастерской в Москве или из обзоров, источник назван в тексте. Обновлено 29 сентября 2026.

Читать дальше

30 сентября 2026 · 3 мин чтения

Нужна ли RTX 5080 для ремастера «Ведьмака 3»

Максимум с Path Tracing в ремастере «Ведьмака 3» просит RTX 5080, 24 ГБ оперативной памяти и процессор уровня Core i9-13900K; для 1080p достаточно RTX 2060 Super. Это формулировка вендора, а не замер со стенда: конкретных кадров по этой сборке мы не обещаем.

29 сентября 2026 · 3 мин чтения

Что значит DLSS 5 на RX 9070 XT, если собираете ПК

Это не разгон Radeon RX 9070 XT и не штатный DLSS 5, а сторонний мод: на выбор железа для сборки сейчас он не влияет. Генерация кадров не создаёт производительность и увеличивает задержку ввода. Ориентир при сборке — нативный FPS и драйвер AMD, а не сторонний мод в одной игре.

28 сентября 2026 · 2 мин чтения

Что значит OB360, если собираете ПК сейчас

Thermaltake показала закрытую 360-мм процессорную СЖО без подсветки; цену и дату продаж не назвали — для сборки сейчас это выбор внешнего вида, а не повод ждать кулер. Закрытый контур по-прежнему не обслуживают как кастом. Своих замеров этой модели у нас нет.

Частые вопросы

Сколько видеопамяти нужно для LLM 70B?

Llama 3.1 70B в сжатии Q4 весит 43 ГБ по библиотеке Ollama, контекст 32K добавляет ещё 10 ГБ — всего 53 ГБ. В одну RTX 5090 на 32 ГБ это не помещается. Рабочие пути — две карты по 32 ГБ или часть слоёв в оперативной памяти, второй вариант медленнее.

Хватит ли 16 ГБ видеопамяти для локальной нейросети?

Для моделей 8B — да, даже в мягком сжатии Q8 с контекстом 32K: это 12,5–13,4 ГБ. Модель 14B в Q4 с тем же контекстом занимает 14,3–15 ГБ, это впритык. Модель 32B весит 20 ГБ и в 16 ГБ целиком не ложится.

Какую модель тянет RTX 5090?

Модель 32B в сжатии Q4 с контекстом 32K занимает 28 ГБ и помещается в 32 ГБ карты целиком. Модель 32B в Q8 весит 35 ГБ и уже не влезает. Модель 70B требует второй карты или оперативной памяти.

Можно ли на компьютере для ИИ играть?

Да, обе задачи держит одна видеокарта. Для игр мы ставим Ryzen X3D: 9800X3D в 1080p быстрее Core Ultra 9 285K на 13–24% по замерам TechPowerUp и Hardware Unboxed. Если машина ещё и считает на процессоре, берём 16-ядерный 9950X3D.

Почему локальная модель отвечает медленно, хотя видеокарта новая?

Чаще всего модель не влезла в видеопамять целиком. Команда ollama ps покажет долю CPU/GPU: если там не 100% GPU, часть слоёв считает процессор. Помогает урезать контекст, сжать кэш в q8_0 или взять модель меньше.

Собрано и стоит в мастерской

Готовые машины в Москве: живые фото, 48 часов тестов перед выдачей, гарантия мастерской на сборку до 3 лет, на комплектующие — срок производителя. Наличие уточняйте в Telegram; забрать можно на Варшавском шоссе или отправим по России.

Белый ПК HAVN HS420, 5090 Master, 9950x3D2, DDR5 96 ГБ

№ 7393918917 · наличие уточняйте · Москва

Белый ПК HAVN HS420, 5090 Master, 9950x3D2, DDR5 96 ГБ

ПК Asus 5090 Astral, 9950x3D2, 96 ГБ, HS420

№ 7361943333 · наличие уточняйте · Москва

ПК Asus 5090 Astral, 9950x3D2, 96 ГБ, HS420

ПК в Singularity Spectre 4: RTX 5090, 9950x3D2, DDR5 96 ГБ

№ 4801494117 · наличие уточняйте · Москва

ПК в Singularity Spectre 4: RTX 5090, 9950x3D2, DDR5 96 ГБ

Цена1 499 990 ₽
Смотреть сборку →