Чтобы запустить нейросеть на ПК локально, не нужен сервер за сотни тысяч рублей или опыт программирования. На обычный компьютер можно установить приложение, скачать подходящую языковую модель и получить собственный чат с искусственным интеллектом, который работает без подписки и постоянного подключения к интернету.
Вся настройка занимает около 15–20 минут. Самая частая ошибка новичков — скачать слишком большую модель: она либо не запускается, либо заставляет компьютер отвечать по одному слову в несколько секунд. Поэтому сначала мы проверим характеристики ПК, затем выберем модель под 8, 16 или 32 ГБ памяти и только после этого установим её через LM Studio.
Короткий ответ: для первого запуска установите LM Studio и выберите Qwen3 4B в квантизации Q4_K_M. Такой вариант подходит для знакомства с локальным ИИ и способен работать даже без отдельной видеокарты. Если на компьютере 16 ГБ оперативной памяти, можно попробовать Qwen3 8B или другую модель класса 7–8B.
Как запустить локальную нейросеть: план на 15 минут
Весь процесс состоит из семи шагов:
- Узнать объём оперативной и видеопамяти.
- Выбрать модель подходящего размера.
- Скачать LM Studio с официального сайта.
- Установить необходимые компоненты.
- Загрузить модель в формате GGUF.
- Открыть локальный чат.
- Отключить интернет и проверить офлайн-режим.
Для первоначальной установки подключение к интернету необходимо: нужно загрузить программу, среду выполнения и файл модели размером от нескольких гигабайт. После этого локальная нейросеть сможет отвечать без сети.
Потянет ли компьютер локальную нейросеть
Для запуска важны три характеристики:
- оперативная память — RAM;
- память видеокарты — VRAM;
- свободное место на SSD.
Самый простой способ выбрать модель — ориентироваться на объём оперативной памяти.
| Характеристики компьютера | Какую модель выбрать | Размер файла | Подходящие задачи |
|---|---|---|---|
| 8 ГБ RAM, без видеокарты | 1–4B, Q4 | 1–3,5 ГБ | Короткие ответы, редактирование текста |
| 16 ГБ RAM | 4–8B, Q4 | 3–6 ГБ | Чат, тексты, небольшие документы |
| 32 ГБ RAM | 8–14B, Q4 | 5–10 ГБ | Анализ документов, код, сложные инструкции |
| 64 ГБ RAM | 20–32B, Q4 | 13–22 ГБ | Продвинутая локальная работа |
Это безопасные стартовые ориентиры, а не абсолютные ограничения. Потребление памяти зависит от модели, длины контекста, программы запуска и фоновых приложений.

Чем больше оперативной и видеопамяти, тем более крупную модель можно запустить на ПКМодель должна не просто поместиться в память. Необходимо оставить запас для Windows, браузера, антивируса и других процессов. Если компьютер начинает использовать файл подкачки, скорость генерации может снизиться в несколько раз.
Если вы выбираете новый компьютер для локального ИИ, узнайте, что такое NPU в ноутбуке и стоит ли за него доплачивать, поскольку высокая производительность нейропроцессора полезна не во всех программах.
Не скачивайте самую крупную модель, которая теоретически помещается в оперативную память. Быстрая модель 4B часто полезнее, чем модель 14B, ответа которой приходится ждать несколько минут.
Как узнать характеристики ПК
В Windows:
- Нажмите
Ctrl + Shift + Esc. - Откройте вкладку «Производительность».
- Выберите раздел «Память».
- Посмотрите общий объём RAM.
- Перейдите в раздел «Графический процессор».
- Найдите объём выделенной памяти GPU.
Модель процессора и выпуск Windows можно посмотреть через «Параметры → Система → О системе».
На Mac откройте меню Apple и выберите «Об этом Mac». На компьютерах с Apple Silicon центральный и графический процессоры используют объединённую память.
Можно ли запустить нейросеть без видеокарты
Да. Нейросеть на ПК без видеокарты будет использовать центральный процессор и оперативную память. Она заработает, но скорость окажется ниже.
Для запуска на CPU выбирайте:
- модель не больше 3–4B;
- квантизацию Q4;
- небольшой контекст;
- короткие отдельные чаты для разных задач.
Отдельная видеокарта ускоряет ответы, если в её VRAM помещается значительная часть модели. Для моделей класса 4–8B обычно полезно иметь 6–8 ГБ видеопамяти, но точные требования зависят от файла и контекста.
Что именно потребуется скачать
Локальная нейросеть состоит не из одной программы.
Приложение для запуска
LM Studio или Ollama управляют моделями, памятью и чатами. Эти программы сами по себе не являются нейросетями.
Среда выполнения
Она отвечает за вычисления на процессоре или видеокарте. LM Studio может предложить загрузить подходящую среду при первом запуске.
Файл модели
Это самая большая часть установки. В нём находятся веса нейросети. Файл компактной модели может занимать 2–4 ГБ, крупной — десятки гигабайт.
История чатов и документы
При локальной работе они сохраняются на компьютере. Но облачные функции, веб-поиск и некоторые сторонние интеграции могут передавать данные в интернет — режим необходимо проверять отдельно.
Как установить LM Studio и запустить нейросеть локально
LM Studio — удобный вариант для новичка. В приложении есть каталог моделей, окно чата, настройки памяти, работа с документами и локальный API.
Программа поддерживает Windows x64 и ARM, Linux, а также Mac с Apple Silicon. На Windows x64 требуется процессор с поддержкой AVX2. Разработчики рекомендуют 16 ГБ RAM и видеокарту с 4 ГБ VRAM, хотя компактные модели могут запускаться на более слабых устройствах. Актуальные ограничения приведены в официальных системных требованиях LM Studio.
Шаг 1. Скачайте LM Studio
Откройте официальный сайт LM Studio и выберите версию для своей операционной системы.
Не загружайте установщик со сторонних каталогов. Программа будет работать с вашими запросами и документами, поэтому происхождение установочного файла критически важно.
Шаг 2. Установите приложение
Запустите установочный файл и следуйте подсказкам. При первом открытии LM Studio может загрузить дополнительные компоненты для работы моделей.
Интерфейс меняется между версиями, но основные разделы обычно сохраняются:
- Discover — поиск и скачивание моделей;
- Chat — локальный чат;
- My Models — загруженные файлы;
- Developer — API и локальный сервер.
Шаг 3. Найдите модель
Откройте Discover и введите в поиск:
Qwen3 4B
Или попробуйте другие варианты:
- Qwen3 8B;
- Gemma 3 4B;
- Gemma 3 12B;
- DeepSeek R1 7B или 8B.
Для первого запуска лучше выбрать Qwen3 4B или другую мультиязычную модель похожего размера.
Каталог постоянно обновляется. Новейшая модель не всегда является лучшим выбором для слабого компьютера: она может требовать больше памяти или пока иметь меньше проверенных квантизаций.
Шаг 4. Выберите правильный файл
Одна и та же модель представлена в нескольких вариантах:
Q4_K_M;Q5_K_M;Q8_0;FP16.
Для начала выбирайте Q4_K_M. Это распространённый баланс между размером, скоростью и качеством.
Не скачивайте FP16 только потому, что этот вариант выглядит «полным». Такой файл может занимать в несколько раз больше памяти, а разница в бытовых задачах не всегда будет заметна.
Шаг 5. Скачайте модель
Проверьте размер файла и нажмите Download. Дождитесь полного завершения загрузки.
На SSD желательно оставить запас свободного места. Для одной небольшой модели и программы потребуется около 8–10 ГБ. Если планируете сравнивать несколько вариантов, освободите 20–30 ГБ.
Шаг 6. Загрузите модель в память
Перейдите в Chat, откройте меню выбора модели и укажите загруженный файл.
LM Studio покажет настройки запуска. На первом этапе лучше оставить автоматические параметры. Если появится предупреждение о нехватке памяти:
- выберите меньшую модель;
- уменьшите контекст;
- закройте тяжёлые приложения;
- выгрузите другие модели из памяти.
Шаг 7. Отправьте проверочный запрос
Не ограничивайтесь словом «Привет». Дайте модели задачу с понятными критериями:
Объясни простыми словами, чем оперативная память отличается от постоянной. Приведи один бытовой пример. Ответь на русском языке и уложись в 200 слов.
Затем проверьте выполнение более сложной инструкции:
Составь план статьи из семи пунктов о защите персональных данных. Для каждого пункта объясни, какую проблему он решает. Не используй повторяющиеся советы.
Оцените:
- отвечает ли модель на русском;
- выполняет ли формат;
- не повторяет ли мысли;
- не придумывает ли сомнительные факты;
- насколько быстро выводится текст.
Как проверить, что нейросеть работает без интернета
Некоторые приложения показывают в одном интерфейсе локальные и облачные модели. Само наличие установленной программы ещё не доказывает, что запросы обрабатываются на компьютере.
Для надёжной проверки:
- Полностью скачайте модель.
- Закройте LM Studio.
- Отключите Wi‑Fi и сетевой кабель.
- Запустите программу заново.
- Загрузите модель из раздела My Models.
- Создайте новый чат.
- Задайте уникальный вопрос.
Например:
Придумай четыре названия для вымышленной мастерской роботов. Каждое название должно состоять из двух слов.
Если после перезапуска без сети модель загружается и отвечает, локальный режим работает.
Интернет всё равно понадобится для:
- поиска новых моделей;
- загрузки файлов;
- обновления LM Studio;
- скачивания сред выполнения;
- веб-поиска;
- обращения к облачным моделям.
LM Studio подтверждает, что загруженные модели, обычные чаты, локальный сервер и работа с документами могут функционировать офлайн. Официальное описание офлайн-режима
Если вы хотите гарантированно работать локально, проверяйте не только наличие интернета, но и название выбранной модели. В интерфейсе могут появляться облачные функции, которые не относятся к установленному файлу GGUF.
Какую локальную нейросеть выбрать
Универсально лучшей модели не существует. Выбирать нужно по трём параметрам:
- Мощность компьютера.
- Основная задача.
- Качество русского языка.
Для компьютера с 8 ГБ RAM
Начните с модели 1–4B в квантизации Q4.
Подходящие задачи:
- исправление текста;
- составление списков;
- короткие пересказы;
- простые вопросы;
- создание черновиков.
Стартовый вариант — Qwen3 4B Q4_K_M. Файл занимает около 2,6 ГБ, но программе потребуется дополнительная память для контекста и вычислений.
Для компьютера с 16 ГБ RAM
Попробуйте модели класса 4–8B:
- Qwen3 4B;
- Qwen3 8B;
- Gemma 3 4B;
- DeepSeek R1 7B или 8B.
Модель 8B обычно лучше удерживает сложные инструкции, но отвечает медленнее.
Для компьютера с 32 ГБ RAM
Можно запускать модели класса 8–14B в Q4:
- Qwen3 8B;
- Gemma 3 12B;
- другие мультиязычные модели 12–14B.
Они подходят для анализа документов, программирования и более длинных материалов.
Для 64 ГБ RAM и мощной видеокарты
Доступны модели 20–32B, включая продвинутые решения для рассуждений и кода. Они требуют больше места, дольше загружаются и не всегда нужны для обычной переписки.
Таблица выбора по задачам
| Задача | Что выбрать |
|---|---|
| Первый локальный чат | LM Studio + Qwen3 4B Q4 |
| Работа со статьями | Qwen3 8B или похожая модель |
| Анализ PDF | LM Studio или приложение Ollama |
| Слабый компьютер | Модель 1–4B Q4 |
| Программирование | Модель, обученная для кода |
| Логические задачи | DeepSeek R1 или reasoning-модель |
| Локальный API | Ollama или сервер LM Studio |
| Работа без видеокарты | Компактная Q4-модель на CPU |
Названия и доступность моделей меняются. При обновлении каталога выбирайте не самую новую модель, а подходящий размер, мультиязычную поддержку и проверенную квантизацию.
Что означают 4B, 8B, GGUF и Q4
Количество параметров
Буква B означает миллиарды параметров:
- 4B — около четырёх миллиардов;
- 8B — около восьми миллиардов;
- 14B — около четырнадцати миллиардов.
Большее количество параметров может повышать качество, но увеличивает требования к памяти и снижает скорость.
Формат GGUF
GGUF — распространённый формат файлов локальных моделей. Его используют LM Studio, llama.cpp и совместимые приложения.
Квантизация
Квантизация уменьшает точность хранения весов, благодаря чему модель занимает меньше памяти.
Упрощённо:
- Q4 — оптимальный старт;
- Q5 — немного крупнее;
- Q8 — ещё больше памяти и меньше сжатия;
- FP16 — крупный файл с высокой точностью.
Для большинства домашних компьютеров Q4_K_M — разумный выбор.

При локальной обработке запросы и загруженные документы могут оставаться на компьютере пользователяКак запустить нейросеть через Ollama
Ollama подходит не только программистам. С 2025 года официальное приложение для Windows и macOS имеет графический чат, каталог моделей и поддержку перетаскивания файлов, включая PDF. Терминал остаётся доступен для управления моделями и интеграций. Анонс приложения Ollama
Запуск через приложение
- Скачайте Ollama с официального сайта.
- Установите приложение.
- Откройте новый чат.
- Выберите локальную модель.
- Дождитесь её загрузки.
- Отправьте запрос.
Обращайте внимание на пометки моделей. В Ollama могут отображаться локальные и облачные варианты. Для работы без интернета выбирайте файл, который загружается на компьютер.
Запуск через терминал
После установки откройте PowerShell и выполните:
ollama run qwen3:4b
При первом выполнении Ollama скачает модель, затем откроет чат.
Для более мощного компьютера:
ollama run qwen3:8b
Список установленных моделей:
ollama list
Удаление модели:
ollama rm qwen3:4b
Выход из диалога:
/bye
LM Studio или Ollama: что лучше
| Критерий | LM Studio | Ollama |
|---|---|---|
| Графический чат | Да | Да, Windows и macOS |
| Работа через терминал | Да | Да |
| Работа с PDF | Да | Да |
| Тонкая настройка моделей | Очень удобно | Меньше настроек в интерфейсе |
| Локальный API | Да | Да |
| Подходит новичку | Да | Да |
| Автоматизация | Возможна | Особенно удобна |
| Linux | Да | Да |
Выбирайте LM Studio, если хотите видеть параметры модели, управлять контекстом, квантизациями и загрузкой в GPU.
Выбирайте Ollama, если нужен простой чат, API или подключение к другим программам.
Действительно ли документы остаются на компьютере
При работе с загруженной локальной моделью LM Studio сообщает, что история, запросы и документы сохраняются на устройстве и не передаются разработчикам. Но интернет используется для поиска моделей, загрузок, обновлений и облачных функций.
Чтобы снизить риски:
- скачивайте программы с официальных сайтов;
- проверяйте название выбранной модели;
- не включайте облачный режим;
- отключайте ненужный веб-поиск;
- осторожно устанавливайте расширения;
- включите шифрование диска;
- защитите учётную запись Windows или macOS;
- не предоставляйте модели доступ к терминалу без необходимости.
Дополнительные рекомендации собраны в инструкции, как защитить свои данные в интернете.
Локальный чат, который только создаёт текст, относительно изолирован. ИИ-агент с доступом к файлам, браузеру и терминалу способен выполнять реальные действия. Не подтверждайте команды, смысл которых вы не понимаете.
Как проверить скорость модели
Скорость измеряется в токенах в секунду. Токен — это слово, часть слова или знак.
Приблизительное восприятие:
- меньше 2 токенов в секунду — очень медленно;
- 2–5 — работать можно, но длинные ответы утомляют;
- 5–10 — приемлемо;
- 10–20 — комфортный чат;
- больше 20 — текст появляется достаточно плавно.
Для сравнения моделей используйте один запрос и новый пустой чат:
Объясни простыми словами, как работает домашний Wi‑Fi. Ответ должен состоять из пяти абзацев, содержать один бытовой пример и занимать не более 300 слов.
Проверьте:
- время до первого слова;
- общую скорость;
- выполнение формата;
- качество русского языка;
- фактические ошибки;
- загрузку CPU, GPU и памяти.
Такой тест полезнее абстрактного рейтинга: одна и та же модель работает по-разному на разных компьютерах.
Как ускорить локальную нейросеть
Если модель отвечает медленно:
- Выберите меньший размер.
- Используйте Q4 вместо Q8 или FP16.
- Закройте браузер и тяжёлые программы.
- Создайте новый чат.
- Уменьшите контекст.
- Проверьте загрузку видеокарты.
- Обновите драйвер GPU.
- Храните модель на SSD.
- Не запускайте две модели одновременно.
- Перезагрузите компьютер.
Большой контекст требует дополнительной памяти. Максимальные 128 или 256 тысяч токенов редко нужны для обычного чата.
Типичные ошибки
Модель не загружается
Причина обычно связана с нехваткой RAM или VRAM.
Решение:
- перейти с 8B на 4B;
- выбрать Q4;
- уменьшить контекст;
- закрыть другие приложения;
- освободить место на SSD.
Компьютер зависает
Вероятно, система начала активно использовать файл подкачки. Выберите модель меньшего размера и оставьте больше свободной RAM.
Нейросеть отвечает по-английски
Добавьте системную инструкцию:
Всегда отвечай на русском языке. Используй естественные русские формулировки. Английские термины сопровождай коротким пояснением.
Если это не помогает, выберите другую мультиязычную модель.
Ответ обрывается
Причиной может быть лимит генерации, переполненный контекст или нехватка памяти. Создайте новый чат, сократите документ либо попросите отвечать частями.
Модель не знает свежих событий
Локальная нейросеть не получает актуальную информацию автоматически. Без веб-поиска она опирается на обучающие данные и предоставленные документы.
Чек-лист: нейросеть действительно работает локально
Проверьте себя:
Итог
Самый простой способ запустить нейросеть на ПК локально — установить LM Studio, скачать небольшую модель Qwen3 4B в Q4_K_M и проверить её после полного отключения интернета.
Компьютер с 8 ГБ RAM подходит для компактных моделей и знакомства с локальным ИИ. При 16 ГБ можно комфортнее работать с моделями 4–8B. С 32 ГБ становятся доступны более серьёзный анализ документов, программирование и модели класса 12–14B.
Не пытайтесь сразу установить самый большой файл. Начните с компактной модели, проверьте качество русского языка и скорость, а затем постепенно увеличивайте размер.
Если локальный ИИ нужен для программирования, полезно также разобраться, почему Claude Code расходует много токенов и как снизить затраты.
FAQ
Да. Интернет потребуется для загрузки программы, среды выполнения и модели. После этого локальный чат, обработка документов и API могут работать без подключения к сети.
Для компьютера с 8 ГБ оперативной памяти выбирайте модель класса 1–4B в квантизации Q4. В качестве стартового варианта можно использовать Qwen3 4B Q4_K_M.
Да. Вычисления будет выполнять процессор, а модель разместится в оперативной памяти. Ответы появятся медленнее, поэтому лучше использовать компактную модель 3–4B.
Обе программы подходят для локального запуска. LM Studio удобнее для выбора квантизации, контекста и настроек GPU. Ollama предлагает графическое приложение, терминал, локальный API и удобные интеграции.
Официальные облачные модели ChatGPT нельзя скачать и установить как обычный локальный файл. Вместо них используются открытые модели Qwen, Gemma, DeepSeek и другие. Некоторые приложения также показывают облачные модели, но для них требуется интернет.
Для небольших моделей достаточно 8 ГБ, но 16 ГБ заметно удобнее. Для моделей 12–14B желательно 32 ГБ, а решениям 20–32B часто требуется 32–64 ГБ памяти.
Да. LM Studio и приложение Ollama поддерживают работу с файлами. Для длинных документов может использоваться RAG-поиск по подходящим фрагментам. Важные выводы нужно проверять по оригиналу.
Это популярный вариант квантизации, уменьшающий размер модели и потребление памяти. Он обеспечивает удачный баланс качества и скорости для домашнего компьютера.
Многие программы и модели доступны бесплатно, но условия зависят от лицензии. Перед коммерческим использованием проверьте разрешённые сценарии. Также учитывайте стоимость оборудования и электроэнергии.






