Ты уже знаешь, что ИИ может писать код. В курсе мы работаем с Claude Code — облачным ассистентом, который думает на серверах Anthropic и приходит к тебе через интернет. Другой вариант — скачать модель и обрабатывать запросы прямо на своём компьютере. Это называется локальная LLM.
Звучит заманчиво: после скачивания модели нет оплаты за каждый токен, а запросы можно обрабатывать на своём компьютере. Но приватность сохраняется только при полностью локальном запуске без облачных моделей и сетевых инструментов. Есть и обратная сторона: локальные модели обычно слабее, медленнее и капризнее облачных. Кстати, если тебя привело сюда желание сэкономить, открытые модели можно вызывать через бесплатный план Groq API в пределах его лимитов, без своего железа.
В этой статье — обзор локальных LLM для программирования: чем они отличаются от облачных Claude или GPT, как устроен запуск через Ollama, какие модели подходят для кода, сколько железа нужно и что меняется при подключении локальной модели к Claude Code или другой агентной оболочке.
Содержание
- Что такое локальная LLM и чем она отличается от облачной Claude или GPT
- Зачем локальная LLM нужна разработчику-новичку
- Ollama: самый простой способ запустить модель локально
- Популярные модели для кода
- Требования к железу
- Когда локальная LLM оправдана, а когда нет
- Практика для курса: локальная модель как черновой помощник рядом с Claude Code
- Распространённые ошибки новичков
- Частые вопросы
- Заключение
Что такое локальная LLM и чем она отличается от облачной Claude или GPT
LLM — это Large Language Model, большая языковая модель. Проще говоря, это программа, обученная на огромном количестве текста, которая умеет продолжать фразы, отвечать на вопросы, писать код, переводить и многое другое. Когда такая модель работает на серверах компании вроде Anthropic или OpenAI, а ты общаешься с ней через сайт или API, это облачная LLM. Когда файл модели лежит на твоём диске и считается на твоём процессоре или видеокарте — это локальная LLM.
Облачная модель — это такси. Ты садишься, называешь адрес, водитель везёт. Тебе не нужен свой автомобиль, не нужно думать о бензине и ремонте, но поездка стоит денег, и машина не твоя. Локальная модель — это свой велосипед. Он всегда под рукой, не требует подписки, но едешь ты сам, медленнее, и если нужно проехать десяток километров в гору, будет тяжело.
Где живёт модель
В облачном сервисе вес модели измеряется десятками или сотнями гигабайт. Она стоит на мощных серверах с десятками и сотнями видеокарт, объединённых в кластер. Ты отправляешь запрос, он уходит через интернет, обрабатывается на этих серверах, и ответ возвращается обратно. Весь тяжёлый вычислительный труд происходит где-то далеко.
Локальная LLM — это тот же принцип, но сервером выступает твой компьютер. Ты скачиваешь файл модели, программа-раннер загружает его в оперативную память или видеопамять, и генерация текста происходит прямо у тебя на столе. После скачивания локальной модели интернет для самой генерации не нужен, если ты не подключил облачный режим, веб-поиск или другие сетевые инструменты.
Что происходит с данными
Главное отличие, которое волнует многих разработчиков — приватность. Когда ты отправляешь код в облачный сервис, он уходит на чужие серверы. При полностью локальном запуске промпты и код обрабатываются на твоём компьютере. Это не защищает от вредоносных программ, журналов других приложений и случайно подключённых сетевых инструментов. Пароли, токены и другие секреты не стоит вводить даже в локальную модель.
Подробнее о том, как не светить токены и секреты при работе с ИИ, читай в статье хранение секретов и токенов.
Скорость и качество
Облачные модели верхнего уровня от Anthropic, OpenAI и Google обычно лучше понимают сложные инструкции и решают многошаговые задачи. Сравнивать только заявленный размер контекста недостаточно: качество работы с длинным проектом зависит от модели, агентной оболочки и инструментов. За облачный сервис обычно платят подпиской или по объёму использования.
Локальные модели доступные на домашнем железе обычно меньше по размеру. Меньше параметров означает меньше знаний, меньше способность к рассуждению и хуже качество кода на сложных задачах. Они могут отлично справляться с простыми шаблонами, но запутаться в архитектуре проекта, забыть детали из длинного файла или предложить решение, которое выглядит правдоподобно, но не работает.
Стоимость
Облачные сервисы требуют подписки или оплаты за токены. Локальный запуск после скачивания не создаёт счёт за каждый запрос, но остаются расходы на электричество и железо. Лицензия каждой модели действует отдельно и может ограничивать отдельные способы использования. Кроме того, Ollama поддерживает облачные модели, для которых действуют аккаунт, тарифы и лимиты сервиса.
Требование к интернету
Облачный ИИ не работает без интернета. Локальный ИИ работает офлайн после того, как модель скачана. Это удобно в дороге, в местах со слабой связью или при работе с конфиденциальными данными, которые нельзя отправлять по сети.
Главная мысль: локальная LLM — это не «бесплатный Claude у себя на компьютере». При полностью локальном запуске она может работать офлайн и не отправлять промпты провайдеру модели, но качество, скорость, лицензия и приватность зависят от выбранной модели и окружения.
Зачем локальная LLM нужна разработчику-новичку
Новичок в вайбкодинге обычно хочет одного: чтобы ИИ помог собрать работающее приложение без глубокого знания программирования. Для этого идеально подходит мощный облачный ассистент вроде Claude Code, который видит весь проект, понимает контекст и может вести длинный диалог. Но у локальной LLM тоже есть свои сценарии, где она полезна именно на старте.
Приватность промптов и кода
Когда ты экспериментируешь с идеей будущего продукта или закрытым кодом, полностью локальная обработка уменьшает число сторон, которым передаются данные. Перед работой с реальными персональными или медицинскими данными всё равно проверь логи, плагины, сетевые инструменты и требования законодательства: само слово «локальный» не создаёт автоматической гарантии безопасности.
Бесплатные эксперименты
Подписки на облачные ИИ стоят денег. Локальная модель позволяет экспериментировать без поминутного или поточного счётчика провайдера. Лимиты всё равно есть: объём памяти, длина контекста, скорость железа и место на диске.
Оффлайн-работа
Скажем, ты едешь в поезде, в самолёте или на даче со слабым интернетом и хочешь поработать над своей «Змейкой». С локальной моделью можно генерировать черновики кода, объяснять себе фрагменты HTML и JavaScript, искать ошибки в уже загруженных файлах. Конечно, полноценно разрабатывать сложный проект офлайн всё равно сложно — нужны документация, поиск, GitHub — но для черновой работы локальный ИИ подходит.
Обучение и понимание
Локальная модель заставляет разобраться в том, как устроены языковые модели изнутри: что такое параметры, квантование, контекстное окно, токены. Это полезно для развития, но не стоит превращать изучение инфраструктуры в самоцель, если твоя задача — просто собрать первое приложение.
Важное ограничение: это не замена Claude Code
Сама модель только принимает контекст и генерирует ответ. Доступ к файлам, терминалу, тестам и браузеру даёт агентная оболочка. С января 2026 года Ollama умеет настраивать и запускать Claude Code, OpenCode и Codex с локальными или облачными моделями через ollama launch. Возможности инструментов при этом появляются, но качество планирования и правок всё ещё зависит от модели, доступной памяти и длины контекста. На слабом домашнем компьютере такой агент обычно заметно уступает сильной облачной связке.
Локальная LLM — это дополнение, а не замена. Черновой помощник для быстрых вопросов, приватных экспериментов и офлайн-работы. Основной инструмент для сборки приложения остаётся облачным ассистентом.
Важно: не покупай мощный компьютер ради локальной LLM, если у тебя ещё нет стабильного рабочего процесса с облачным ИИ. Сначала научись получать результат от Claude Code, а потом решай, нужна ли тебе локальная копия.
Ollama: самый простой способ запустить модель локально
Один из самых простых способов поработать с моделями — Ollama. Это приложение с открытым исходным кодом для Windows, macOS и Linux, которое упрощает скачивание и запуск моделей. На Windows и macOS есть приложение с графическим интерфейсом, а команды ollama доступны в терминале. В каталоге встречаются и локальные, и облачные варианты: суффикс :cloud означает, что вычисления уходят в Ollama Cloud.
Как установить
Установка Ollama сводится к скачиванию установщика с официального сайта и запуску по инструкции. На macOS и Windows это обычный графический инсталлятор. На Linux можно установить через команду в терминале, которую публикует сам проект. После установки в системе появляется команда ollama, которую можно вызывать из терминала.
Точные версии и шаги интерфейса меняются со временем, поэтому лучше смотреть актуальную инструкцию на официальном сайте Ollama. Общий принцип остаётся стабильным: установил, открыл терминал, начал pull моделей.
Как скачать модель
Модели в Ollama хранятся в виде так называемых модельных файлов. Чтобы скачать модель, используется команда:
ollama pull имя-модели
Для первого опыта на компьютере с 8–16 ГБ общей памяти можно начать с компактной qwen3.5:4b: ollama pull qwen3.5:4b. Кодовая qwen3-coder:30b занимает около 19 ГБ только на диске и требует заметно больше ресурсов при большом контексте. Тег и размер всегда проверяй в каталоге Ollama перед скачиванием.
Команда pull скачивает файлы модели на диск. Вес может измеряться несколькими гигабайтами, поэтому первый запуск требует времени и места на диске.
Как запустить и пообщаться
После скачивания модель запускается командой:
ollama run имя-модели
Терминал превращается в чат: ты пишешь промпт, модель отвечает. Чтобы выйти, обычно используется команда /bye или сочетание клавиш.
На Windows и macOS приложение обычно уже запускает локальный сервер в фоне. При ручном запуске или на Linux его можно поднять командой:
ollama serve
После этого к модели можно обращаться через собственный API Ollama. Для программ, ожидающих интерфейс OpenAI, Ollama отдельно предоставляет частичную совместимость по адресам /v1/....
Где брать модели
Ollama имеет библиотеку моделей на своём сайте. Там перечислены варианты, размеры, теги и лицензии. Перед pull проверь, локальный ли это файл: модели с тегом :cloud выполняются в облаке и требуют входа в аккаунт.
Полезные команды и API
Помимо pull и run, в Ollama есть несколько команд, которые пригодятся в работе. Команда ollama list показывает все скачанные модели и занимаемое ими место. Команда ollama rm имя-модели удаляет выбранную модель с диска, что полезно, когда места становится мало. Команда ollama ps показывает, какие модели сейчас загружены в память.
Для собственных скриптов Ollama предоставляет HTTP API. Локальный запрос можно отправить, например, на http://localhost:11434/api/generate. Совместимые с OpenAI приложения подключаются к http://localhost:11434/v1/, но Ollama реализует только поддерживаемую часть интерфейса. Если указана модель с :cloud, локальная точка входа всё равно передаст вычисление в Ollama Cloud.
Почему Ollama удобна для старта
Для новичка главное преимущество Ollama в том, что она прячет сложность. Не нужно устанавливать PyTorch, разбираться в версиях CUDA, вручную конвертировать модели. Ты пишешь пару команд в терминале и получаешь работающий локальный чат. Это снижает порог входа, хотя полностью от проблем с железом и настройками не избавляет.
Практический совет: начни с одной небольшой модели и одного простого вопроса. Например, попроси объяснить, как работает localStorage в браузере, или попроси написать простую функцию на JavaScript. Если ответ получен и скорость тебя устраивает, попробуй более сложные задачи.
Популярные модели для кода
Не все локальные модели одинаково хорошо пишут код. Некоторые обучены преимущественно на разговорных текстах, другие — специально на коде, документации и задачах программирования. Для разработчика важнее вторые, поэтому локальная LLM для программирования — это не просто любая скачанная модель, а именно вариант, дообученный на коде.
Qwen3-Coder
Актуальная кодовая ветка Alibaba в Ollama — Qwen3-Coder. Локальный вариант qwen3-coder:30b имеет 30 млрд общих параметров и около 3,3 млрд активных на токен, занимает примерно 19 ГБ и заявляет контекст до 256 тысяч токенов. Это уже не модель для слабого ноутбука: для агентной работы с большим контекстом потребуется существенно больше памяти, чем размер файла.
Вариант Qwen3-Coder на 480 млрд параметров требует не менее 250 ГБ памяти даже в локальной поставке Ollama. Тег 480b-cloud запускает облачную, а не локальную модель.
Qwen3.5 для первого запуска
Если Qwen3-Coder не помещается в память, практичнее начать с универсальной Qwen3.5. В каталоге Ollama есть варианты 0,8B, 2B, 4B, 9B и крупнее; qwen3.5:4b занимает около 3,4 ГБ, а qwen3.5:9b — около 6,6 ГБ. Они поддерживают инструменты и умеют работать с кодом, хотя на сложных задачах уступают крупным кодовым моделям.
А вот гигантов вроде Kimi K3 на 2,8 трлн параметров на обычном домашнем компьютере не поднять: им нужны серверные конфигурации, а дома их место занимают компактные или квантованные модели.
gpt-oss 20B
gpt-oss:20b — открытая по весам модель OpenAI для рассуждений, инструментов и задач разработки. В Ollama её файл занимает около 14 ГБ, а запуск рассчитан на системы примерно с 16 ГБ памяти и выше. Это пограничный вариант для обычного ноутбука: модель может запуститься, но большой контекст потребует дополнительной памяти.
Модель распространяется по Apache 2.0. Более крупная gpt-oss:120b занимает около 65 ГБ и относится уже к другому классу железа.
Devstral Small 2
Devstral Small 2 от Mistral — кодовая модель на 24 млрд параметров для работы с инструментами и несколькими файлами. В Ollama квантованный вариант занимает около 15 ГБ и распространяется по Apache 2.0. Несмотря на слово Small, для комфортного агентного режима это не маленькая модель: заявленное окно до 384 тысяч токенов не означает, что оно поместится в память домашнего компьютера.
Старые семейства
DeepSeek-Coder, Code Llama, CodeGemma и StarCoder остаются в каталогах и могут работать на старом железе, но это уже предыдущие поколения. Для новой установки сначала сравни актуальные Qwen3.5, Qwen3-Coder, gpt-oss 20B и Devstral Small 2, а старую модель выбирай только при понятной причине: меньший размер, совместимость или конкретный удачный тест.
Как выбрать модель
Главный критерий для новичка — не название на обложке, а то, помещается ли модель в память твоего компьютера и даёт ли приемлемую скорость. Второй критерий — качество на конкретных задачах. Лучший способ выбрать: скачать две-три небольшие модели и сравнить их на реальных вопросах из своего проекта.
Не гонись за самой большой моделью. Модель с большим количеством параметров обычно умнее, но если она не влезает в видеопамять и начинает тормозить на процессоре, практическая польза резко падает. Лучше стабильно работающая компактная модель, чем монстр, который думает по минуте на предложение.
Важно: не верь красивым цифрам в маркетинговых сравнениях. Реальное качество модели на твоей задаче может сильно отличаться от усреднённых бенчмарков. Проверяй лично.
Требования к железу
Главный вопрос, который возникает после «а можно ли запустить локально?» — «а потянет ли мой компьютер?». Ответ зависит от размера модели и того, на чём ты собираешь её запускать: на видеокарте или на процессоре.
Видеопамять и размер модели
Для локального запуска LLM критически важна видеопамять GPU, если ты хочешь скорость. Модели хранятся в виде огромного количества чисел — весов. Чем больше параметров у модели, тем больше места они занимают в памяти. Если модель не помещается в видеопамять, система начинает использовать оперативную память и процессор, и скорость падает на порядок.
Универсального коэффициента между размером файла и требуемой видеопамятью нет. Помимо весов память занимает KV-кэш контекста, а Ollama может распределять слои между GPU и системной RAM. Чем длиннее заданный контекст и больше параллельных запросов, тем выше расход памяти. После запуска смотри столбец PROCESSOR в ollama ps: он показывает, какая доля модели работает на GPU и CPU.
Квантование
Чтобы запускать большие модели на менее мощном железе, применяют квантование. Это технология, которая уменьшает точность представления весов модели. Вместо того чтобы хранить каждое число в 32 бита, хранят его в 16, 8 или даже 4 бита. Модель становится меньше и быстрее, но немного теряет в качестве.
Квантованная модель — это компромисс для новичка. Она позволяет запустить более крупную модель на слабом железе, но может хуже рассуждать и чаще выдавать бред. С другой стороны, для простых задач вроде объяснения кода или генерации шаблонов потеря качества может быть незаметна.
Запуск на CPU
Если у тебя нет дискретной видеокарты или она слабая, Ollama и другие инструменты позволяют запускать модели на центральном процессоре. Это работает, но медленно. На CPU генерация одного ответа может занимать десятки секунд или даже минуты. Для экспериментов и редких вопросов это терпимо, для ежедневной разработки — нет.
Оперативная память
Даже если модель запускается на GPU, системе нужна достаточная оперативная память. Если видеопамяти не хватает, часть вычислений переносится в RAM. Если не хватает и RAM, система начинает использовать файл подкачки на диске, и скорость падает катастрофически. Поэтому для серьёзной работы с локальными LLM желательно иметь не менее шестнадцати-тридцати двух гигабайт оперативной памяти, а лучше больше.
Диск
Файлы моделей занимают много места. Одна модель может весить от одного до десятков гигабайт. Если планируешь держать несколько моделей для сравнения, позаботься о свободном месте на диске. SSD предпочтительнее HDD: загрузка модели в память происходит быстрее.
Особенности разных платформ
На компьютерах Apple с процессорами M-серии локальные LLM часто работают неплохо благодаря унифицированной памяти, когда процессор и видеоядро используют общий пул RAM. Это значит, что модель, которая на Windows с дискретной видеокартой требует отдельную видеопамять, на MacBook с достаточным объёмом памяти может загрузиться в общий пул. Однако скорость зависит от конкретного чипа и оптимизации инструментов под Metal.
На Windows и Linux стандарт де-факто для локальных LLM — видеокарты NVIDIA с поддержкой CUDA. У них, как правило, лучше совместимость и производительность в инструментах вроде Ollama. Видеокарты AMD тоже работают, но могут требовать дополнительных настроек или быть медленнее из-за менее зрелой поддержки в некоторых раннерах. Запуск только на CPU универсален, но медленный на любой платформе.
Минимальный комплект для старта
Для первого опыта на компьютере с 8–16 ГБ оперативной памяти выбирай модель уровня 2B–4B и оставляй запас системе. Например, файл qwen3.5:4b занимает около 3,4 ГБ. Скорость на CPU зависит от процессора, но для коротких запросов такой вариант обычно реалистичнее, чем кодовая модель на 20–30 млрд параметров.
Видеокарта с 6–8 ГБ памяти подходит для компактных моделей, но не гарантирует комфортную агентную разработку. Ollama по умолчанию выделяет лишь 4 тысячи токенов контекста при объёме VRAM меньше 24 ГБ, тогда как для coding tools рекомендует не менее 64 тысяч. Увеличение контекста заметно повышает расход памяти, поэтому требования нужно проверять на выбранной модели и реальной задаче.
Практический совет: не обновляй железо ради локальной LLM, пока не попробуешь хотя бы одну модель на том, что есть. Часто оказывается, что скорость на CPU терпима для простых задач, а покупка видеокарты не оправдана.
Когда локальная LLM оправдана, а когда нет
Локальная LLM — инструмент с узкой областью применения. Чтобы не разочароваться, важно честно оценивать задачи.
Когда оправдана
Приватность данных. Если ты работаешь с коммерческим кодом, персональными данными, медицинской информацией или просто не хочешь, чтобы твои промпты уходили на чужие серверы, локальная модель — логичный выбор.
Черновики и эксперименты. Нужно быстро сгенерировать шаблон функции, переписать фрагмент кода в другом стиле, придумать названия переменных или получить объяснение простой концепции — локальная модель справится и не сожжёт бюджет.
Оффлайн-работа. Путешествия, места со слабым интернетом, ограниченный трафик — в этих условиях локальная модель остаётся доступной.
Обучение. Если хочешь глубже понять, как устроены языковые модели, поэкспериментировать с разными размерами и настройками, локальный запуск даёт больше контроля.
Снижение зависимости от подписок. Даже если основная работа идёт через облако, наличие локального резерва помогает в ситуациях, когда подписка временно недоступна, закончились кредиты или сервис лежит.
Когда не оправдана
Сложная многошаговая разработка. Если нужно собрать полноценное приложение из множества файлов, настроить интеграции, исправить сложные баги, провести рефакторинг — локальная модель на домашнем железе скорее всего не справится так же хорошо, как Claude Code.
Работа с большими контекстами на ограниченной памяти. Некоторые локальные модели заявляют окна в 256–384 тысячи токенов, но фактически выделенный контекст зависит от настроек и железа. В Ollama при VRAM меньше 24 ГБ значение по умолчанию составляет 4 тысячи токенов.
Скорость критична. Если ты привык получать ответ за секунды и перебирать варианты, медленная локальная модель будет раздражать.
Нет подходящего железа. Запуск на старом ноутбуке без видеокарты может превратить каждый запрос в ожидание. В таком случае проще и продуктивнее использовать облако.
Нужна надёжная интеграция с инструментами. Ollama может запустить Claude Code, OpenCode или Codex с локальной моделью через ollama launch, поэтому собирать всю оболочку вручную уже не обязательно. Ограничением остаётся качество модели: слабый локальный вариант чаще ошибается при выборе инструментов и многошаговых изменениях.
Честный вывод
Локальная модель и Claude Code относятся к разным слоям: модель генерирует ответы, а агентная оболочка даёт ей файлы и инструменты. Их можно соединить, но на домашнем железе качество, скорость и реально доступный контекст часто уступают облачной модели. Локальная связка оправдана, когда важнее контроль над данными, офлайн-работа и отсутствие оплаты за каждый запрос.
Важно: не пытайся заменить облачный ИИ локальным только потому, что «бесплатно лучше». Время, которое ты потратишь на борьбу с тормозами и низким качеством, может стоить дороже месячной подписки.
Практика для курса: локальная модель как черновой помощник рядом с Claude Code
В курсе skillmake основной инструмент — Claude Code. Он помогает собирать приложение, писать код, исправлять ошибки и учиться. Локальная LLM не заменяет его, но может стать полезным черновым помощником.
Сценарий 1: объяснение концепций
Ты изучаешь курсы по нейросетям и натыкаешься на непонятный термин — например, «квантование» или «контекстное окно». Можно спросить локальную модель. Даже если ответ будет не идеален, он даст отправную точку, и потом ты уточнишь у Claude или в документации.
Сценарий 2: приватные эксперименты с кодом
Ты хочешь попробовать идею, но не готов показывать её облачному сервису. Запускаешь локальную модель, просишь сгенерировать прототип функции, смотришь, нравится ли направление. Если идея окажется удачной, переносишь её в основной проект и дорабатываешь с Claude Code.
Сценарий 3: офлайн-работа
Ты в дороге и хочешь подумать над структурой игры. Локальная модель поможет сгенерировать варианты названий, описать логику столкновений змейки с едой или предложить способ хранения рекорда. Полноценно кодить офлайн всё равно сложно, но черновики получить можно.
Сценарий 4: резервный вариант
Интернет пропал, подписка временно недоступна, или ты просто хочешь дать отдохнуть облачному бюджету. Локальная модель решает простые вопросы, пока основной инструмент недоступен.
Чего не стоит делать
Не переноси разработку «Змейки» на локальную модель только ради экономии. Через агентную оболочку она может видеть структуру проекта и запускать тесты, но компактной модели часто не хватает качества для сложного бага в нескольких файлах. Сначала проверь её на копии проекта и сравни результат с облачным ассистентом.
Рекомендуемый рабочий процесс
- Основная разработка — в Claude Code.
- Локальная LLM — для простых вопросов, черновиков и приватных экспериментов.
- Если локальная модель не справляется — не форсируй, переноси задачу в облако.
- Периодически проверяй, действительно ли локальная модель экономит время, или ты тратишь его на настройку.
Главная мысль: локальная LLM — это как блокнот и карандаш рядом с мощным станком. В блокноте удобно набросать идею, но станок делает деталь.
Распространённые ошибки новичков
Первые шаги с локальными LLM часто сопровождаются типичными заблуждениями. Если их избежать, опыт будет гораздо приятнее.
Ошибка 1: ожидать качества облачного ИИ
Самая частая ошибка — думать, что локальная модель за несколько гигабайт будет такой же надёжной, как сильный облачный агент. Компактные модели хуже понимают сложные инструкции, чаще путаются в контексте и могут выдавать уверенно звучащий, но неработающий код. Настрой ожидания заранее: небольшой локальный вариант лучше начинать использовать с простых и проверяемых задач.
Ошибка 2: сразу гнаться за самой большой моделью
Новички часто скачивают самый крупный доступный вариант, потому что «больше параметров — значит лучше». Но если модель не влезает в видеопамять, она начинает тормозить на процессоре, и практическая польза падает. Иногда компактная модель даёт ответ за секунды, тогда как большая думает минуту. Начинай с малого и увеличивай размер только если железо позволяет.
Ошибка 3: пытаться заменить Claude Code полностью
Не путай модель и агента. Файлы, команды и тесты подключает Claude Code, OpenCode, Codex или другая оболочка; Ollama умеет запускать такие интеграции командой ollama launch. Но наличие инструментов не исправляет слабое планирование модели, поэтому начинай с ограниченного доступа и проверяй каждое изменение.
Ошибка 4: игнорировать квантование
Квантование позволяет запускать большие модели на слабом железе, но сильно урезанная точность может превратить умную модель в бесполезную. Если ответы получаются бессвязными или модель начинает фантазировать, попробуй версию с меньшим уровнем квантования или более компактную модель без агрессивного сжатия.
Ошибка 5: забывать про контекст
Заявленное окно модели и реально выделенный контекст — не одно и то же. Большой контекст расходует дополнительную память, поэтому Ollama уменьшает значение по умолчанию на системах с небольшой VRAM. Проверяй настройку контекста, передавай только нужные файлы и следи за загрузкой через ollama ps.
Ошибка 6: покупать железо до экспериментов
Легко увлечься идей «своего ИИ» и купить видеокарту или нарастить память, не проверив, действительно ли это нужно. Сначала попробуй запустить модель на том, что есть. Если локальная LLM приживётся в рабочем процессе — тогда можно думать об апгрейде. Часто оказывается, что облачный ИИ покрывает большинство задач быстрее и дешевле.
Частые вопросы
Нужен ли мощный компьютер, чтобы попробовать локальную LLM?
Нет. На ноутбуке с 8–16 ГБ оперативной памяти можно попробовать вариант уровня 2B–4B, например qwen3.5:4b. Для более крупных кодовых моделей и длинного контекста требования быстро растут; сама цифра 6–8 ГБ VRAM не гарантирует комфортную агентную работу.
Локальная LLM бесплатная?
Локальный Ollama можно использовать без оплаты за токены, но у каждой модели своя лицензия. Облачные теги :cloud выполняются на серверах Ollama, требуют аккаунта и подчиняются тарифам и лимитам. Для локального режима остаются расходы на электричество, диск и железо.
Может ли локальная модель полностью заменить Claude Code?
Технически Claude Code можно запустить с поддерживаемой локальной моделью через ollama launch claude. Он сохранит доступ к файлам и терминалу, но результат будет зависеть от качества модели, памяти и фактической длины контекста. На обычном домашнем железе такая связка чаще служит резервом или средой для экспериментов, а не равноценной заменой сильной облачной модели.
Какую модель выбрать для начала?
Для первого запуска подойдёт qwen3.5:4b размером около 3,4 ГБ; при большем запасе памяти можно сравнить qwen3.5:9b. Qwen3-Coder 30B, gpt-oss 20B и Devstral Small 2 заметно тяжелее. Сверь размер тега в каталоге Ollama, затем проверь одну-две модели на одинаковых задачах.
Безопасно ли отправлять код в облачный ИИ?
Это зависит от политики конкретного сервиса. Крупные платформы обычно заявляют, что не используют данные пользователей платных тарифов для обучения, но факт передачи данных на сервер остаётся. Если код содержит секреты, пароли, токены API или чувствительную информацию, их никогда не стоит отправлять никуда — ни в облако, ни в локальную модель. Подробнее о безопасности — в статье хранение секретов и токенов.
Почему локальная модель даёт плохие ответы?
Причины обычно три: модель слишком маленькая для задачи, она запущена в слишком сильно квантованном виде, или железо не справляется и работа идёт на процессоре. Попробуй взять модель побольше, уменьшить квантование или запустить на видеокарте. Если не помогает — задача, скорее всего, слишком сложна для локального ИИ, и пора обратиться к облачному ассистенту.
Заключение
Локальную модель можно запустить на своём компьютере без оплаты за каждый запрос и, при отключённых облачных и сетевых функциях, без передачи промптов провайдеру. Через Ollama это делается несколькими командами. Claude Code тоже можно подключить к поддерживаемой локальной модели, но наличие агентных инструментов не делает компактную модель равной сильной облачной.
Для новичка локальная LLM полезна как черновой помощник: она поможет объяснить термин, сгенерировать простую функцию, поработать офлайн или поэкспериментировать с приватной идеей. При желании её можно подключить к агентной оболочке с доступом к проекту и терминалу, но сначала ограничь права и сравни качество с облачным вариантом.
Не покупай дорогое железо ради локальной модели, пока не убедился, что тебе это реально нужно. Начни с Ollama, скачай одну небольшую кодовую модель и задай ей несколько вопросов. Если инструмент приживётся — отлично, у тебя появится приватный резерв. Если нет — ничего страшного, Claude Code и другие облачные сервисы покрывают основные задачи разработки гораздо лучше.
Главное правило: локальная LLM — это дополнение к рабочему процессу, а не его замена. Используй её там, где она сильна, и не пытайся заставить делать то, что ей не по силам.
Читай дальше
Все статьиНе просто статьи — тебя доведут до результата
В практикуме за 1999 ₽ рядом живая команда практикующих разработчиков и маркетологов: ведём по шагам до твоего работающего приложения. Не «ролики и сам разбирайся» — помогаем на каждом затыке.
Перейти к практикуму