← ИИ на устройстве: модели у вас в руках

Запускаем модель у себя

⏱ ~8 мин · награда +35 XP

Цели урока:
  • Запустить локальную модель минимальными шагами
  • Проверить ограничения своего железа

Запускаем модель у себя

Поработаем руками: запустим локальную модель. Способ — рантайм-запуск (например, через ollama, llama.cpp или LM Studio — выбирайте что стоит/или что удобнее).

🧠 Запомни: минимальный запуск = модель + runtime + запрос.

Шаг 1. Проверьте железо (1 мин)

Посмотрите объём ОЗУ и наличие GPU/метал-ускорения. Правило: разумнее начинать с модели 10–15B, а не 30B, если ноутбук без мощного GPU.

Шаг 2. Установите runtime (2 мин)

Установите рантайм по официальной инструкции (ctl + платформа). Проверьте командой, что рантайм отвечает.

Шаг 3. Загрузите модель и спросите (2 мин)

Загрузите одну модель недели (например, Muse Glimmer 30B или любую доступную) и задайте простой вопрос. Запишите: скорость, качество, сколько памяти заняло.

Шаг 4. Ускорьте запрос (1 мин)

Включите настройки ускорения (quantization: Q4, ускорение GPU/CPU). Сравните скорость до и после.

🛠 Попробуй: отправьте один и тот же вопрос локальной модели и облачной. Сравните качество ответа и время.

⚠️ Ловушка: не скачивайте модели из случайных источников без проверки. Ставьте из официальных реестров. Модель — это программа, она выполняется на вашем устройстве.

Итог

  • Минимальный цикл: железо → runtime → модель → запрос.
  • Quantization и ускорение меняют скорость ощутимо.
  • Скачивайте модели только из проверенных источников.

Проверка: Проверка: запускаем модель

Порог прохождения: 80%. Нажмите «Проверить» — получите объяснение к каждому ответу.

1. Минимальный цикл запуска локальной модели — это...
2. Что выбрать для ноутбука без мощного GPU?
3. Скачивать модели можно из любых источников, они безопасны по умолчанию.
4. Quantization (например, Q4) может заметно ускорить локальный запуск.
Запомнить надолгоФлешкарты курса