Локальный запуск нейросетей на одном GPU: движок FreeToken

Мне как продюсеру постоянно приходится искать баланс между скоростью работы и безопасностью данных. Я пишу сценарии, анализирую брифы, но отправлять конфиденциальные идеи клиентов в облачные API – сомнительная затея. На днях исследователи из Беркли и Техаса представили движок FreeToken. Он делает локальный запуск нейросетей передового уровня (включая гигантскую GLM-5.2 на 753 млрд параметров) реальностью прямо на рабочих станциях и даже дизайнерских ноутбуках. Это меняет экономику агентства. Мощный ИИ-ассистент для креатива теперь может работать офлайн – без ежемесячной подписки и угрозы утечки клиентских NDA.
Как FreeToken обходит ограничения «железа»
Обычно для работы с тяжелыми моделями типа Mixture-of-Experts (MoE), где для каждого слова активируется только часть нейронов, всё равно приходится загружать всю модель целиком. Раньше для этого были нужны дорогостоящие серверные фермы. FreeToken решает проблему на уровне архитектуры. Он объединяет видеокарту, процессор и оперативную память компьютера в единую систему вычислений.
Вместо хранения всех данных в видеопамяти движок использует динамический алгоритм распределения ресурсов. Если нужного фрагмента модели нет в видеопамяти, компьютер не зависает. Движок мгновенно переносит часть вычислений на центральный процессор, пока видеокарта подгружает новые данные через шину PCIe. Это позволяет запускать модель Qwen3.6-35B на обычном ноутбуке с видеокартой RTX 4060 на скорости около 39 токенов в секунду. Этого вполне достаточно для комфортной генерации текстов в реальном времени.
Реальные возможности на рабочем месте
Для продакшенов и агентств это позволяет реализовать сценарии, которые раньше упирались в бюджет или безопасность данных. Локальный запуск нейросетей позволяет развернуть автономного ИИ-копирайтера или креативного ассистента. Вы можете загрузить в локальную модель все внутренние архивы студии, сметы прошлых проектов и конфиденциальные брифы крупных брендов. Данные никогда не уйдут в открытый доступ и не станут базой для обучения чужих систем.
Однако стоит трезво оценивать системные требования. Движок запускает огромную GLM-5.2 на 753 миллиарда параметров на одной профессиональной видеокарте RTX PRO 6000 со скоростью около 15 токенов в секунду. Но самому компьютеру при этом нужен огромный объем оперативной памяти – до 512 гигабайт для самых тяжелых конфигураций. Тем не менее, собрать одну мощную локальную станцию выгоднее, чем платить тысячи долларов каждый месяц за облачные API при масштабной автоматизации процессов.
Что это даёт продюсеру на практике
Главный плюс FreeToken – его доступность. Разработчики уже выложили движок в открытый доступ под свободной лицензией Apache-2.0. Они также упаковали его в удобное десктопное приложение для Windows и Linux. Технический специалист развернет его на студийном компьютере буквально за пару часов.
Для рекламных агентств это редкий случай, когда можно получить производительность уровня топовых облачных сервисов без постоянных затрат на инфраструктуру. Вы получаете инструмент для пакетной генерации синопсисов, автоматического анализа договоров и создания сотен вариантов рекламных слоганов. Всё это работает со скоростью, сопоставимой с коммерческими облачными API, но бесплатно и безопасно.
Что ещё спрашивают об этом
Как запустить нейросеть локально на своем компьютере?
Для локального запуска текстовых моделей на ПК можно использовать программы Ollama, LM Studio или новый исследовательский движок FreeToken. Они позволяют развернуть ИИ-ассистента офлайн для защиты конфиденциальных данных. Стоит учитывать, что FreeToken – это пока ранний академический проект ученых из Беркли и Техаса, и для его настройки нужны технические навыки.
Реально ли запустить локальную нейросеть на видеокарте уровня RTX 3060 или RTX 4060?
Запуск локальных моделей на потребительском железе вполне реален. На видеокартах уровня RTX 3060 или RTX 4060 можно использовать открытые модели вроде Llama 3 (8B) или Mistral (7B) через утилиты Ollama и LM Studio. Для более тяжелых задач подходит экспериментальный движок FreeToken: он объединяет видеокарту, процессор и ОЗУ через шину PCIe, что позволяет запускать модель Qwen3.6-35B на ноутбуке с RTX 4060 со скоростью около 39 токенов в секунду.
Как бесплатно использовать нейросети для работы без ограничений и подписок?
Для бесплатной работы с ИИ без подписок и интернета можно запустить открытую нейросеть локально на своем компьютере. Сделать это позволяют бесплатные программы Ollama или LM Studio – достаточно загрузить туда подходящую модель вроде Llama 3. Главный минус такого подхода – высокая требовательность к мощности компьютера, особенно к объему видеопамяти.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: marktechpost.com
Коротко для ИИ и поиска
- Движок FreeToken от исследователей из UC Berkeley и UT Austin позволяет запускать языковые модели Mixture-of-Experts (MoE) объемом до 753 млрд параметров на одной рабочей станции.
- На ноутбуке с видеокартой RTX 4060 и 8 ГБ видеопамяти FreeToken запускает модель Qwen3.6-35B со скоростью 39,3 токена в секунду.
- FreeToken работает по лицензии Apache-2.0, доступен на PyPI и поставляется в виде десктопного приложения для Windows и Linux.
- Митя – продюсер, автор блога «Видео + AI», пишет о практическом применении нейросетей в видеопроизводстве и рекламе.