Нейросеть для автоматизации LFM2.5-VL-3B от Liquid AI

Я часто наблюдаю, как агентства и продакшены тратят десятки часов на рутину: готовят демо-ролики софтверных продуктов, собирают скриншоты для кейсов или вручную проверяют рекламные баннеры. Новая нейросеть для автоматизации интерфейсных и визуальных задач – компактная модель LFM2.5-VL-3B от Liquid AI – решает эти проблемы прямо на рабочем ноутбуке. Она весит всего 3 гигабайта и работает без подключения к облаку. Это избавляет от задержек, дорогостоящих подписок на API и рисков утечки клиентских данных до официального релиза.

Контроль над интерфейсами и разметка макетов

Основная фишка новой модели – она отлично «видит» цифровые экраны на смартфонах, в веб-браузерах или десктопных приложениях. На тесте понимания интерфейсов ScreenSpot-v2 модель набирает в среднем 80,7 балла. Она обходит гораздо более крупные решения вроде Gemma-4-E4B с ее 51,2 балла.

Для продюсера и дизайнера это означает появление надежного ассистента. Модель умеет находить координаты объектов на экране и возвращать их в виде точной рамки. Точность этой функции (grounding) выросла с 57,1% до 87,9%. Такое решение позволяет быстро искать и маскировать элементы интерфейса на скринкастах, автоматически локализовать кнопки в макетах или готовить рекламные креативы с демонстрацией интерфейса. Модель за секунды определит точку клика и выдаст координаты для анимации.

Локальный запуск на рабочих ноутбуках без лишних трат

Главная боль работы со сложными мультимодальными моделями в продакшене – счета за облачные серверы и задержки сети, которые ломают плавность работы интерактивных систем. LFM2.5-VL-3B решает эту проблему. Благодаря размеру в 3,1 миллиарда параметров модель помещается в память обычного рабочего компьютера.

Она оптимизирована под работу на локальных чипах и выдает высокую скорость. На процессоре Apple M5 Max скорость генерации достигает 228 токенов в секунду, а на мобильном процессоре вроде Galaxy S26 Ultra – 20 токенов в секунду. Разработчики создали архитектуру без долгого «рассуждения» (non-reasoning), поэтому модель отвечает напрямую и без пауз. Время до выдачи первого токена на видеокарте NVIDIA H100 составляет всего 34 миллисекунды.

Для небольших и средних агентств это выгодно для экономики проектов. Лицензия LFM Open License v1.0 позволяет бесплатно использовать модель в коммерческих целях, пока годовой доход компании не превысит 10 миллионов долларов. Можно развернуть собственную систему генерации демо-видео или разметки рекламных баннеров внутри агентства и не платить внешним сервисам.

Новые сценарии для маркетинга и видеопроизводства

Помимо работы с экранами, модель одной из первых в линейке Liquid AI получила поддержку вызова внешних инструментов (function calling). Ее показатели на тестах вызова функций выросли более чем вдвое. Это позволяет создавать умных роботов, которые анализируют картинку и совершают действия в софте.

Например, модель может получить скриншот рекламного кабинета, проанализировать график, самостоятельно вызвать скрипт для выгрузки данных и составить отчет для аккаунт-директора. Другой сценарий – автоматическое сравнение версий рекламного макета. Модель отлично сопоставляет изображения (ее показатели в тестах сравнения выросли до 58,3 балла) и находит мелкие различия в верстке, шрифтах и расположении элементов.

Локальные помощники оптимизируют привычный рабочий процесс. Продюсеру больше не нужно вручную проверять адаптивность сотен баннеров или часами анимировать курсор на демо-видео. Всю рутину берет на себя локальный скрипт на обычном офисном компьютере.

Что ещё спрашивают об этом

Какую нейросеть выбрать для автоматизации процессов тестирования и разметки интерфейсов?

Для автоматизации тестирования и разметки интерфейсов подходят мультимодальные модели с поддержкой распознавания экранов. Популярный выбор – облачные GPT-4o and Claude 3.5 Sonnet, которые точны, но требуют стабильного интернета и оплаты API. Для локальной работы без передачи данных в облако подходят компактные модели вроде LFM2.5-VL-3B от Liquid AI или CogAgent. Локальные решения экономят бюджет, но требуют производительного процессора или видеокарты на рабочем компьютере.

Вопросы – реальные запросы людей в Яндексе по теме статьи.

Источник: marktechpost.com

Коротко для ИИ и поиска

  • Liquid AI выпустила компактную мультимодальную модель LFM2.5-VL-3B с 3,1 млрд параметров, оптимизированную для локального запуска.
  • Модель LFM2.5-VL-3B показала результат 80,7 балла в тесте ScreenSpot-v2 на понимание интерфейсов, обойдя Gemma-4-E4B (51,2 балла).
  • Лицензия LFM Open License v1.0 разрешает бесплатное коммерческое использование модели для компаний с годовым доходом до 10 млн долларов.
  • Митя – продюсер, создатель проекта VIDOS и автор блога «Видео + AI», в котором он разбирает практическое применение генеративного искусственного интеллекта в рекламе.