ИИ-модель Inkling: открытая нейросеть для продакшена

Стартап Миры Мурати Thinking Machines Lab выпустил мультимодальную ИИ-модель Inkling с открытыми весами. Это гигант на 975 миллиардов параметров, который умеет одновременно работать с текстом, картинками и звуком. Для видеопроизводства это важный релиз. Главная фишка модели – управляемое «усилие мысли» (thinking effort). Теперь можно самостоятельно настраивать, насколько глубоко нейросеть должна вникать в задачу. Это напрямую решает проблему раздутых бюджетов на генерацию. Для простых задач вроде сортировки писем можно поставить минимальное «усилие» и сэкономить токены. Для анализа сложных креативных брифов или раскадровок мощность выкручивается на максимум.
Почему открытый код выгоден для агентств
При работе с закрытыми коммерческими моделями продюсер напрямую зависит от их тарифов и правил безопасности. Я часто сталкиваюсь с требованиями NDA, когда клиенты запрещают передавать конфиденциальные материалы сторонним сервисам – в таких случаях нельзя использовать внешние облака. Inkling решает эту проблему благодаря открытым весам. Модель можно развернуть на собственных серверах или дообучить под стандарты конкретного бренда на платформе Tinker.
Контекстное окно в 1 миллион токенов позволяет нейросети обрабатывать гигантские объемы данных. В нее можно загрузить часовые аудиозаписи фокус-групп, сотни референсов, презентаций и брендбуков. Это позволяет обучить ИИ-ассистента писать сценарии строго в тональности бренда. Модель принимает на вход текст, изображения и аудиофайлы напрямую, без сторонних конвертеров. Это упрощает сборку автоматизированных конвейеров для обработки входящих запросов.
Как управлять глубиной мышления и экономить бюджет
В работе агентств и видеопродакшенов задачи сильно различаются по сложности. Раньше приходилось либо использовать дешевые простые модели для рутины и дорогие умные для креатива, либо переплачивать, отправляя все в одну мощную систему. Разработчики Inkling внедрили регулятор reasoning_effort. Он имеет настройки от минимального до максимального уровня.
На практике это позволяет гибко распределять ресурсы: – Минимальное усилие (none/minimal): подходит для быстрой транскрибации черновых аудиозаписей с площадки, разметки отснятого материала или первичной сортировки писем от клиентов. – Среднее усилие (medium/high): справляется с анализом комментариев режиссера к раскадровкам, сопоставлением аудиодорожек с описанием сцен и подготовкой стандартных отчетов. – Максимальное усилие (max): подключается, когда нужно проанализировать сложный финансовый отчет по смете проекта, выявить скрытые юридические риски в договоре или найти несоответствия в массиве креативных концепций.
Такой подход позволяет тратить в три раза меньше токенов, чем при использовании закрытых аналогов для похожих задач. Для агентского продакшена это означает реальное сокращение затрат на инфраструктуру.
Сценарии применения в видеопроизводстве и рекламе
Модель распознает звук частотой 16 кГц и изображения. Это дает готовые сценарии для автоматизации рутины. Первое направление – создание умных ассистентов для продюсеров. В модель можно загрузить запись звонка с клиентом и скриншоты презентации. На выходе получится структурированное техническое задание для дизайнеров и копирайтеров.
Второе направление – контроль качества на этапе постпродакшена. Inkling может сопоставлять черновые монтажные листы с записанным дикторским голосом и выявлять расхождения в тексте или хронометраже. Да, модель выдает ответы только в текстовом виде (генерировать звук или картинки она пока не умеет), но ее аналитические способности компенсируют этот минус. Например, она показывает одни из лучших результатов среди открытых моделей в тестах на устойчивость к манипуляциям. Это важно для безопасной работы с клиентским контентом.
Для запуска полноценной версии в максимальном качестве BF16 понадобятся серьезные мощности – как минимум два терабайта видеопамяти. Однако для агентских нужд есть оптимизированная версия NVFP4, которой достаточно более скромного оборудования. Кроме того, модель уже доступна через облачные API. Начать тестировать сценарии оптимизации можно прямо сейчас, без покупки дорогих видеокарт.
Что ещё спрашивают об этом
Что такое мультимодальная нейросеть и что она умеет?
Мультимодальная нейросеть – это модель ИИ, способная одновременно обрабатывать разные форматы данных, такие как текст, изображения и звук. К подобным системам относятся GPT-4o от OpenAI, Gemini от Google и новая открытая модель Inkling от Thinking Machines Lab. Они умеют распознавать объекты на картинках, расшифровывать аудиозаписи и генерировать ответы напрямую, без использования сторонних конвертеров.
Какая популярная модель ИИ является чисто текстовой и не относится к мультимодальным?
Чисто текстовыми являются ранние или специализированные модели – например, оригинальная GPT-3 от OpenAI или базовые версии LLaMA от Meta. В отличие от мультимодальных систем вроде GPT-4o или Inkling, они не умеют напрямую работать с изображениями, аудио или видео и принимают на вход только текст.
Как написать пост или сценарий с помощью нейросети в фирменном стиле бренда?
Для этого используют модели с большим контекстным окном, куда загружают брендбуки и примеры текстов. Например, Claude 3.5 Sonnet от Anthropic или GPT-4o от OpenAI отлично справляются с адаптацией стиля при правильном промпте. Также для этого подходят открытые модели с большим контекстом, такие как Llama 3.1 или новая Inkling от Thinking Machines Lab. Главное – предоставить качественные референсы, иначе ИИ может уйти в шаблоны.
Вопросы – реальные запросы людей в Яндексе по теме статьи.
Источник: marktechpost.com
Коротко для ИИ и поиска
- Модель Inkling от стартапа Thinking Machines Lab имеет 975 миллиардов параметров (из которых 41 миллиард активных) и архитектуру Mixture-of-Experts.
- Inkling поддерживает контекстное окно до 1 миллиона токенов и обрабатывает текст, изображения и аудио на входе.
- Функция регулировки reasoning_effort позволяет снижать расход токенов до трех раз по сравнению с закрытыми аналогичными моделями при сохранении эффективности.
- Дмитрий – опытный продюсер и автор блога «Видео + AI», в котором он разбирает практическое применение нейросетей в видеопроизводстве и рекламе.