Немецкая компания Black Forest Labs, известная благодаря семейству моделей FLUX для генерации изображений, представила FLUX 3 — свою первую мультимодальную модель искусственного интеллекта. В отличие от предыдущих версий, новинка умеет не только создавать изображения, но и генерировать видео со встроенным звуком, а также выступает основой для управления промышленными роботами. Разработчики считают, что это шаг к созданию универсального ИИ, который сможет одинаково эффективно работать как в цифровой, так и в физической среде. Главное отличие FLUX 3 заключается в том, что модель изначально обучалась одновременно на изображениях, видео и аудио. По словам Black Forest Labs, именно такой подход позволяет ИИ формировать более глубокое понимание окружающего мира. Вместо отдельных моделей для разных задач компания создала единую архитектуру, способную понимать взаимосвязи между движением объектов, их внешним видом и сопровождающими звуками.
Видео со звуком в одном запросе
Читайте также
NVIDIA и Microsoft анонсировали RTX Spark: чип который сам будет управлять компьютером
Одной из ключевых возможностей FLUX 3 стала генерация видеороликов продолжительностью до 20 секунд с синхронным звуком. Модель способна создавать речь персонажей, шум окружающей среды и звуковые эффекты одновременно с изображением, избавляя пользователей от необходимости отдельно озвучивать ролики.
Разработчики отмечают, что система поддерживает несколько сценариев работы:
генерацию видео по текстовому описанию;
создание роликов на основе изображения;
преобразование одного видео в другое;
продолжение существующего видео со звуком;
создание анимированных переходов между ключевыми кадрами;
генерацию многоязычных диалогов.
Кроме того, FLUX 3 умеет работать в различных художественных стилях, сохранять внешний вид персонажей между сценами и создавать ролики с высокой точностью отображения текста.
От генерации контента — к робототехнике
Наиболее неожиданной частью анонса стало применение той же модели в робототехнике. Совместно с компанией mimic robotics разработчики создали систему FLUX-mimic, которая использует внутреннее представление мира, сформированное FLUX 3, для управления роботизированными манипуляторами. В Black Forest Labs считают, что если ИИ способен реалистично предсказывать развитие событий в видеоролике, то он также может понимать физические свойства объектов — их массу, движение, взаимодействие и причинно-следственные связи. Именно эти знания необходимы промышленным роботам при выполнении реальных задач. По данным компании, ранняя версия FLUX-mimic уже проходит испытания на производственных площадках Audi, где используется для автоматизации операций на сборочных линиях.
Первые сравнения с конкурентами
Хотя FLUX 3 пока находится на стадии “Ранний доступ”, Black Forest Labs уже опубликовала результаты предварительных сравнений. По внутренним тестам компании, пользователи чаще отдавали предпочтение роликам FLUX 3 по сравнению с видео, созданными рядом популярных генеративных моделей. В частности, разработчики заявляют о преимуществе над Runway Gen-4.5, Luma Ray 3.2, Kling v3 Pro и несколькими другими системами. При этом компания подчеркивает, что тестирование продолжается, а качество модели еще будет улучшаться.
Последние месяцы показывают, что рынок ИИ постепенно смещается от узкоспециализированных моделей к универсальным мультимодальным системам. Аналогичным направлением занимаются OpenAI, Google, Meta и другие ведущие лаборатории, однако Black Forest Labs делает ставку на объединение генерации контента и управления физическими устройствами в рамках одной архитектуры. Если этот подход подтвердит свою эффективность, подобные модели смогут не только создавать реалистичные изображения и видео, но и управлять роботами, промышленным оборудованием, автономными машинами и другими интеллектуальными системами. FLUX 3 демонстрирует, что граница между генеративным ИИ и «физическим искусственным интеллектом» постепенно начинает исчезать, открывая дорогу новому поколению универсальных моделей.





