Монтажерам відео приготуватися на вихід! NVIDIA показала “вбивцю монтажерів” – нейромережу Text2LIVE. Нова ШІ вміє накладати на відео будь-які ефекти, сформульовані простим текстом.
Ми представляємо метод маніпулювання зовнішнім виглядом природних зображень та відео на основі текстових підказок. Зокрема, маючи вхідне зображення або відео та цільову текстову підказку, наша мета полягає в тому, щоб відредагувати зовнішній вигляд існуючих об’єктів (наприклад, текстуру об’єкта) або доповнити сцену новими візуальними ефектами (наприклад, дим, вогонь) у семантично значущий спосіб.
Наш фреймворк навчає ШІ генератор, використовуючи внутрішній набір навчальних прикладів, витягнутих з одного входу (зображення або відео та цільової текстової підказки), одночасно використовуючи зовнішню попередньо навчену CLIP-модель для визначення наших втрат.
Замість того, щоб безпосередньо генерувати відредагований результат, наша ключова ідея полягає у створенні шару редагування (колір+прозорість), який накладається на вихідні дані. Це дозволяє нам обмежити процес генерації і зберегти високу точність вихідних даних завдяки новим втратам, що залежать від тексту, які застосовуються безпосередньо до шару редагування.
Наш метод не покладається на попередньо навчений генератор і не потребує масок редагування, наданих користувачем. Таким чином, він може виконувати локалізоване семантичне редагування природних зображень високої роздільної здатності та відео з різноманітними об’єктами та сценами.
Пока что, всё это выглядит достаточно некачественно и непрофессионально.
Нічого, за декілька років вони доведуть технологію до нормального рівня.