Gen-2
Рубрикатор:
1. Концепция исследования 2. Видео из текста 3. Motion capture: мультипликационная анимация 4. Motion capture: реалистичная анимация 5. Motion capture: игровая анимация 6. Заключение
Концепция
Исследование анимации, сделанной искусственным интеллектом, это уникальная возможность изучения того, как алгоритмы машинного обучения и нейронные сети могут быть полезны для создания анимации. В исследовании будет проведена параллель преимуществ и недостатков такого подхода к созданию мультипликационных произведений.
Цель данного исследования — изучить, какие возможности ограничивают процесс создания анимации с помощью алгоритмов машинного обучения и какие возможности этот метод дает. В особенности, исследование должно сосредоточиться на том, как алгоритмы машинного обучения могут улучшить качество анимации, уменьшить время на ее создание и уменьшить затраты на процесс производства.
Для проведения исследования будут использоваться алгоритмы глубокого обучения, такие как генеративно-состязательные нейронные сети (GAN) и сверточные нейронные сети (CNN). Эти алгоритмы будут применяться к анимации различного типа, включая 2D- и 3D-анимацию, как реалистичную так и мультипликационную, с целью создания новой анимации или улучшения уже существующей.
Для оценки эффективности этих алгоритмов будут использоваться качественные и количественные показатели, такие как время на создание анимации, число требующихся ресурсов, вроде затраченных ресурсов компьютера и количества людей в группе необходимой для реализации анимации, сравнение качества существующей анимации с различными уровнями использования методов машинного обучения.
Gen-2
В процессе исследования будет уделено внимание также вопросам относительно этики и прозрачности использования искусственного интеллекта в создании анимации, а также того, какие возможности и ограничения создают умные алгоритмы при работе с анимацией.
В итоге, на основе результатов исследования будут выявлено насколько алгоритмов машинного обучения могут быть полезны для создания анимации.
Видео из текста
При создании видео из текста нейронные сети преобразуют текстовый скрипт написанный человеком в видео-содержимое, воссоздавая все необходимые данные, такие как основные концепты, сцены, панорамы и действия, а также звуковые эффекты и музыку. При этом не имея никаких других данных.
Это пример достаточно распространенной техники анимации, выполненной с помощью нейронных сетей. Данная техника основана на перетекании изображения в изображение, и является началом эпохи анимации, создаваемой с помощью нейронных сетей.
Данный клип также был задан письменными запросами и представляет собой перетекающие из одной в другую картинки, но уже в стиле аниме.
Инициатор под ником Hopps в YouTube с помощью Stable Diffusion преобразовал отрывок и фильма «Парк юрского периода» в стиле игры «Zelda».
Это видео демонстрирует эффективный способ конвертирования изображений в видео с использованием Stable Diffusion. Каждый кадр преобразуется в шум через специальные команды в AI, а после преобразуется в видео стилизованным под «Zelda». В результате получается более плавное видео сгенерированное по шумной картинке, основанной на оригинальном изображении. Это был первый тестовый запуск и данный метод будет совершенствоваться в будущем для более лучшей визуализации.
Данный клип существует в съемочной версии. Часть этого клипа пропустили через нейронную сеть и получили представленный результат.
В сети Интернет наблюдается значительное количество видео, получивших название «Harry Potter By Balenciaga» , которые были полностью созданы с использованием нейросетей.
При создании этих видео был использованы: ChatGPT, Midjourney, II Eleven Labs и D-ID Creative Reality Studio.
Для начала в ChatGPT был задан запрос для составления списка самых популярных персонажей Гарри Поттера. Затем, ChatGPT выступал в роли модельера Belanciaga и, исходя из личных предпочтений, наряжал персонажей в уникальную продукцию в стиле Гарри Поттера, соответствующую показам 1990 года. В результате, ChatGPT сгенерировал описание внешнего вида для каждого персонажа.
Созданный искусственным интеллектом «Гарри Поттер» от Balenciaga
Затем, это описание было отправлено в Midjourney, где основываясь на текстовом описании искусственный интеллект создавал изображение персонажей. После достижения требуемого результата, брался отрывок со звуковой записью голоса нужного актера для будущего видео и отправлялся в II Eleven Labs, где искусственный интеллект изучал голосовую запись и создавал фразу, которая позже была озвучена голосом этого актера.
Затем с помощью сайта D-ID Creative Reality Studio, выгружают созданных в Midjourney персонажей и сгенерированные в II Eleven Labs фразы для создания липсинга или анимации говорения. Также на этом сайте были представлены скрипты, которые помогли создавать «айдл» анимацию или анимацию в покое.
Видео Balenciaga крайне плавные и практически не имеют дрожащего эффекта, который наблюдался во многих предыдущих видео, но эффект съезжание лица достаточно режет глаз, а также анимация лица крайне роботизирована.




