Диффузионные Модели в Видении
Идем дальше, к значительно более важному.
https://arxiv.org/pdf/2209.04747.pdf
На картинке представлена общая структура, состоящая из трех альтернативных формулировок моделей диффузии, основанных на: стохастических дифференциальных уравнениях (SDE), шумоподавляющих диффузионных вероятностных моделях (DDPM) и сети оценки с учетом шума (NCSN). В общем случае диффузионная модель состоит из двух процессов.
Первый процесс, называемый прямым процессом, преобразует данные в шум, а второй представляет собой порождающий процесс, который реверсирует Эффект прямого процесса. Этот последний процесс учится преобразовывать шум обратно в данные.
Проиллюстрируем эти процессы для всех трех формулировок.
Прямой SDE показывает, что изменение x во времени моделируется функцией f плюс стохастический компонент ∂ω ∼ N(0,∂t), масштабированный с помощью σ(t). Мы
подчеркните, что разный выбор f и σ приведет к разным процессам диффузии. Вот почему формулировка SDE является обобщением других двух.
Обратное (генеративное) SDE показывает, как изменить x, чтобы восстановить данные из чистого шума. Мы сохраняем случайную составляющую и модифицируем
детерминированную, используя градиенты логарифмической вероятности ∇x log pt(x), так что x перемещается в области, где плотность данных p(x) высока. DDPM
выборка точек данных во время прямого процесса из нормального распределения N xt;√1−βt·xt−1,βt·I , где βt ≪ 1 медленно уничтожает информацию в данных и заменяет ее гауссовским шумом. Выборка иллюстрируется приемом репараметризации (подробности см. Раздел 2.1). Обратный процесс DDPM также выполняет итеративную выборку из нормального распределения, но среднее значение μθ(xt,t) распределения получается путем вычитания шума, оцененного нейронной сетью, из изображения на предыдущем шаге xt. Дисперсия равна используемой
в прямом процессе. Исходное изображение, идущее в обратном процессе, содержит только гауссовский шум. Прямой процесс NCSN просто добавляет
нормальный шум к изображению на предыдущем шаге. Это также можно рассматривать как выборку из нормального распределения N (xt; xt−1, (σ2 − σ2 )) · I), с t t−1
означает быть изображением на предыдущем шаге. Обратный процесс NCSN основан на алгоритме, описанном в разделе 2.2. Лучше смотреть в цвете.

Смотрим на картинку, видите зайчика с его временной линией жизни.
Допустим мы начали делать снимки зайчика в нулевой момент времени и продолжаем их делать в реале до момента времени t.
Дальше - будущее, к последнему снимку добавляется шум с целью уничтожения информации, т.е. Жизни. Таким образом создается несуществующая (пока) временная линия для зайчика, вплоть до терминальной отметки, т.е. Смерти Зайчика.
Модель учится ВОССОЗДАВАТЬ Исходную картинку зайчика в последний момент его достоверной истории жизни. Оптимизационный критерий простой - воскрешение зайчика должно привести к полному адекватному воспроизведению его последнего реального снимка в цвете лет.
Обученная модель может в принципе уже использоваться как есть, в варианте без контроля граничных условий путем текста.
Это другая, отдельная тема.
+++
Будущие направления.
Чтобы снизить уровень неопределенности, модели диффузии обычно избегают больших шагов во время выборки. Действительно, небольшие шаги гарантируют, что выборка данных, генерируемая на каждом шаге, будет объясняться изученным распределением Гаусса. Аналогичное поведение наблюдается при применении градиентного спуска для оптимизации нейронных сетей.
Действительно, большой шаг в отрицательном направлении градиента, т. е. использование очень большой скорости обучения, может привести к обновлению модели до области с высокой неопределенностью, не имея контроля над значение убытка. В будущем перенос правил обновления, заимствованных из эффективных оптимизаторов, в модели распространения, возможно, может привести к более эффективному процессу выборки (генерации).
Помимо текущей тенденции исследования более эффективных моделей диффузии, в будущей работе можно будет изучить модели диффузии, применяемые в других задачах компьютерного зрения, таких как dehazing изображений, обнаружение аномалий видео или визуальные ответы на вопросы. Много исследований изучают обнаружение аномалий на медицинских изображениях [44]–[46], эта задача также может быть исследована в других областях, таких как видеонаблюдение или промышленный контроль.
Интересным направлением исследований является оценка качества и полезности пространства представления, изученного диффузионными моделями в задачах различения. Это может быть осуществлено, по крайней мере, двумя различными способами. Напрямую, изучая некоторую дискриминационную модель поверх скрытых представлений, обеспечиваемых шумоподавляющей моделью, для решения некоторой задачи классификации или регрессии. Косвенным образом, дополняя обучающие наборы реалистичными образцами, сгенерированными диффузионными моделями. Последнее направление может быть более подходящим для таких задач, как обнаружение объектов, где модели диффузии с отрисовкой могут хорошо работать при смешивании новых объектов в изображениях.
Еще одним направлением будущей работы является использование моделей условной диффузии для имитации возможного будущего в видео. Сгенерированные видеоролики могут быть использованы в качестве входных данных для моделей обучения с подкреплением.