Google, düşük çözünürlüklü görüntülerin kalitesini artırmak için yeni AI tabanlı difüzyon modelleri tanıttı. İki yeni difüzyon modeli - görüntü süper çözünürlük (SR3) ve basamaklı difüzyon modelleri (CDM) - yüksek kaliteli görüntüler oluşturmak için AI kullanabilir. Bu modellerde, eski aile portrelerini geri yüklemek ve tıbbi görüntüleme sistemlerinin görüntü sınıflandırması, segmentasyonu ve daha fazlası için aşağı akış modellerinin performansını arttırmak için tıbbi görüntüleme sistemlerinin iyileştirilmesini sağlayacak birçok uygulamaya sahiptir. Örneğin, SR3 modeli, düşük çözünürlüklü bir görüntüyü, insan değerlendirmelerinde üretken olumsuz yönler (GAN) gibi mevcut derin üretici modelleri aşan ayrıntılı bir yüksek çözünürlüklü görüntü sonucuna dönüştürmek için eğitilmiştir.
Google Research'in Brain ekibinden araştırmacılar, hem SR3 hem de CDM difüzyon modellerini detaylandıran Google'ın AI blogunda bir yazı yayınladı. SR3'ün, düşük çözünürlüklü bir görüntüyü girip giren ve saf gürültüden karşılık gelen yüksek çözünürlüklü bir görüntü oluşturan süper çözünürlüklü bir difüzyon modeli olduğu söylenir. Model, yalnızca saf gürültü kalmaya kadar yüksek çözünürlüklü bir görüntüye gürültü ekleyen bir görüntü yolsuzluk işlemi üzerinde eğitilmiştir. SR3 modeli daha sonra "saf gürültüden başlayarak ve giriş düşük çözünürlüklü görüntünün rehberliğinde bir hedef dağılıma ulaşmak için gürültüyü giderek çıkarma işlemini tersine çevirir."
Google, 64x64 piksel çözünürlükte görüntünün, SR3'ü kullanarak 1,024x1.024 piksel çözünürlüklü fotoğrafa nasıl ölçeklendirileceğine dair birkaç etkileyici örneği paylaştı. 1.024x1.024 piksel çözünürlük çıktısının, özellikle yüz ve doğal görüntülerin sonucu sonucu, çok etkileyicidir. Tech Giant, SR3'ün, 4x ila 8x daha yüksek çözünürlükleri ölçeklendiğinde, yüz ve doğal görüntüler için süper çözünürlüklü görevde güçlü kıyaslama sonuçları elde edebileceğini söylüyor.
CDM difüzyon modeli, yüksek çözünürlüklü doğal görüntüler üretmek için Imagege verilerinde eğitilmiştir. Imagenet zor, yüksek entropi bir veri seti olduğundan, Google CDM'yi birden fazla difüzyon modelinin basamaklı olarak oluşturduğu. Bu cascade yaklaşımı, birkaç mekansal çözünürlükte birden fazla üretken modelin bir araya gelmesini içerir. Zincir, düşük çözünürlükte veri üreten bir difüzyon modeli, ardından üretilen görüntünün çözünürlüğünü yavaş yavaş en yüksek çözünürlüğe artıran SR3 Süper çözünürlüklü difüzyon modelleri oluşturur. Google, Gauss Gürültüsünü ve Gaussian'ın bulanıklığını, basamaklı boru hattındaki her bir süper çözünürlüklü modelin düşük çözünürlüklü giriş görüntüsüne uygular. Bu işlemi şartlandırma artışı olarak çağırır ve CDM için daha iyi ve daha yüksek çözünürlüklü örnek kalite sağlar.
SR3 ve CDM ile Google, "difüzyon modellerinin performansını süper çözünürlükte ve sınıf koşullu Imagenet üretim kriterleri üzerine son teknoloji performansını itti" diyor.
Kaynak: Gadgets 360