<link rel="stylesheet" href="styles.f3b1fba60ec7970c.css">

Publication:
Color optimization and diffusion-based post-processing to obtain sharper images without compromising R-D performance in learned image compression

Loading...
Thumbnail Image

Departments

School / College / Institute

Item type:Organizational Unit,

Program

Electrical and Electronics Engineering

Organization Authors

Co-Authors

Author

item.page.yoktezid

905209

Approval Date

Date

Language

Type

Embargo Status

No

Journal Title

Journal ISSN

Volume Title

Alternative Title

Ɩğrenilmiş gƶrüntü sıkıştırmada R-D performansını bozmadan daha keskin gƶrüntüler elde etmek iƧin renk optimizasyonu ve diffüzyon tabanlı son işleme.

Abstract

In the digital era, efficient storage and transmission of visual signals have become paramount due to the explosive growth in multimedia content. The need for advanced image compression methods is driven by increasing image resolutions and the limitations of traditional codecs in terms of flexibility and adaptability. In the first part of this thesis, we introduce a flexible method for coding color images in the YCrCb space, addressing the human visual system's greater sensitivity to the luma component over chroma components. We extend the variable-rate image coding approach to YCrCb images, enabling separate rate adjustments for luma and chroma components. By implementing image-adaptive luma-chroma bit allocation during inference, we can increase Y PSNR at the expense of slightly lower chroma PSNR, resulting in sharper images without introducing color artifacts. This strategy enhances image sharpness more effectively than optimizing for RGB PSNR alone. Our experimental results demonstrate that sharper images with better VMAF and Y PSNR can be obtained by optimizing models for YCrCb MSE compared to state-of-the-art models optimizing RGB MSE at the same bpp. In the second part, we explore the use of diffusion models for post-processing in wavelet-based image codecs. Diffusion models, a type of deep generative models, have shown great promise in various domains, including inverse problems in image processing. They are particularly effective at producing visually pleasing textures. By integrating a fixed, invertible transform with a learned entropy model and a diffusion-based post-processing module, we demonstrate enhanced visual quality without compromising the rate-distortion performance. Our experimental results show that sharper images with better perceptual quality and YCrCb PSNR can be obtained compared to state-of-the-art classic and learned codecs.
Dijital Ƨağda, gƶrsel sinyallerin verimli bir şekilde depolanması ve iletilmesi, multimedya iƧeriğindeki patlayıcı artış nedeniyle büyük ƶnem kazanmıştır. Artan gƶrüntü Ƨƶzünürlükleri ve geleneksel kodlayıcıların esneklik ve uyum sağlama konusundaki sınırlamaları, gelişmiş gƶrüntü sıkıştırma yƶntemlerine olan ihtiyacı artırmaktadır. Bu tezin ilk bƶlümünde, insan gƶrsel sisteminin luma bileşenine olan hassasiyetinin chroma bileşenlerine kıyasla daha fazla olduğunu gƶz ƶnünde bulundurarak YCrCb uzayında gƶrüntülerin kodlanması iƧin esnek bir yƶntem sunuyoruz. Değişken oranlı gƶrüntü kodlama yaklaşımını YCrCb gƶrüntülerine genişleterek luma ve chroma bileşenleri iƧin ayrı oran ayarlamaları yapılmasını sağlıyoruz. Ƈıkarım sırasında gƶrüntüye uyarlanabilir luma-chroma bit tahsisi yaparak, Y PSNR'yi artırırken, hafifƧe daha düşük chroma PSNR pahasına, renk bozulmalarına yol aƧmadan daha keskin gƶrüntüler elde edebiliyoruz. Bu strateji, yalnızca RGB PSNR'yi optimize etmekten daha etkili bir şekilde gƶrüntü keskinliğini artırmaktadır. Deneysel sonuƧlarımız, YCrCb MSE'yi optimize eden modellerin, aynı bpp oranında RGB MSE'yi optimize eden en güncel modellerle karşılaştırıldığında, daha keskin gƶrüntüler ve daha iyi VMAF ile Y PSNR sağladığını gƶstermektedir. İkinci bƶlümde ise, wavelet tabanlı gƶrüntü kodlayıcılarında difüzyon modellerinin son işlem iƧin kullanımını inceliyoruz. Derin üretici modellerin bir türü olan difüzyon modelleri, gƶrüntü işleme alanındaki ters problemler de dahil olmak üzere Ƨeşitli alanlarda büyük bir potansiyel gƶstermiştir. Sabit, terslenebilir bir dƶnüşümü öğrenilmiş bir entropi modeli ve difüzyon tabanlı bir son işlem modülü ile entegre ederek, RD performansını bozmadan gƶrsel kaliteyi artırabileceğimizi gƶsteriyoruz. Deneysel sonuƧlarımız, klasik ve öğrenilmiş en güncel kodlayıcılara kıyasla daha keskin gƶrüntüler ve daha iyi algısal kalite elde edilebileceğini gƶstermektedir.

Source

Publisher

KoƧ University

Citation

item.page.haspartof

Source

item.page.ispartofseries

item.page.edition

DOI

item.page.datauri

item.page.link

Rights

restrictedAccess

Copyrights Note

© All Rights Reserved. Accessible to Koç University Affiliated Users Only!

Rights and licensing

restrictedAccess
© All Rights Reserved. Accessible to Koç University Affiliated Users Only!

Endorsement

Review

Supplemented By

Referenced By

Related Patent

Related Goal

Google Scholar
Scholar'da Ara ↗
3
Görüntülenme
0
İndirme
Bu yayında DOI yok — Altmetric/Dimensions/PlumX/BIP! rozetleri DOI gerektirir.