Publication: Color optimization and diffusion-based post-processing to obtain sharper images without compromising R-D performance in learned image compression
Loading...
Program
Electrical and Electronics Engineering
KU-Authors
Organization Authors
Co-Authors
Author
Advisor
item.page.yoktezid
905209
Approval Date
Date
Language
Type
Embargo Status
No
Journal Title
Journal ISSN
Volume Title
Alternative Title
ĆÄrenilmiÅ gƶrüntü sıkıÅtırmada R-D performansını bozmadan daha keskin gƶrüntüler elde etmek iƧin renk optimizasyonu ve diffüzyon tabanlı son iÅleme.
Abstract
In the digital era, efficient storage and transmission of visual signals have become paramount due to the explosive growth in multimedia content. The need for advanced image compression methods is driven by increasing image resolutions and the limitations of traditional codecs in terms of flexibility and adaptability. In the first part of this thesis, we introduce a flexible method for coding color images in the YCrCb space, addressing the human visual system's greater sensitivity to the luma component over chroma components. We extend the variable-rate image coding approach to YCrCb images, enabling separate rate adjustments for luma and chroma components. By implementing image-adaptive luma-chroma bit allocation during inference, we can increase Y PSNR at the expense of slightly lower chroma PSNR, resulting in sharper images without introducing color artifacts. This strategy enhances image sharpness more effectively than optimizing for RGB PSNR alone. Our experimental results demonstrate that sharper images with better VMAF and Y PSNR can be obtained by optimizing models for YCrCb MSE compared to state-of-the-art models optimizing RGB MSE at the same bpp. In the second part, we explore the use of diffusion models for post-processing in wavelet-based image codecs. Diffusion models, a type of deep generative models, have shown great promise in various domains, including inverse problems in image processing. They are particularly effective at producing visually pleasing textures. By integrating a fixed, invertible transform with a learned entropy model and a diffusion-based post-processing module, we demonstrate enhanced visual quality without compromising the rate-distortion performance. Our experimental results show that sharper images with better perceptual quality and YCrCb PSNR can be obtained compared to state-of-the-art classic and learned codecs.
Dijital ƧaÄda, gƶrsel sinyallerin verimli bir Åekilde depolanması ve iletilmesi, multimedya iƧeriÄindeki patlayıcı artıŠnedeniyle büyük ƶnem kazanmıÅtır. Artan gƶrüntü Ƨƶzünürlükleri ve geleneksel kodlayıcıların esneklik ve uyum saÄlama konusundaki sınırlamaları, geliÅmiÅ gƶrüntü sıkıÅtırma yƶntemlerine olan ihtiyacı artırmaktadır. Bu tezin ilk bƶlümünde, insan gƶrsel sisteminin luma bileÅenine olan hassasiyetinin chroma bileÅenlerine kıyasla daha fazla olduÄunu gƶz ƶnünde bulundurarak YCrCb uzayında gƶrüntülerin kodlanması iƧin esnek bir yƶntem sunuyoruz. DeÄiÅken oranlı gƶrüntü kodlama yaklaÅımını YCrCb gƶrüntülerine geniÅleterek luma ve chroma bileÅenleri iƧin ayrı oran ayarlamaları yapılmasını saÄlıyoruz. Ćıkarım sırasında gƶrüntüye uyarlanabilir luma-chroma bit tahsisi yaparak, Y PSNR'yi artırırken, hafifƧe daha düÅük chroma PSNR pahasına, renk bozulmalarına yol aƧmadan daha keskin gƶrüntüler elde edebiliyoruz. Bu strateji, yalnızca RGB PSNR'yi optimize etmekten daha etkili bir Åekilde gƶrüntü keskinliÄini artırmaktadır. Deneysel sonuƧlarımız, YCrCb MSE'yi optimize eden modellerin, aynı bpp oranında RGB MSE'yi optimize eden en güncel modellerle karÅılaÅtırıldıÄında, daha keskin gƶrüntüler ve daha iyi VMAF ile Y PSNR saÄladıÄını gƶstermektedir. İkinci bƶlümde ise, wavelet tabanlı gƶrüntü kodlayıcılarında difüzyon modellerinin son iÅlem iƧin kullanımını inceliyoruz. Derin üretici modellerin bir türü olan difüzyon modelleri, gƶrüntü iÅleme alanındaki ters problemler de dahil olmak üzere ƧeÅitli alanlarda büyük bir potansiyel gƶstermiÅtir. Sabit, terslenebilir bir dƶnüÅümü ƶÄrenilmiÅ bir entropi modeli ve difüzyon tabanlı bir son iÅlem modülü ile entegre ederek, RD performansını bozmadan gƶrsel kaliteyi artırabileceÄimizi gƶsteriyoruz. Deneysel sonuƧlarımız, klasik ve ƶÄrenilmiÅ en güncel kodlayıcılara kıyasla daha keskin gƶrüntüler ve daha iyi algısal kalite elde edilebileceÄini gƶstermektedir.
Dijital ƧaÄda, gƶrsel sinyallerin verimli bir Åekilde depolanması ve iletilmesi, multimedya iƧeriÄindeki patlayıcı artıŠnedeniyle büyük ƶnem kazanmıÅtır. Artan gƶrüntü Ƨƶzünürlükleri ve geleneksel kodlayıcıların esneklik ve uyum saÄlama konusundaki sınırlamaları, geliÅmiÅ gƶrüntü sıkıÅtırma yƶntemlerine olan ihtiyacı artırmaktadır. Bu tezin ilk bƶlümünde, insan gƶrsel sisteminin luma bileÅenine olan hassasiyetinin chroma bileÅenlerine kıyasla daha fazla olduÄunu gƶz ƶnünde bulundurarak YCrCb uzayında gƶrüntülerin kodlanması iƧin esnek bir yƶntem sunuyoruz. DeÄiÅken oranlı gƶrüntü kodlama yaklaÅımını YCrCb gƶrüntülerine geniÅleterek luma ve chroma bileÅenleri iƧin ayrı oran ayarlamaları yapılmasını saÄlıyoruz. Ćıkarım sırasında gƶrüntüye uyarlanabilir luma-chroma bit tahsisi yaparak, Y PSNR'yi artırırken, hafifƧe daha düÅük chroma PSNR pahasına, renk bozulmalarına yol aƧmadan daha keskin gƶrüntüler elde edebiliyoruz. Bu strateji, yalnızca RGB PSNR'yi optimize etmekten daha etkili bir Åekilde gƶrüntü keskinliÄini artırmaktadır. Deneysel sonuƧlarımız, YCrCb MSE'yi optimize eden modellerin, aynı bpp oranında RGB MSE'yi optimize eden en güncel modellerle karÅılaÅtırıldıÄında, daha keskin gƶrüntüler ve daha iyi VMAF ile Y PSNR saÄladıÄını gƶstermektedir. İkinci bƶlümde ise, wavelet tabanlı gƶrüntü kodlayıcılarında difüzyon modellerinin son iÅlem iƧin kullanımını inceliyoruz. Derin üretici modellerin bir türü olan difüzyon modelleri, gƶrüntü iÅleme alanındaki ters problemler de dahil olmak üzere ƧeÅitli alanlarda büyük bir potansiyel gƶstermiÅtir. Sabit, terslenebilir bir dƶnüÅümü ƶÄrenilmiÅ bir entropi modeli ve difüzyon tabanlı bir son iÅlem modülü ile entegre ederek, RD performansını bozmadan gƶrsel kaliteyi artırabileceÄimizi gƶsteriyoruz. Deneysel sonuƧlarımız, klasik ve ƶÄrenilmiÅ en güncel kodlayıcılara kıyasla daha keskin gƶrüntüler ve daha iyi algısal kalite elde edilebileceÄini gƶstermektedir.
Source
Publisher
KoƧ University
Citation
item.page.haspartof
Source
item.page.ispartofseries
item.page.edition
DOI
item.page.datauri
item.page.link
Rights
restrictedAccess
Copyrights Note
© All Rights Reserved. Accessible to Koç University Affiliated Users Only!
Rights and licensing
restrictedAccess
© All Rights Reserved. Accessible to Koç University Affiliated Users Only!
© All Rights Reserved. Accessible to Koç University Affiliated Users Only!
Collections
Endorsement
Review
Supplemented By
Referenced By
Google Scholar
Scholar'da Ara ā3
Görüntülenme
0
İndirme
Bu yayında DOI yok ā Altmetric/Dimensions/PlumX/BIP! rozetleri DOI gerektirir.
