Publication: Efficient autonomous driving with foundation models
Program
Computer Engineering
KU-Authors
KU Authors
Co-Authors
Editor & Affiliation
Compiler & Affiliation
Translator
Other Contributor
Author
Advisor
YĆK Thesis ID
Date on the IR
Date
Language
eng
Type
Embargo Status
No
Journal Title
Journal ISSN
Volume Title
Alternative Title
Abstract
Abstract: Driving safely in urban environments is a task that requires a deep understanding of complex, dynamic environments and the ability to react swiftly and effectively to unexpected events. Recent advances in large foundation models have shown impressive capabilities to reason and generalize. In this thesis, we explore the potential and feasibility of foundation models for driving. First, we start by building on top of previous work showing promising performance in robotics tasks by formulating reinforcement learning as a language modeling problem using auto-regressive transformers. These approaches, however, assume the state is relatively simple, often representable as a single vector. In driving, the state is more complex, involving multiple agents that interact with each other, raising the need to find a compact, effective state representation. In Carformer, we propose a language model using learned, self-supervised, object-centric representation based on slot attention. We analyze different possible state representations in a privileged setting and find that our proposed representation outperforms both scene-level and hand-crafted objectcentric representations, achieving the state-of-the-art on the Longest6 benchmark. After showing strong results with a language modeling approach in a privileged setting, we then focus on a more realistic, end-to-end setting. While foundation models further improve with scale, this results in additional inference latency. Latency is one of the main hurdles facing the deployment of large foundation models for real-time applications like driving. To address this, we propose a dual approach pipeline, ETA, that utilizes a large foundation model in tandem with a smaller, lightweight model. To minimize latency, we shift the computation of the large foundation model to an earlier time-step following it with a forecasting module to adapt the features to the present. Unlike previous work on dual approaches, we batch the large model inference to enable the decisions to benefit from the large model features at every time-step. Outperforming all previous approaches at a fraction of the latency, we highlight the feasibility of large foundation models in self-driving.
Ćzet: Kentsel ortamlarda güvenli sürüÅ, karmaÅık ve dinamik Ƨevrelerin derinlemesine anlaÅılmasını ve beklenmedik durumlara hızlı ve etkin biƧimde yanıt verebilme yetkinliÄini gerektirir. Son dƶnemdeki büyük temel yapay zeka modelleri (foundation models) üzerine geliÅmeleri akıl yürütme ve genelleme konusunda dikkate deÄer yetenekler ortaya koymaktadır. Bu tezde, temel modellerin sürüŠbaÄlamındaki potansiyelini ve uygulanabilirliÄini inceliyoruz. İlk olarak, pekiÅtirmeli ƶÄrenme problemini otoregresif transformer modelleri aracılıÄıyla bir dil modelleme problemi olarak formüle ederek, robotik gƶrevlerde umut verici performans sergileyen ƶnceki ĀøcalıÅmalara dayandırıyoruz. Bununla birlikte, bu yaklaÅımlar genellikle durumun gƶrece basit olduÄunu varsayar ve tek bir vektƶr ile temsil edilebileceÄini ƶngƶrür. SürüÅte durum daha karmaÅıktır; birbirleriyle etkileÅim halinde Ƨok sayıda ajan iƧerir. Bu nedenle, daha kompakt ve etkili bir durum temsili geliÅtirmemiz gerekir. Bu doÄrultuda, Carformer modeli kapsamında slot attention mekanizmasına dayalı, ƶz-denetimli olarak ƶÄrenilmiÅ, nesne-merkezli bir temsil ile ƧalıÅan bir dil modeli ƶneriyoruz. Ayrıcalıklı (privileged) bir senaryoda farklı durum temsillerini karÅılaÅtırmalı olarak analiz ediyor, ƶnerdiÄimiz temsilin hem sahne düzeyinde hem de elle tasarlanmıŠnesne-merkezli temsillerden üstün olduÄunu ve Longest6 kıyaslama testinde en iyi (state-of-the-art) performansı elde ettiÄini gƶsteriyoruz. Ayrıcalıklı senaryoda dil modelleme yaklaÅımıyla güçlü sonuƧlar elde ettikten sonra, daha gerƧekƧi uƧtan uca bir senaryoya odaklanıyoruz. Temel modeller ƶlƧek büyüdükƧe daha geliÅmiÅ sonuƧlar üretse de, bu durum ek Ƨıkarım gecikmesine yol aƧar. Gecikme, büyük ƶlƧekli temel modellerin sürüŠgibi gerƧek zamanlı uygulamalarda kullanılmasının ƶnündeki temel engellerden biridir. Bu sorunu aÅmak iƧin, büyük bir temel modeli daha küçük ve hafif bir modelle birlikte kullandıÄımız ikili yaklaÅıma dayalı bir uygulama, ETA, ƶneriyoruz. Gecikmeyi en aza indirmek amacıyla, büyük temel modelin hesaplamalarını daha erken bir zaman adımında gerƧekleÅtiriyor ve elde edilen ƶzellikleri, bir tahmin modülü aracılıÄıyla güncel zamana uyarlıyoruz. Mevcut ikili yaklaÅımlardan farklı olarak, büyük model Ƨıkarımlarını toplu biƧimde iÅleyerek her bir zaman adımında kararların büyük model ƶzelliklerinden yararlanmasını saÄlıyoruz. Bƶylelikle, Ƨok daha düÅük gecikme ile tüm ƶnceki yaklaÅımları geride bırakıyor ve otonom sürüÅte büyük temel modellerin uygulanabilirliÄini vurguluyoruz.
Ćzet: Kentsel ortamlarda güvenli sürüÅ, karmaÅık ve dinamik Ƨevrelerin derinlemesine anlaÅılmasını ve beklenmedik durumlara hızlı ve etkin biƧimde yanıt verebilme yetkinliÄini gerektirir. Son dƶnemdeki büyük temel yapay zeka modelleri (foundation models) üzerine geliÅmeleri akıl yürütme ve genelleme konusunda dikkate deÄer yetenekler ortaya koymaktadır. Bu tezde, temel modellerin sürüŠbaÄlamındaki potansiyelini ve uygulanabilirliÄini inceliyoruz. İlk olarak, pekiÅtirmeli ƶÄrenme problemini otoregresif transformer modelleri aracılıÄıyla bir dil modelleme problemi olarak formüle ederek, robotik gƶrevlerde umut verici performans sergileyen ƶnceki ĀøcalıÅmalara dayandırıyoruz. Bununla birlikte, bu yaklaÅımlar genellikle durumun gƶrece basit olduÄunu varsayar ve tek bir vektƶr ile temsil edilebileceÄini ƶngƶrür. SürüÅte durum daha karmaÅıktır; birbirleriyle etkileÅim halinde Ƨok sayıda ajan iƧerir. Bu nedenle, daha kompakt ve etkili bir durum temsili geliÅtirmemiz gerekir. Bu doÄrultuda, Carformer modeli kapsamında slot attention mekanizmasına dayalı, ƶz-denetimli olarak ƶÄrenilmiÅ, nesne-merkezli bir temsil ile ƧalıÅan bir dil modeli ƶneriyoruz. Ayrıcalıklı (privileged) bir senaryoda farklı durum temsillerini karÅılaÅtırmalı olarak analiz ediyor, ƶnerdiÄimiz temsilin hem sahne düzeyinde hem de elle tasarlanmıŠnesne-merkezli temsillerden üstün olduÄunu ve Longest6 kıyaslama testinde en iyi (state-of-the-art) performansı elde ettiÄini gƶsteriyoruz. Ayrıcalıklı senaryoda dil modelleme yaklaÅımıyla güçlü sonuƧlar elde ettikten sonra, daha gerƧekƧi uƧtan uca bir senaryoya odaklanıyoruz. Temel modeller ƶlƧek büyüdükƧe daha geliÅmiÅ sonuƧlar üretse de, bu durum ek Ƨıkarım gecikmesine yol aƧar. Gecikme, büyük ƶlƧekli temel modellerin sürüŠgibi gerƧek zamanlı uygulamalarda kullanılmasının ƶnündeki temel engellerden biridir. Bu sorunu aÅmak iƧin, büyük bir temel modeli daha küçük ve hafif bir modelle birlikte kullandıÄımız ikili yaklaÅıma dayalı bir uygulama, ETA, ƶneriyoruz. Gecikmeyi en aza indirmek amacıyla, büyük temel modelin hesaplamalarını daha erken bir zaman adımında gerƧekleÅtiriyor ve elde edilen ƶzellikleri, bir tahmin modülü aracılıÄıyla güncel zamana uyarlıyoruz. Mevcut ikili yaklaÅımlardan farklı olarak, büyük model Ƨıkarımlarını toplu biƧimde iÅleyerek her bir zaman adımında kararların büyük model ƶzelliklerinden yararlanmasını saÄlıyoruz. Bƶylelikle, Ƨok daha düÅük gecikme ile tüm ƶnceki yaklaÅımları geride bırakıyor ve otonom sürüÅte büyük temel modellerin uygulanabilirliÄini vurguluyoruz.
Source
Publisher
KoƧ University
Subject
Automotive engineering, Automated vehicles, Technological innovations, Automobiles, Automatic control, Automobiles, Electronic equipment, Automobiles, Design and construction, Automobiles, Safety measures, Driver assistance systems, Artificial intelligence, Computational intelligence, User interfaces (Computer systems), Robots, Control systems, Automated vehicles, Intelligent transportation systems, Robotics, Automation, Internet of things, Control engineering, Control theory, System theory
Citation
Has Part
Source
Book Series Title
Edition
DOI
item.page.datauri
Link
Rights
restrictedAccess
Copyrights Note
© All Rights Reserved. Accessible to Koç University Affiliated Users Only!
