ɫɫÀ²

Tapahtumat

Väitös, robotiikka ja automoniset järjestelmät, MSc Yi Zhao

Learning versatile skills with sample-efficient reinforcement learning.
Väitös Aalto-yliopiston sähkötekniikan korkeakoulusta, sähkötekniikan ja automaation laitokselta.
Kuvitus puhujakorokkeesta ja sen yläpuolella olevasta tohtorinhatusta.

Noudatamme tapahtumissamme Aalto-yliopiston turvallisemman tilan periaatteita.

Väitöskirjan nimi: Learning versatile skills with sample-efficient reinforcement learning.

³Õä¾±³Ù³Ù±ð±ô¾±Âáä: Yi Zhao
³Õ²¹²õ³Ù²¹±¹Ã¤¾±³Ù³ÙäÂáä: Prof. Olov Andersson, KTH, Ruotsi
Kustos: Prof. Joni Pajarinen, Aalto-yliopiston sähkötekniikan korkeakoulu

Tässä väitöskirjassa tutkitaan, miten robotit voivat oppia monimutkaisia taitoja tehokkaammin vahvistusoppimisen (Reinforcement Learning, RL) avulla. Vaikka vahvistusoppiminen mahdollistaa robottien oppimisen kokemuksen kautta, nykyiset menetelmät vaativat usein miljoonia vuorovaikutuksia ympäristön kanssa. Tämä tekee harjoittelusta todellisissa ympäristöissä hidasta, kallista ja haastavaa.

Väitöskirjassa kehitetään kolme lähestymistapaa datatehokkuuden parantamiseksi. Ensimmäiseksi työssä esitellään Temporal Consistency Reinforcement Learning (TCRL) -menetelmä, joka oppii hyödyllisiä sisäisiä esityksiä robotin tilasta ja tehostaa liikkumistehtävien oppimista. Toiseksi väitöskirjassa kehitetään menetelmiä aiemmin kerätyn datan tehokkaampaan hyödyntämiseen, mukaan lukien laadultaan vaihteleva data sekä eri robottijärjestelmistä kerätty data. Menetelmät parantavat oppimisen vakautta ja datatehokkuutta useissa näköhavaintoihin perustuvissa motorisissa tehtävissä. Kolmanneksi väitöskirjassa tutkitaan, miten palkkiofunktion parempi suunnittelu voi tukea erittäin monimutkaisten taitojen oppimista. Robottipianonsoittoa esimerkkitehtävänä käyttäen kehitetty uusi palkkiofunktio mahdollistaa koordinoidun kaksikätisen pianonsoiton oppimisen. Tutkimuksen tuloksena syntyivät myös yli miljoona robottipianonsoiton liikerataa sisältävät laajat aineistot sekä OmniPianist-agentti, joka kykenee esittämään monipuolisesti erilaisia musiikkikappaleita.

Väitöskirja osoittaa, että paremmat tilaesitykset, olemassa olevan datan tehokas hyödyntäminen ja informatiiviset palkkiosignaalit voivat merkittävästi vähentää uuden kokemuksen määrää, jota robotit tarvitsevat monimutkaisten taitojen oppimiseen. Tulokset tarjoavat käytännöllisiä menetelmiä tehokkaampien, vakaampien ja monipuolisempien robottien oppimisjärjestelmien kehittämiseen.

Linkki väitöskirjan sähköiseen esittelykappaleeseen (esillä 7 päivää ennen väitöstä):

Sähkötekniikan korkeakoulun väitöskirjat

Suuri valkoinen 'A!' veistos Otaniemen Kandidaattikeskuksen katolla. Taustalla puu ja muita rakennuksia.

Sähkötekniikan korkeakoulun väitöskirjat ovat saatavilla yliopiston ylläpitämässä avoimessa Aaltodoc-julkaisuarkistossa.

Zoom pikaopas
  • ±Êä¾±±¹¾±³Ù±ð³Ù³Ù²â:
  • Julkaistu:
Jaa
URL kopioitu