TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
AGI

18 Mar 2018, 05:38

Telegram'da ochish Ulashish Shikoyat qilish

Есть такой алгоритм successor reinforcement learning, люди кто давно занимается RL точно знают его потому что он был хайповым когда вышла в 2016 году его Deep версия, но его потом захейтили потому что в пейпере его противопоставили DQN который на много мощнее в общем и не говоря уже об актор критике. Если в крациях то уравнение бэлмана можно раписать в таком виде:
Q = E[sum(gamma**t * R(s_t) for t in range(0, inf))] =
E[gamma**0 * R(s_0) + gamma**1*R(s_0) + ...]
если R(s_t) = f*w, где f это фича f=neural_net(s_t), а w-афинное преоброзвание, то подставляя получим:
E[gamma**0 * f_0 * w + gamma**1 * f_1 * w + ...] =
E[gamma**0 * f_0 + gamma * f_1 + ...] * w =
E[M(s, a] * w, то есть вместо того чтоб считать expected reward, мы считаем expected feature representation, а w мы назваем reward vector и выносим его из expectation.
Проблема этого подхода очевидна что если мы имеем s_t высокой размерности, то воозможно ли вообще выучить successor representation M(s, a), ребята из MIT(сейчас уже в deepmind) попробывали и у них что то слабенькое получилось:
Deep Successor Reinforcement Learning - DCR
https://arxiv.org/pdf/1606.02396.pdf

Потом его захейтили из за очень медленного обучения, но теперь в новую эру сложных модульных алгоритмов HRL/MetaRL/MultiTaskRL/I2A - DCR имеет хорошие перспективы как небольшая часть какой то большой архитектуры где его свойства будут полезны
Поэтому сделал мини подборку пейперов по DCR:

Deep reinforcement learning with successor features for navigation across similar environments
http://ieeexplore.ieee.org/abstract/document/8206049/authors

Successor features for transfer in reinforcement learning
papers.nips.cc/paper/6994-successor-features-for-transfer-in-reinforcement-learning
- в авторах сам David Silver!

Universal Successor Representations for Transfer Reinforcement Learning
https://openreview.net/pdf?id=HJ_CpYyDz
в авторах сам Bengio

Source Traces for Temporal Difference Learning
https://silviupitis.com/files/source_traces_aaai18.pdf
- ну и на последок какой то мутный пейпер мутного чувака из harvard law school про которого я узнал из HRL NISP workshop😂😂😂
Deep reinforcement learning with successor features for navigation across similar environments - IEEE Conference Publication
In this paper we consider the problem of robot navigation in simple maze-like environments where the robot has to rely on its onboard sensors to perform th

361 0 0
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot