Есть такой алгоритм successor reinforcement learning, люди кто давно занимается RL точно знают его потому что он был хайповым когда вышла в 2016 году его Deep версия, но его потом захейтили потому что в пейпере его противопоставили DQN который на много мощнее в общем и не говоря уже об актор критике. Если в крациях то уравнение бэлмана можно раписать в таком виде:
Q = E[sum(gamma**t * R(s_t) for t in range(0, inf))] =
E[gamma**0 * R(s_0) + gamma**1*R(s_0) + ...]
если R(s_t) = f*w, где f это фича f=neural_net(s_t), а w-афинное преоброзвание, то подставляя получим:
E[gamma**0 * f_0 * w + gamma**1 * f_1 * w + ...] =
E[gamma**0 * f_0 + gamma * f_1 + ...] * w =
E[M(s, a] * w, то есть вместо того чтоб считать expected reward, мы считаем expected feature representation, а w мы назваем reward vector и выносим его из expectation.
Проблема этого подхода очевидна что если мы имеем s_t высокой размерности, то воозможно ли вообще выучить successor representation M(s, a), ребята из MIT(сейчас уже в deepmind) попробывали и у них что то слабенькое получилось:
Deep Successor Reinforcement Learning - DCR
https://arxiv.org/pdf/1606.02396.pdf
Потом его захейтили из за очень медленного обучения, но теперь в новую эру сложных модульных алгоритмов HRL/MetaRL/MultiTaskRL/I2A - DCR имеет хорошие перспективы как небольшая часть какой то большой архитектуры где его свойства будут полезны
Поэтому сделал мини подборку пейперов по DCR:
Deep reinforcement learning with successor features for navigation across similar environments
http://ieeexplore.ieee.org/abstract/document/8206049/authors
Successor features for transfer in reinforcement learning
papers.nips.cc/paper/6994-successor-features-for-transfer-in-reinforcement-learning
- в авторах сам David Silver!
Universal Successor Representations for Transfer Reinforcement Learning
https://openreview.net/pdf?id=HJ_CpYyDz
в авторах сам Bengio
Source Traces for Temporal Difference Learning
https://silviupitis.com/files/source_traces_aaai18.pdf
- ну и на последок какой то мутный пейпер мутного чувака из harvard law school про которого я узнал из HRL NISP workshop😂😂😂
Q = E[sum(gamma**t * R(s_t) for t in range(0, inf))] =
E[gamma**0 * R(s_0) + gamma**1*R(s_0) + ...]
если R(s_t) = f*w, где f это фича f=neural_net(s_t), а w-афинное преоброзвание, то подставляя получим:
E[gamma**0 * f_0 * w + gamma**1 * f_1 * w + ...] =
E[gamma**0 * f_0 + gamma * f_1 + ...] * w =
E[M(s, a] * w, то есть вместо того чтоб считать expected reward, мы считаем expected feature representation, а w мы назваем reward vector и выносим его из expectation.
Проблема этого подхода очевидна что если мы имеем s_t высокой размерности, то воозможно ли вообще выучить successor representation M(s, a), ребята из MIT(сейчас уже в deepmind) попробывали и у них что то слабенькое получилось:
Deep Successor Reinforcement Learning - DCR
https://arxiv.org/pdf/1606.02396.pdf
Потом его захейтили из за очень медленного обучения, но теперь в новую эру сложных модульных алгоритмов HRL/MetaRL/MultiTaskRL/I2A - DCR имеет хорошие перспективы как небольшая часть какой то большой архитектуры где его свойства будут полезны
Поэтому сделал мини подборку пейперов по DCR:
Deep reinforcement learning with successor features for navigation across similar environments
http://ieeexplore.ieee.org/abstract/document/8206049/authors
Successor features for transfer in reinforcement learning
papers.nips.cc/paper/6994-successor-features-for-transfer-in-reinforcement-learning
- в авторах сам David Silver!
Universal Successor Representations for Transfer Reinforcement Learning
https://openreview.net/pdf?id=HJ_CpYyDz
в авторах сам Bengio
Source Traces for Temporal Difference Learning
https://silviupitis.com/files/source_traces_aaai18.pdf
- ну и на последок какой то мутный пейпер мутного чувака из harvard law school про которого я узнал из HRL NISP workshop😂😂😂