TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
AGI

18 Mar 2018, 05:38

Открыть в Telegram Поделиться Пожаловаться

Есть такой алгоритм successor reinforcement learning, люди кто давно занимается RL точно знают его потому что он был хайповым когда вышла в 2016 году его Deep версия, но его потом захейтили потому что в пейпере его противопоставили DQN который на много мощнее в общем и не говоря уже об актор критике. Если в крациях то уравнение бэлмана можно раписать в таком виде:
Q = E[sum(gamma**t * R(s_t) for t in range(0, inf))] =
E[gamma**0 * R(s_0) + gamma**1*R(s_0) + ...]
если R(s_t) = f*w, где f это фича f=neural_net(s_t), а w-афинное преоброзвание, то подставляя получим:
E[gamma**0 * f_0 * w + gamma**1 * f_1 * w + ...] =
E[gamma**0 * f_0 + gamma * f_1 + ...] * w =
E[M(s, a] * w, то есть вместо того чтоб считать expected reward, мы считаем expected feature representation, а w мы назваем reward vector и выносим его из expectation.
Проблема этого подхода очевидна что если мы имеем s_t высокой размерности, то воозможно ли вообще выучить successor representation M(s, a), ребята из MIT(сейчас уже в deepmind) попробывали и у них что то слабенькое получилось:
Deep Successor Reinforcement Learning - DCR
https://arxiv.org/pdf/1606.02396.pdf

Потом его захейтили из за очень медленного обучения, но теперь в новую эру сложных модульных алгоритмов HRL/MetaRL/MultiTaskRL/I2A - DCR имеет хорошие перспективы как небольшая часть какой то большой архитектуры где его свойства будут полезны
Поэтому сделал мини подборку пейперов по DCR:

Deep reinforcement learning with successor features for navigation across similar environments
http://ieeexplore.ieee.org/abstract/document/8206049/authors

Successor features for transfer in reinforcement learning
papers.nips.cc/paper/6994-successor-features-for-transfer-in-reinforcement-learning
- в авторах сам David Silver!

Universal Successor Representations for Transfer Reinforcement Learning
https://openreview.net/pdf?id=HJ_CpYyDz
в авторах сам Bengio

Source Traces for Temporal Difference Learning
https://silviupitis.com/files/source_traces_aaai18.pdf
- ну и на последок какой то мутный пейпер мутного чувака из harvard law school про которого я узнал из HRL NISP workshop😂😂😂
Deep reinforcement learning with successor features for navigation across similar environments - IEEE Conference Publication
In this paper we consider the problem of robot navigation in simple maze-like environments where the robot has to rely on its onboard sensors to perform th

361 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot