TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
AGI

27 Jul 2018, 16:20

Открыть в Telegram Поделиться Пожаловаться

Program Induction - Новые пейперы
После того как вы прочитаете вводные пейперы можно перейти на последние пейперы с ICML 2018

Towards Mixed Optimization for Reinforcement Learning with Program Synthesis
Эта статья мне оооочень понравилась. Но пока ее слабость что был поставлен игрушечный таск.
Авторы предложили policy-distillation-as-program-synthesis.
Идея такая в обычный RL-loop: neural policy -> behavior -> improve neural policy добавили еще одно звено: neural policy -> behavior -> program synthesis -> improve neural policy.
То есть у нас есть нейронка политики которую мы дистиллируем в программный код, это дает огромный плюс в том что из нейронки блэк бокс мы получаем читаемую программу которую легко интерпретировать. Поэтому дальше человек или другая программа может не много откорректировать программу и улучшить политику. Далее нам надо наоборот дистилировать политику представляемую программным кодом в нейронную сеть. Для этого можно юзать любой алгоритм imitation learning например GAIL. Далее мы опять улучшаем нейроную сеть стандартным RL алгоритмом и так по кругу. Дистилляция политики в программный код делается с помощью алгоритма VIPER - Verifiable Reinforcement Learningvia Policy Extraction. Это алгоритм построения decision tree policies основанный на двух других алгоритмах DAGGER и CART. Есть еще другие способы например PiRL - Programmatically Interpretable Reinforcement Learning которые можно использовать на этом этапе. Улучшение программного кода может делать человек таким образом мы получаем интерпретируемую human in the loop систему.

Automatically Composing Representation Transformations as a Means for Generalization
Этот пейпер самый важный из этого списка на мой взгляд. Сейчас типичный deep learning подход это запилить какую либо архитектуру сети с нуля и обучить на датасете. Иногда мы юзаем transfer learning вставляя предобученные слои одной сети как один модуль в другую сеть. Авторы предложили другой взгляд на построения архитектур. Архитектура сети представляет из себя набор маленьких модулей из которых можно строить computational graph. Граф строит другая сеть называемая controller. И обучение модулей и обучение генерации вычислительного графа происходит одновременно. Первое тренится обычном бэкпропом, второе RL алгоритмом. Мы надеемся что каждый модуль обучиться какой то полезной и конкретной трансформации, а контроллер научиться применять эту трансформацию в нужном месте вычислительного графа.
Это важно потому что в идеале мы хотим чтобы AI система не переучивалась заново при каждой новой задаче, а строила аналогии с прошлыми решенными задачами и делала re-representation новой задачи в задачу которую она уже решала.

Program Language Translation Using a Grammar-Driven Tree-to-Tree Model
Авторы решали задачу перевода между двумя языками программирования. Задача важная и интересная. Думаю многие бы хотели иметь модель перевода с Objective-C в Swift) ну или там Javascript в Coffeescript. Если для перевода естественного языка мы достигли многого и были придуманы куча архитектур (Transformer, ConvSeq2Seq), то для языков программирования есть большой простор инновации. В первую очередь стандартные encoder-ы и decoder-ы для естественных языков не подходят для языков программирования так как они имеют болею строгую грамматику и самый очевидный способ решения это использовать tree-based сетки, поэтому вместо seq2seq мы юзаем tree2tree. Архитектура достаточная простая и использует TreeLSTM: h = lstm(concat(h_l, h_r), x) где h_l, h_r - правый и левый потомок в случае бинарного дерева. В этом пейпере авторы улучишили предыдущий tree2tree поменяв не много архитектуру декодера чтобы он генерил только синтаксически валидные программы. Так же если интересна тема советую пейпер A Syntactic Neural Model for General-Purpose Code Generation. Там авторы смогли генерить AST питона из natural language описания.

446 0 0
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot