Грокаем глубокое обучение с подкреплением, Моралес М., 2026

Подробнее о кнопках "Купить"

По кнопкам "Купить бумажную книгу" или "Купить электронную книгу" можно купить в официальных магазинах эту книгу, если она имеется в продаже, или похожую книгу. Результаты поиска формируются при помощи поисковых систем Яндекс и Google на основании названия и авторов книги.

Наш сайт не занимается продажей книг, этим занимаются вышеуказанные магазины. Мы лишь даем пользователям возможность найти эту или похожие книги в этих магазинах.

Список книг, которые предлагают магазины, можно увидеть перейдя на одну из страниц покупки, для этого надо нажать на одну из этих кнопок.

Грокаем глубокое обучение с подкреплением, Моралес М., 2026.
 
   Мы учимся, взаимодействуя с окружающей средой, и получаемые вознаграждения и наказания определяют наше поведение в будущем. Глубокое обучение с подкреплением привносит этот естественный процесс в искусственный интеллект и предполагает анализ результатов для выявления наиболее эффективных путей движения вперед. Агенты глубокого обучения с подкреплением могут способствовать успеху маркетинговых кампаний, прогнозировать роет акций и побеждать гроссмейстеров в Го и шахматах.
Давайте научимся создавать системы глубокого обучения на примере увлекательных упражнений, сопровождаемых кодом на Python с подробными комментариями и понятными объяснениями. Вы увидите, как работают алгоритмы, и научитесь создавать собственных агентов глубокого обучения с подкреплением, используя оценочную обратную связь.

Грокаем глубокое обучение с подкреплением, Моралес М., 2026


Цикл обучения с подкреплением.
Обычно у среды есть четко определенная задача, которая формируется через функцию вознаграждения. Сигналы этой функции могут быть одновременно последовательными, оценочными и выборочными. Для достижения поставленной цели агент должен продемонстрировать интеллект или хотя бы когнитивные способности, связанные с ним: долгосрочное мышление, сбор информации и обобщение.

Работа агента проходит в три этапа: взаимодействие со средой, оценка ее поведения и улучшение ответов. Агент может быть предназначен для изучения связей между наблюдениями и действиями (такие связи называют правилами или стратегиями) или для изучения влияния модели среды. А с помощью функций ценности его можно научить оценивать и будущее вознаграждение.

ОГЛАВЛЕНИЕ.
Предисловие.
Вступление.
Благодарности.
О книге.
Для кого эта книга.
Структура издания.
О коде.
От издательства.
Об авторе.
Глава 1. Введение в глубокое обучение с подкреплением.
Что такое глубокое обучение с подкреплением.
Прошлое, настоящее и будущее глубокого обучения с подкреплением.
Целесообразность глубокого обучения с подкреплением.
Определение четких обоюдных ожиданий.
Подведем итоги.
Глава 2. Математические основы обучения с подкреплением.
Элементы обучения с подкреплением.
MDP: двигатель среды.
Подведем итоги.
Глава 3. Баланс краткосрочных и долгосрочных целей.
Цель агента, принимающего решения.
Планирование оптимальных последовательностей действий.
Подведем итоги.
Глава 4. Баланс между сбором и использованием информации.
Проблема интерпретации оценочной обратной связи.
Стратегическое исследование.
Подведем итоги.
Глава 5. Оценка поведения агента.
Учимся прогнозировать ценность политик.
Прогноз на основе нескольких шагов.
Подведем итоги.
Глава 6. Улучшение поведения агентов.
Анатомия агентов обучения с подкреплением.
Оптимизация политик поведения.
Разделение поведения и обучения.
Подведем итоги.
Глава 7. Более действенные и эффективные способы достижения целей.
Улучшение политик с помощью достоверных целей.
Агенты, которые взаимодействуют, обучаются и планируют.
Подведем итоги.
Глава 8. Введение в ценностно ориентированное глубокое обучение с подкреплением.
Тип обратной связи, который используют агенты глубокого обучения с подкреплением.
Введение в аппроксимацию функций для обучения с подкреплением.
NFQ: первая попытка реализовать ценностно ориентированное глубокое обучение с подкреплением.
Подведем итоги.
Глава 9. Более стабильные ценностно ориентированные методы.
DQN: делаем RL похожим на контролируемое обучение.
Двойная DDQN: борьба с завышением прогнозов функций ценности действий.
Подведем итоги.
Глава 10. Ценностно ориентированные методы с эффективным использованием выборок.
Дуэльная DDQN: архитектура нейросети, рассчитанная на обучение с подкреплением.
PER: приоритетное воспроизведение полезного опыта.
Подведем итоги.
Глава 11. Методы градиента политик и «актер-критик».
REINFORCE: обучение политик на основе результатов.
VPG: формирование функции ценности.
A3C: параллельное обновление политики.
GAE: надежное прогнозирование преимущества.
A2C: синхронное обновление политик.
Подведем итоги.
Глава 12. Продвинутые методы «актер-критик».
DDPG: аппроксимация детерминированной политики.
TD3: лучшие оптимизации для DDPG.
SAC: максимизация ожидаемой выгоды и энтропии.
PPO: ограничение этапа оптимизации.
Подведем итоги.
Глава 13. Путь к сильному искусственному интеллекту.
Важные темы, которые были рассмотрены, и те, которые остались без внимания.
Углубленные аспекты AGI.
Что дальше?.
Подведем итоги.



Бесплатно скачать электронную книгу в удобном формате, смотреть и читать:
Скачать книгу Грокаем глубокое обучение с подкреплением, Моралес М., 2026 - fileskachat.com, быстрое и бесплатное скачивание.

Скачать pdf
Ниже можно купить эту книгу, если она есть в продаже, и похожие книги по лучшей цене со скидкой с доставкой по всей России.Купить книги



Скачать - pdf - Яндекс.Диск.
Дата публикации:





Теги: :: ::


 


 

Книги, учебники, обучение по разделам




Не нашёл? Найди:





2026-08-10 06:24:03