Агент обучения с подкреплением Q-изучения
Алгоритм Q-обучения является онлайновым методом обучения с подкреплением без моделей и без политики. Агент Q-обучения это агент обучения с подкреплением на базе ценностей, который обучает критика оценивать текущее или будущее вознаграждения.
Для получения дополнительной информации об агентах Q-обучения смотрите Агентов Q-обучения.
Для получения дополнительной информации о различных типах агентов обучения с подкреплением смотрите Агентов Обучения с подкреплением.
создает агента Q-обучения с заданной сетью критика и устанавливает agent
= rlQAgent(critic
,agentOptions
)AgentOptions
свойство.
train | Обучите агента обучения с подкреплением в заданной среде |
sim | Симулируйте обученного агента обучения с подкреплением в заданной среде |
getActor | Получите представление актера от агента обучения с подкреплением |
setActor | Установите представление актера агента обучения с подкреплением |
getCritic | Получите представление критика от агента обучения с подкреплением |
setCritic | Установите представление критика агента обучения с подкреплением |
generatePolicyFunction | Создайте функцию, которая оценивает обученную политику агента обучения с подкреплением |