Resolvendo o Grid World Com MDP

por Frank de Alcantara em 10/02/2025

Resolvendo o Grid World Com MDP

Agora que formalizamos o Grid World como um Processo de Decisão de Markov (MDP), podemos aplicar algoritmos de Reinforcement Learning para encontrar a política ótima π ⁢ . A política ótima é aquela que maximiza a recompensa total esperada a longo prazo para o agente.

Para encontrar a política ótima, vamos dissecar a estrutura do MDP como ferramenta para resolver o Grid World.

Formulação MDP do Grid World

Vamos dedicar um minuto, ou dez, para lembrar em que porto desta jornada estamos. Até agora definimos o seguinte:

  1. Estados ( S ) : O conjunto de todas as células da grade. Cada célula ( x , y ) representa um estado.

  2. Ações ( A ) : O conjunto de ações possíveis: A = { Norte , Sul , Leste , Oeste } .

  3. Função de Transição ( P ) : P ( s ′ | s , a ) define a probabilidade de transitar para o estado s ′ ao executar a ação a no estado s . No Grid World estocástico que estamos estudando, teremos:

    • 0.8 de probabilidade de se mover na direção pretendida.
    • 0.1 de probabilidade de se mover para cada um dos lados perpendiculares.
    • Se a ação levar a uma colisão com a parede, o agente permanece no estado s .

    Eu havia usado 10 % e 80 % . Se a atenta leitora não entendeu a mudança, este não é um artigo para você.

Conteúdo Exclusivo
Quer continuar lendo?

Este artigo completo contém estratégias práticas e dados exclusivos reservados para nossos membros cadastrados.

Continuar com Google Acesso gratuito e instantâneo com sua conta Google

(Updated: )