首页 /研究 /FCPortugal - Multi-Robot Action Learning
SWARM

FCPortugal - Multi-Robot Action Learning

Ventura de Sousa Pereira

发表年份
2020
引用次数
2
访问权限
开放获取

摘要

Futebol robtico simulado um ambiente de sistema de multi agentes, uma rea onde h ainda muitas questes por responder.No contexto do ambiente referido, h certas situaes de jogo, as jogadas de bola parada, que poderiam ser melhor exploradas de forma a encontrar formas de marcar golos.Efetivamente, este tipo de situaes de jogo acontecem com relativa frequncia e um desperdcio perder a posse de bola ou sofrer golos a partir das mesmas.Desta forma, enfrentando um ambiente competitivo de multi-agentes como o anteriormente referido, pretendemos desenhar, implementar e testar um mecanismo de aprendizagem que permitir a um grupo de robots humanides executar uma srie de aces individuais coordenadas, de forma a executar um plano global.Contudo, no podemos pr de lado o facto de que o ambiente dinmico e que necessitamos de minimizar as hipteses de ser explorados pelos adversrios.Podemos, ento, dizer formalmente que o problema encontrar um mecanismo eficiente, no contexto de um ambiente MAS, para fazer com que os robots humanides aprendam comportamentos coordenados que lhes permita ganhar vantagem no jogo.Para atingir o nosso objetivo iremos usar as habilidades de baixo nvel j desenvolvidas, assim como a ferramenta FCPGym e uma framework de deep learning, Stable Baselines.Apesar de algum trabalho j ter sido desenvolvido no que toca criao de jogadas colectivas e uma interface para o utilizador ter sido desenvolvida, ainda h algumas limitaes e questes por responder.Como podemos atingir o desfecho de uma jogada colectiva quando enfrentando um ambiente no estacionrio?Como podemos melhorar os mecanismos de aprendizagem de cada agente?Hoje em dia j h algumas pesquisas e avanos relativamente ao tpico de multi agentes, onde dito que a complexidade do espao-aco exponencial para a quantidade de agentes.A maior parte do trabalho aplicado atravs da adaptao do contexto de agente individual ao MAS.Isto feito centralizando o mecanismo de aprendizagem ou individualizando cada agente.Para alm disso, houve relativo sucesso com redes neuronais de aprendizagem profundas, usando o algoritmo Redes Profundas-Q no jogo Pursuit e Foraging Task, no que toca ao paradigma de multi agentes.Houve, tambm, algum trabalho interessante desenvolvido nas reas mencionadas, aplicadas ao contexto de futebol robtico.No que toca a set plays, foi desenvolvido um strategy planner onde uma interface fornecia a possibilidade de criar uma jogada estudada.Para alm disso, o uso de reinforcement learning, no desenvolvimento de set plays, foi j testado pela equipa FCPortugal, onde o desempenho foi melhorado atravs da experincia.Por ltimo, deep learning, nos anos mais recentes, dentro da RoboCup, foi testado, especialmente, para localizao da bola.Neste trabalho usamos o TD3, um algoritmo de deep reinforcement learning, para optimizar as set plays desenvolvidas, que consistiram em duas variaes de um canto.Fomos capazes de usar deep learning, que tem crescido, e a ideia de usar as experincias passadas, para sincronizar os robots humanides numa sequncia de aes que originam golo.Os modelos treinados obtidos mostram que a rede neuronal encontrou valores ptimos dentro dos espaos de ao definidos, resultando em jogadas estudadas que levam a golo.

关键词

Action (physics)Artificial intelligenceComputer scienceHuman–computer interactionPhysics

相关论文

查看 SWARM 分类全部论文