Uma pesquisa desenvolvida no Programa de Pós-Graduação em Computação (PPGC) do Instituto de Informática da UFRGS recebeu Menção Honrosa no Prêmio CAPES de Tese. De autoria de Lucas Nunes Alegre, a tese Sample-Efficient Multi-Task and Multi-Objective Reinforcement Learning by Combining Multiple Behaviors, orientada pela Profa. Ana L. C. Bazzan e com coorientação do Prof. Bruno C. da Silva, aborda um dos desafios centrais do aprendizado por reforço: desenvolver agentes de Inteligência Artificial capazes de adaptar seu comportamento a diferentes tarefas sem precisar aprender novamente cada solução do zero.
Em aplicações de tomada de decisão sequencial, uma mesma situação pode exigir comportamentos distintos conforme os objetivos envolvidos. Um sistema autônomo, por exemplo, pode precisar equilibrar diferentes critérios — como segurança, tempo e consumo de energia — que nem sempre apontam para a mesma decisão. Para um agente de aprendizado por reforço, aprender uma nova combinação desses objetivos tradicionalmente pode exigir novas interações com o ambiente, processo que pode ser demorado, computacionalmente custoso ou até inviável quando essas interações são caras ou arriscadas. A tese parte justamente do problema de como tornar essa adaptação mais eficiente.
A pesquisa combina conceitos de aprendizado por reforço multitarefa (Multi-Task Reinforcement Learning – MTRL) e aprendizado por reforço multiobjetivo (Multi-Objective Reinforcement Learning – MORL), áreas que normalmente são estudadas de maneira independente. A proposta é permitir que um agente aprenda diferentes comportamentos especializados e, posteriormente, consiga combiná-los para encontrar soluções para tarefas que ainda não havia enfrentado.
Um dos principais problemas investigados na tese é o chamado optimal policy transfer, ou transferência ótima de políticas. A questão é determinar quais comportamentos um agente deve aprender previamente para que, diante de uma nova tarefa, seja possível combinar esse conhecimento e chegar diretamente a uma solução ótima, sem a necessidade de coletar novos dados do ambiente.
Para enfrentar esse problema, o trabalho apresenta o SFOLS (Successor Features Optimistic Linear Support). O método estabelece uma relação formal entre técnicas de aprendizado multitarefa baseadas em successor features e problemas de aprendizado multiobjetivo. A partir dessa relação, o SFOLS identifica um conjunto de políticas que pode ser combinado pelo método Generalized Policy Improvement (GPI) para construir comportamentos ótimos para novas tarefas cujas funções de recompensa possam ser expressas linearmente, sem a necessidade de novas amostras de treinamento.
A ideia é particularmente relevante para situações em que o problema não muda necessariamente de ambiente, mas muda a forma como os objetivos são priorizados. No exemplo de direção autônoma discutido na tese, diferentes comportamentos podem privilegiar velocidade, segurança ou conforto. Em vez de reaprender a dirigir para cada nova combinação dessas prioridades, o agente pode utilizar e combinar comportamentos previamente aprendidos para se adaptar à nova tarefa.
Além dos métodos teóricos e algorítmicos, o trabalho resultou em ferramentas de código aberto destinadas a apoiar a pesquisa e a reprodução de experimentos em aprendizado por reforço multiobjetivo. Entre elas estão o MO-Gymnasium, conjunto de ambientes padronizados para avaliação de algoritmos, e o MORL-Baselines, que reúne implementações de algoritmos de referência em MORL. A tese registra que o MO-Gymnasium passou posteriormente a integrar oficialmente a Farama Foundation.
As ferramentas também contribuíram para ampliar o alcance dos resultados da pesquisa. Segundo os dados registrados na tese, os trabalhos relacionados às contribuições já haviam recebido mais de 140 citações, enquanto MO-Gymnasium e MORL-Baselines somavam mais de 110 mil downloads no período analisado.
As contribuições científicas da tese foram apresentadas em conferências e periódicos internacionais da área, incluindo ICML, AAMAS e NeurIPS.
A Menção Honrosa no Prêmio CAPES de Tese soma-se a outro reconhecimento recebido pelo trabalho. A tese de Lucas Alegre conquistou anteriormente o 1º lugar no Concurso de Teses e Dissertações do Congresso da Sociedade Brasileira de Computação (CSBC), destacando-se entre os trabalhos selecionados pela SBC.
Para Lucas Alegre, os reconhecimentos representam a validação de anos de pesquisa e reforçam a relevância dos resultados obtidos em aprendizado por reforço e Inteligência Artificial. Em relação ao prêmio CAPES, o pesquisador compartilhou que:
“Receber a menção honrosa do Prêmio CAPES de Tese é uma alegria imensa e um reconhecimento muito especial. Ele representa a validação de anos de trabalho dedicado durante o doutorado, e reforça minha convicção de que a pesquisa que venho desenvolvendo em inteligência artificial e aprendizado por reforço tem relevância e impacto real, tanto na comunidade científica internacional quanto em aplicações práticas.”
Algre também destaca a importância da formação e da estrutura proporcionadas pelo Instituto de Informática e pelo PPGC, além da orientação recebida durante sua trajetória. Segundo ele, os reconhecimentos representam ainda uma motivação para continuar investigando problemas fundamentais da área e desenvolvendo métodos capazes de contribuir para o avanço do aprendizado por reforço e da Inteligência Artificial.