Aquesta secció presenta una extensió del marc d'Optimització Nash Directa (DNO) per gestionar preferències regularitzades. La principal diferència entre SPO i Nash-MD rau en l'ús de polítiques suavitzades per a aquest últim, cosa que ajuda a obtenir una garantia de convergència tardana. La secció introdueix una nova versió de DNO, dissenyada per convergir a un equilibri de Nash mitjançant KL-regularització. L'algorisme (Algorisme 3) funciona de manera iterativa, ajustant la distribució de la política a través d'una funció de partició i una funció de recompensa, refinant finalment la política amb cada iteració. Aquest enfocament ajuda a abordar els reptes de les preferències regularitzades mentre garanteix una convergència estable.





