En aquesta secció, proporcionem proves teòriques detallades que donen suport al marc d'Optimització Directa de Nash (DNO). La prova del Teorema 2 implica un procediment de dos passos, començant amb una regressió utilitzant pèrdua logarítmica i portant a un límit d'error quadrat. Les definicions i suposicions es basen en gran mesura en la concentrabilitat de la teoria de l'aprenentatge per reforç (específicament en els treballs de Xie et al., 2021, 2023). Tot i que la secció simplifica alguns conceptes per a més claredat, una anàlisi teòrica completa està més enllà de l'abast del document. Les proves també fan ús de resultats estàndard de la teoria de regressió, amb referències addicionals proporcionades per a una comprensió més profunda.





