En aquesta secció, presentem proves teòriques detallades que donen suport al marc d'Optimització Nash Directa (DNO). La prova del Teorema 2 implica un procediment de dos passos, començant amb la regressió utilitzant pèrdua logarítmica i portant a un límit d'error quadrat. Les definicions i suposicions es basen en gran mesura en la concentrabilitat de la teoria de l'aprenentatge per reforç (específicament en els treballs de Xie et al., 2021, 2023). Tot i que la secció simplifica alguns conceptes per a més claredat, una anàlisi teòrica completa està més enllà de l'abast del document. Les proves també aprofiten resultats estàndard de la teoria de la regressió, amb referències addicionals proporcionades per a una comprensió més profunda.





