HydraMARL
Uno studio sui fondamenti della condivisione dei parametri nel reinforcement learning multi-agente cooperativo. HydraMARL scompone la policy network e la value network di ogni agente in un tronco condiviso da tutti gli agenti e una testa individuale, con la stessa decomposizione per actor e critic; un singolo parametro continuo copre l'intero spettro dalla condivisione completa alla piena indipendenza. Esperimenti sistematici sulla suite di benchmark VMAS individuano il regime di condivisione ottimale e ne caratterizzano la sensibilità alla struttura del task, al grado di cooperazione e alla dimensione della popolazione.
Quando molti agenti imparano insieme, parti delle loro reti neurali possono essere condivise. Misuriamo quanto aiuti davvero condividere e mettiamo in luce il compromesso tra imparare in fretta e imparare a specializzarsi.








