RMIX: Learning risk-sensitive policies for cooperative reinforcement learning agents

Current value-based multi-agent reinforcement learning methods optimize individual Q values to guide individuals' behaviours via centralized training with decentralized execution (CTDE). However, such expected, i.e., risk-neutral, Q value is not sufficient even with CTDE due to the randomness o...

وصف كامل

محفوظ في:

التفاصيل البيبلوغرافية
المؤلفون الرئيسيون:	QIU, Wei, WANG, Xinrun, YU, Runsheng, HE, Xu, WANG, Rundong, AN, Bo, OBRAZTSOVA, Svetlana, RABINOVICH, Zinovi
التنسيق:	text
اللغة:	English
منشور في:	Institutional Knowledge at Singapore Management University 2021
الموضوعات:	Artificial Intelligence and Robotics Theory and Algorithms
الوصول للمادة أونلاين:	https://ink.library.smu.edu.sg/sis_research/9137 https://ink.library.smu.edu.sg/context/sis_research/article/10140/viewcontent/NeurIPS_2021_rmix__pvoa.pdf
الوسوم:	إضافة وسم لا توجد وسوم, كن أول من يضع وسما على هذه التسجيلة!

الانترنت

https://ink.library.smu.edu.sg/sis_research/9137
https://ink.library.smu.edu.sg/context/sis_research/article/10140/viewcontent/NeurIPS_2021_rmix__pvoa.pdf

RMIX: Learning risk-sensitive policies for cooperative reinforcement learning agents

الانترنت

مواد مشابهة