Investigação
DRACO distribui o sinal de treino pelos passos de um agente
A IBM publicou DRACO, que redistribui recompensa por passos de agentes e torna a versão e o comportamento do avaliador críticos para a reprodução do treino.
A IBM publicou DRACO, que redistribui recompensa por passos de agentes e torna a versão e o comportamento do avaliador críticos para a reprodução do treino.