#alphazero

@Kamil Lee
AI

Gumbel AlphaZero 핵심 알고리즘 1: 행동 선택

시뮬레이션 횟수가 적으면 정책 개선을 보장하지 못하는 PUCT의 한계를, Gumbel AlphaZero가 루트 노드와 내부 노드에서 서로 다른 전략으로 푸는 방식을 정리했습니다.

Gumbel AlphaZero 핵심 알고리즘 1: 행동 선택
scroll to top