#tuning

@Kamil Lee
AI

Gumbel AlphaZero 핵심 알고리즘 2: 정책 학습

탐색으로 얻은 더 나은 수를 신경망에 되돌리는 정책 학습 단계를 다룹니다. 방문 횟수 분포를 목표로 삼던 기존 AlphaZero와 무엇이 달라졌는지 비교했습니다.

Gumbel AlphaZero 핵심 알고리즘 2: 정책 학습
@Kamil Lee
AI

Gumbel AlphaZero 핵심 알고리즘 1: 행동 선택

시뮬레이션 횟수가 적으면 정책 개선을 보장하지 못하는 PUCT의 한계를, Gumbel AlphaZero가 루트 노드와 내부 노드에서 서로 다른 전략으로 푸는 방식을 정리했습니다.

Gumbel AlphaZero 핵심 알고리즘 1: 행동 선택
scroll to top