@Kamil Lee
Gumbel AlphaZero 핵심 알고리즘 구현 심층 분석
지금까지 Gumbel AlphaZero의 이론을 바탕으로 실제 코드에서 어떻게 구현되어 있는지에 대해 이야기합니다.
지금까지 Gumbel AlphaZero의 이론을 바탕으로 실제 코드에서 어떻게 구현되어 있는지에 대해 이야기합니다.
탐색으로 얻은 더 나은 수를 신경망에 되돌리는 정책 학습 단계를 다룹니다. 방문 횟수 분포를 목표로 삼던 기존 AlphaZero와 무엇이 달라졌는지 비교했습니다.
시뮬레이션 횟수가 적으면 정책 개선을 보장하지 못하는 PUCT의 한계를, Gumbel AlphaZero가 루트 노드와 내부 노드에서 서로 다른 전략으로 푸는 방식을 정리했습니다.
Gumbel AlphaZero에 대한 소개부터 기존 AlphaZero와의 차이점 등에 대해 이야기합니다.