Gumbel AlphaZero 핵심 알고리즘 구현 심층 분석
지금까지 Gumbel AlphaZero의 이론을 바탕으로 실제 코드에서 어떻게 구현되어 있는지에 대해 이야기합니다.
지금까지 Gumbel AlphaZero의 이론을 바탕으로 실제 코드에서 어떻게 구현되어 있는지에 대해 이야기합니다.
탐색으로 얻은 더 나은 수를 신경망에 되돌리는 정책 학습 단계를 다룹니다. 방문 횟수 분포를 목표로 삼던 기존 AlphaZero와 무엇이 달라졌는지 비교했습니다.
시뮬레이션 횟수가 적으면 정책 개선을 보장하지 못하는 PUCT의 한계를, Gumbel AlphaZero가 루트 노드와 내부 노드에서 서로 다른 전략으로 푸는 방식을 정리했습니다.
Gumbel AlphaZero에 대한 소개부터 기존 AlphaZero와의 차이점 등에 대해 이야기합니다.
수동 튜닝과 베이즈 최적화가 쇼기 AI에서 부딪힌 한계를 짚고, 모든 파라미터를 동시에 흔들어 기울기를 추정하는 SPSA가 왜 게임 AI 튜닝에 잘 맞는지 정리했습니다.
2017년 전왕전에서 명인을 꺾은 포난자의 뿌리인 보난자 메서드를 살펴봅니다. 기보 학습으로 평가 함수를 최적화하는 이 기법이 이후 NNUE까지 이어지는 과정을 정리했습니다.
알파베타 탐색에 의존하던 쇼기 AI가 왜 딥러닝으로 옮겨갔는지, 기물 투입 규칙이 만드는 복잡성과 정책 네트워크의 역할을 2023년까지의 연구 흐름과 함께 정리했습니다.