#shogi

@Kamil Lee
AI

Gumbel AlphaZero 핵심 알고리즘 2: 정책 학습

탐색으로 얻은 더 나은 수를 신경망에 되돌리는 정책 학습 단계를 다룹니다. 방문 횟수 분포를 목표로 삼던 기존 AlphaZero와 무엇이 달라졌는지 비교했습니다.

Gumbel AlphaZero 핵심 알고리즘 2: 정책 학습
@Kamil Lee
AI

Gumbel AlphaZero 핵심 알고리즘 1: 행동 선택

시뮬레이션 횟수가 적으면 정책 개선을 보장하지 못하는 PUCT의 한계를, Gumbel AlphaZero가 루트 노드와 내부 노드에서 서로 다른 전략으로 푸는 방식을 정리했습니다.

Gumbel AlphaZero 핵심 알고리즘 1: 행동 선택
@Kamil Lee
AI

보난자 메서드(Bonanza Method) 해설

2017년 전왕전에서 명인을 꺾은 포난자의 뿌리인 보난자 메서드를 살펴봅니다. 기보 학습으로 평가 함수를 최적화하는 이 기법이 이후 NNUE까지 이어지는 과정을 정리했습니다.

보난자 메서드(Bonanza Method) 해설
@Kamil Lee
AI

컴퓨터 쇼기에 딥러닝을 적용하기 위해

알파베타 탐색에 의존하던 쇼기 AI가 왜 딥러닝으로 옮겨갔는지, 기물 투입 규칙이 만드는 복잡성과 정책 네트워크의 역할을 2023년까지의 연구 흐름과 함께 정리했습니다.

컴퓨터 쇼기에 딥러닝을 적용하기 위해
scroll to top