Gumbel AlphaZero 핵심 알고리즘 1: 행동 선택
시뮬레이션 횟수가 적으면 정책 개선을 보장하지 못하는 PUCT의 한계를, Gumbel AlphaZero가 루트 노드와 내부 노드에서 서로 다른 전략으로 푸는 방식을 정리했습니다.
시뮬레이션 횟수가 적으면 정책 개선을 보장하지 못하는 PUCT의 한계를, Gumbel AlphaZero가 루트 노드와 내부 노드에서 서로 다른 전략으로 푸는 방식을 정리했습니다.
Gumbel AlphaZero에 대한 소개부터 기존 AlphaZero와의 차이점 등에 대해 이야기합니다.
수동 튜닝과 베이즈 최적화가 쇼기 AI에서 부딪힌 한계를 짚고, 모든 파라미터를 동시에 흔들어 기울기를 추정하는 SPSA가 왜 게임 AI 튜닝에 잘 맞는지 정리했습니다.
시간 복잡도와 공간 복잡도가 각각 무엇을 재는 지표인지 구분하고, Big-O 표기법으로 O(1)부터 지수 시간까지 주요 유형을 예시와 함께 정리했습니다.
다수의 프롬프트를 순차 처리할 때 생기는 대기 시간을 asyncio로 줄이는 방법을 다룹니다. 코루틴과 이벤트 루프, 워커 큐 패턴을 거쳐 실제 LLM 서비스 설계 예시까지 정리했습니다.
문장 쌍을 매번 함께 입력해야 했던 BERT의 O(N²) 한계를 SBERT가 어떻게 O(N)으로 줄였는지 살펴보고, Multilingual E5와 비교하며 임베딩 모델 선택 기준을 정리했습니다.
Microsoft의 3D 생성 모델 TRELLIS를 다룹니다. SLAT 구조적 잠재 표현과 Rectified Flow Transformer의 원리부터 설치·사용법, 사전학습 모델과 학습 방법까지 단계별로 정리했습니다.
OS 스레드와 가상 스레드의 차이를 비교하고, JVM이 경량 실행 단위를 스케줄링하는 방식과 블로킹 I/O 환경에서의 이점, 도입 시 주의할 한계까지 정리했습니다.
커널이 프로세스·메모리·파일 시스템·장치를 어떻게 관리하는지 살펴보고, 커널의 종류를 비교하며 운영체제의 핵심 구조를 정리했습니다.