opponent_policy=network 설정으로 1000-iter 실험 두 개 (512x3, 1024x4)를 돌린 결과 두 실험 모두 policy collapse가 발생함을 확인. 큰 capacity는 plateau를 늘리지만 발산 자체를 막지 못함. 향후 학습은 self_play_league 기본값을 유지할 것을 권고. - 실험에 사용한 config 두 개 추가 - 발견 분석 문서 추가 (원인, 비교, 권고) Co-Authored-By: Claude Haiku 4.5 <noreply@anthropic.com>