run_id: jdb-b9w10-from-b9w6 quoridor: board_size: 9 max_walls: 10 max_steps: 300 alphazero: network: type: resnet num_blocks: 6 num_channels: 32 mcts_n: 1000 mcts_c_puct: 1.2 wandb: project: B9W10 upload_model: every: 100 models when_max: - raw_win_perc - p2_win_perc when_min: - dumb_score self_play: num_processes: 1 games_per_process: 128 leaf_parallelism: 16 virtual_loss: 3 enable_tree_reuse: true mcts_worker_threads: 18 eval_batch_size: 1024 eval_max_wait_ms: 1 eval_cache_max_size: 1000000 alphazero: mcts_noise_epsilon: 0.25 drop_t_on_step: 20 temperature: 1.0 program: rust training: games_per_training_step: 100.0 learning_rate: 0.001 batch_size: 2048 weight_decay: 0.0001 replay_buffer_size: 20000 max_cached_games: 20000 finish_after: 9999999 hours initial_model: file: /home/jbinney/ws/deep_rabbit_hole/deep_quoridor/runs/jdb-b9w6-from-b9w4/models/checkpoints/model_712.pt benchmarks: - every: 1 models jobs: - type: tournament alphazero: mcts_n: 0 prefix: raw times: 10 opponents: - random - greedy:p_random=0.3,nick=greedy-03 - greedy - every: 10 models jobs: - type: tournament prefix: '' times: 10 opponents: - random - greedy:p_random=0.3,nick=greedy-03 - greedy