ml-agents/config/sac/Tennis.yaml


								behaviors:

								  Tennis:

								    trainer_type: sac

								    hyperparameters:

								      learning_rate: 0.0003

								      learning_rate_schedule: constant

								      batch_size: 128

								      buffer_size: 50000

								      buffer_init_steps: 0

								      tau: 0.005

								      steps_per_update: 10.0

								      save_replay_buffer: false

								      init_entcoef: 1.0

								      reward_signal_steps_per_update: 10.0

								    network_settings:

								      normalize: true

								      hidden_units: 256

								      num_layers: 2

								      vis_encode_type: simple

								    reward_signals:

								      extrinsic:

								        gamma: 0.99

								        strength: 1.0

								    output_path: default

								    keep_checkpoints: 5

								    max_steps: 20000000

								    time_horizon: 64

								    summary_freq: 10000

								    threaded: true

								    self_play:

								      save_steps: 50000

								      team_change: 250000

								      swap_steps: 50000

								      window: 10

								      play_against_latest_model_ratio: 0.5

								      initial_elo: 1200.0