chain_name: "Reward Model Training Chain"
description: "Sequential reward model training on crow_t1_v51 dataset"

# Global settings
settings:
  base_dir: "/home/tony/Work/tony/slurm/reward_model"
  log_dir: "/home/tony/slurm/logs"
  
  # SLURM defaults
  slurm_defaults:
    time: "48:00:00"
    ntasks_per_node: 8
    cpus_per_task: 4
    gpus_per_node: 8

# Checkpoint extraction patterns
checkpoint_patterns:
  - 'logging checkpoint here:\s*(/[^\s]+)'
  - '(/app2?/suno/checkpoints/\d{4}-\d{2}-\d{2}_\d{2}-\d{2}-\d{2})'

# Script validation patterns
validation_patterns:
  - '--preload_checkpoint='
  - 'train_reward_model\.py'
  - '--wandb_run_name='

# Job definitions
jobs:
  # - name: "round_1"
  #   script: "run_reward_model_crow_r1.sh"
  #   nodes: 16
  #   wandb_run_name: "reward_crow_v51_r1"
  
  - name: "round_2"
    script: "run_reward_model_crow_r2.sh"
    nodes: 16
    wandb_run_name: "reward_crow_v51_r2"
  
  - name: "round_3"
    script: "run_reward_model_crow_r3.sh"
    nodes: 16
    wandb_run_name: "reward_crow_v51_r3"

  - name: "round_4"
    script: "run_reward_model_crow_r4.sh"
    nodes: 16
    wandb_run_name: "reward_crow_v51_r4"
    
  - name: "round_5"
    script: "run_reward_model_crow_r5.sh"
    nodes: 16
    wandb_run_name: "reward_crow_v51_r5"
  
  - name: "round_6"
    script: "run_reward_model_crow_r6.sh"  
    nodes: 16
    wandb_run_name: "reward_crow_v51_r6"
  
  - name: "round_7"
    script: "run_reward_model_crow_r7.sh"  
    nodes: 16
    wandb_run_name: "reward_crow_v51_r7"

