chain_name: "4RVQ Semantic DPO Chain"
description: "A 4RVQ semantic DPO training chain with progressive SFT reduction"

# Global settings
settings:
  base_dir: "/home/tony/Work/tony/slurm/sem_4rvq"
  log_dir: "/home/tony/slurm/logs"
  
  # SLURM defaults - no partition specified
  slurm_defaults:
    time: "48:00:00"
    ntasks_per_node: 8
    cpus_per_task: 14
    gpus_per_node: 8

# Job definitions
jobs:
  - name: "round_1"
    script: "run_dpo_4rvq_crow_r1.sh"
    nodes: 16
    model_cache_loss_name: "crow_t1_d100"
    sft_loss_scale: 0.0
    wandb_run_name: "sem_1rvq_crow_d100_v51_n16_r1"
  
  - name: "round_2"
    script: "run_dpo_4rvq_crow_r2.sh"
    nodes: 16
    model_cache_loss_name: "sem_1rvq_crow_d100_v51_n16_r1"
    sft_loss_scale: 0.0
    wandb_run_name: "sem_1rvq_crow_d100_v52_n16_r2"
  
  - name: "round_3"
    script: "run_dpo_4rvq_crow_r3.sh"
    nodes: 16
    model_cache_loss_name: "sem_1rvq_crow_d100_v52_n16_r2"
    sft_loss_scale: 0.0
    wandb_run_name: "sem_1rvq_crow_d100_v53_n16_r3"
  
  - name: "round_4"
    script: "run_dpo_4rvq_crow_r4.sh"
    nodes: 16
    sft_loss_scale: 0.0
    model_cache_loss_name: "sem_1rvq_crow_d100_v53_n16_r3"
    wandb_run_name: "sem_1rvq_crow_d100_v54_n16_r4"
    
  - name: "round_5"
    script: "run_dpo_4rvq_crow_r5.sh"
    nodes: 16
    model_cache_loss_name: "sem_1rvq_crow_d100_v54_n16_r4"
    wandb_run_name: "sem_1rvq_crow_d100_v55_n16_r5"
  
  - name: "round_6"
    script: "run_dpo_4rvq_crow_r6.sh"
    nodes: 16
    model_cache_loss_name: "sem_1rvq_crow_d100_v55_n16_r5"
    wandb_run_name: "sem_1rvq_crow_d100_v56_n16_r6"
  
  - name: "round_7"
    script: "run_dpo_4rvq_crow_r7.sh"  
    nodes: 16
    model_cache_loss_name: "sem_1rvq_crow_d100_v56_n16_r6"
    wandb_run_name: "sem_1rvq_crow_d100_v57_n16_r7"

