#!/bin/bash
export CUDA_LAUNCH_BLOCKING=0
export NCCL_DEBUG=WARN
export TORCH_DISTRIBUTED_DEBUG=OFF
export TORCH_CPP_LOG_LEVEL=WARNING

export OMP_NUM_THREADS=1
export HOSTNAMES=`scontrol show hostnames "$SLURM_JOB_NODELIST"`
export MASTER_ADDR=$(scontrol show hostnames "$SLURM_JOB_NODELIST" | head -n 1)
export MASTER_PORT=12836
export COUNT_NODE=`scontrol show hostnames "$SLURM_JOB_NODELIST" | wc -l`
export TRITON_CACHE_DIR=/tmp/.triton_cache_tony


TRAIN_PATH=/mnt/round-surf/home/tony/Work/neon/sunoGPT
echo working from $TRAIN_PATH
cd $TRAIN_PATH
# super old prod: /app/suno/checkpoints/2023-12-21_10-59-38/step_450k_ckpt.pt
# ft prod: /app/suno/checkpoints/2024-01-20_22-01-25
# dpo prod: /app/suno/checkpoints/2024-02-02_15-26-29
# v3 prod:  /app/suno/checkpoints/2024-03-19_03-11-05
# https://wandb.ai/suno/chirp-v4_dev2/runs/335lzmnj/overview?nw=nwusertonytongsuno
/mnt/round-surf/home/tony/anaconda3/envs/suno_env/bin/torchrun \
    --master_addr=$MASTER_ADDR \
    --master_port=$MASTER_PORT \
    --nnodes=$SLURM_JOB_NUM_NODES \
    --nproc_per_node=$SLURM_GPUS_ON_NODE \
    --rdzv_id $SLURM_JOB_ID \
    --rdzv_backend c10d \
    --rdzv_endpoint "$MASTER_ADDR:$MASTER_PORT" \
    train_dpo.py \
    \
    --out_dir="/mnt/round-surf/checkpoints" \
    --data_dir="/mnt/round-surf/data/dpo/2b_before_recode_v0" \
    \
    --train_filename="data_tr.bin" \
    --train_metas_filename="meta_tr.jsonl" \
    --train_info_filename="info_tr.json" \
    --val_filename="data_val.bin" \
    --val_metas_filename="meta_val.jsonl" \
    --val_info_filename="info_val.json" \
    \
    --learning_rate=5e-7 \
    --min_lr=1e-8 \
    --do_ipo=True \
    --dpo_beta=5.0 \
    --semantic_codebook_weight=4.0 \
    --last_codebook_weight=1.0 \
    --warmup_iters=200 \
    --max_iters=1_500 \
    \
    --grad_clip=0.1 \
    --eval_interval=500 \
    --eval_iters=25 \
    --step_save_iters=500 \
    \
    --block_size=8832 \
    --t_text=2560 \
    --t_memmap=6016 \
    --t_audio=6272 \
    --use_rotary_pos_emb=True \
    --rope_theta=500_000 \
    --embed_scale_factor=10.0 \
    --use_qk_norm=True \
    --activation_f="silu" \
    \
    --n_layer=60 \
    --n_head=56 \
    --d_head=128 \
    --n_kv_head=4 \
    --attention_type="tao" \
    \
    --gradient_accumulation_steps=1 \
    --batch_size=2 \
    \
    --fsdp=True \
    --sharding_strategy="full_shard" \
    --grad_checkpointing=True \
    \
    --preload_checkpoint="/mnt/round-surf/data/dpo/models/model_30b_150k.pt" \
    --model_cache_loss_name="30b_base" \
    --preload_strict=False \
    --preload_optimizer=False \
    --local_cache_dir="/tmp/checkpoint_tony_30b" \
    \
    --wandb_log=True \
    --wandb_project="chirp-30b-dpo-dev" \
    --wandb_run_name="dpo_30b_test_andro"
    