#!/bin/bash
export CUDA_LAUNCH_BLOCKING=0
export NCCL_DEBUG=WARN
export TORCH_DISTRIBUTED_DEBUG=OFF
export TORCH_CPP_LOG_LEVEL=WARNING

export OMP_NUM_THREADS=1
export MASTER_ADDR=$(scontrol show hostnames "$SLURM_JOB_NODELIST" | head -n 1)
export MASTER_PORT=12835
export TRITON_CACHE_DIR=/mnt/localdisk/.triton_cache_$USER


TRAIN_PATH=/home/tony/Work/neon/sunoGPT
echo working from $TRAIN_PATH
cd $TRAIN_PATH
pkill -f 'spawn_main'
rm -rf /mnt/localdisk/tmp_tony
mkdir -p /mnt/localdisk/tmp_tony
chmod -R 777 /mnt/localdisk/tmp_tony
# v0: first 4p5 sem only 3b: /app/suno/data/dpo/models/model_3b_sem_20250127.pt
# v1: first 4p5 sem only 3b: /app/suno/data/dpo/models/model_3b_sem_20250203_80k.pt
# 6b v0: /app/suno/checkpoints/2025-02-04_21-04-31/last_ckpt_infer.pt
# 6b v0 sft: /app/suno/checkpoints/2025-02-06_11-22-04/last_ckpt_infer.pt
# 6b v0 sft 2: /app/suno/checkpoints/2025-02-24_01-06-45/last_ckpt_infer.pt
# https://wandb.ai/suno/chirp-v4_dev2/runs/335lzmnj/overview?nw=nwusertonytongsuno
/home/tony/anaconda3/envs/gpt_n/bin/python -u \
    train_dpo.py \
    --master_addr=$MASTER_ADDR \
    --master_port=$MASTER_PORT \
    \
    --out_dir="/app2/suno/checkpoints" \
    --data_dir="/app/suno/data/dpo/30b_t1_v23" \
    \
    --train_filename="data_tr.bin" \
    --train_metas_filename="meta_tr.jsonl" \
    --train_info_filename="info_tr.json" \
    --val_filename="data_val.bin" \
    --val_metas_filename="meta_val.jsonl" \
    --val_info_filename="info_val.json" \
    \
    --coarse_n_codebooks=0 \
    --block_size=14_080 \
    --t_text=2048 \
    --t_audio=12_000 \
    \
    --learning_rate=5e-6 \
    --min_lr=1e-7 \
    --do_ipo=True \
    --dpo_beta=20.0 \
    --sft_loss_scale=0.0 \
    --semantic_codebook_weight=4.0 \
    --last_codebook_weight=0.5 \
    --warmup_iters=50 \
    --max_iters=504 \
    \
    --grad_clip=0.1 \
    --eval_interval=260 \
    --eval_iters=25 \
    --step_save_iters=4_000 \
    \
    --t_memmap=6016 \
    --t_data_memmap=6016 \
    --use_rotary_pos_emb=True \
    --rope_theta=500_000 \
    --use_qk_norm=True \
    --activation_f="silu" \
    --embed_scale_factor=10.0 \
    --global_every_n_layers=1 \
    \
    --n_layer=32 \
    --n_head=32 \
    --d_head=128 \
    --n_kv_head=4 \
    --attention_type="tao" \
    \
    --gradient_accumulation_steps=1 \
    --batch_size=4 \
    --eval_loss_batch_size=16 \
    \
    --fsdp=True \
    --sharding_strategy="full_shard" \
    --grad_checkpointing=True \
    --shuffle_data=False \
    \
    --preload_checkpoint="/app2/suno/checkpoints/2025-08-28_01-30-09/last_ckpt_infer.pt" \
    --model_cache_loss_name="6b_crow_25_0" \
    --preload_strict=False \
    --local_cache_dir="/mnt/localdisk/tmp_tony" \
    \
    --wandb_log=True \
    --wandb_project="chirp-bluejay-dpo" \
    --wandb_run_name="dpo_6b_base0828_crow_25_r1"
    

rm -rf /mnt/localdisk/tmp_tony
echo working from $TRAIN_PATH
echo DONE