#!/bin/bash
export CUDA_LAUNCH_BLOCKING=0
export NCCL_DEBUG=WARN
export TORCH_DISTRIBUTED_DEBUG=OFF
export TORCH_CPP_LOG_LEVEL=WARNING

export OMP_NUM_THREADS=1
export MASTER_ADDR=$(scontrol show hostnames "$SLURM_JOB_NODELIST" | head -n 1)
export MASTER_PORT=12835
export TRITON_CACHE_DIR=/mnt/localdisk/.triton_cache_$USER
export SLURM_NTASKS_PER_NODE=8

TRAIN_PATH=/home/tony/Work/neon/sunoGPT
echo working from $TRAIN_PATH
cd $TRAIN_PATH
pkill -f 'spawn_main'
rm -rf /mnt/localdisk/tmp_tony
mkdir -p /mnt/localdisk/tmp_tony
chmod -R 777 /mnt/localdisk/tmp_tony
# super old prod: /app/suno/checkpoints/2023-12-21_10-59-38/step_450k_ckpt.pt
# ft prod: /app/suno/checkpoints/2024-01-20_22-01-25
# dpo prod: /app/suno/checkpoints/2024-02-02_15-26-29
# v3 prod:  /app/suno/checkpoints/2024-03-19_03-11-05 
# 13b test: /app/suno/data/dpo/models/model_13b_full.pt
# 13b dpo: /app/suno/checkpoints/2024-05-16_04-33-58/last_ckpt_infer.pt
# 13b dpo launch: /app/suno/checkpoints/2024-05-27_02-51-46/last_ckpt_infer.pt
# 13b ft: /app/suno/data/dpo/models/13_ft_4head_20k.pt
# s-8: /app/suno/checkpoints/2024-06-17_01-25-46/last_ckpt_infer.pt
# https://wandb.ai/suno/chirp-v4_dev2/runs/335lzmnj/overview?nw=nwusertonytongsuno
/home/tony/anaconda3/envs/suno_12/bin/python -u \
    train_dpo.py \
    --master_addr=$MASTER_ADDR \
    --master_port=$MASTER_PORT \
    \
    --out_dir="/app/suno/checkpoints" \
    --data_dir="/app/suno/data/dpo/13b_s32_v34" \
    \
    --train_filename="data_tr.bin" \
    --train_metas_filename="meta_tr.jsonl" \
    --train_info_filename="info_tr.json" \
    --val_filename="data_val.bin" \
    --val_metas_filename="meta_val.jsonl" \
    --val_info_filename="info_val.json" \
    \
    --learning_rate=5e-7 \
    --min_lr=1e-9 \
    --do_ipo=True \
    --dpo_beta=20.0 \
    --semantic_codebook_weight=4.0 \
    --last_codebook_weight=0.5 \
    --warmup_iters=50 \
    --max_iters=1194 \
    --sft_loss_scale=0.0 \
    --grad_clip=0.1 \
    --eval_interval=600 \
    --eval_iters=25 \
    --step_save_iters=600 \
    \
    --block_size=8704 \
    --t_text=2560 \
    --t_memmap=6016 \
    --t_audio=6144 \
    --use_rotary_pos_emb=True \
    --rope_theta=500_000 \
    --use_qk_norm=False \
    --activation_f="gelu" \
    \
    --n_layer=40 \
    --n_head=40 \
    --d_head=128 \
    --n_kv_head=8 \
    --attention_type="tao" \
    \
    --gradient_accumulation_steps=1 \
    --eval_loss_batch_size=16 \
    --batch_size=4 \
    \
    --fsdp=True \
    --sharding_strategy="full_shard" \
    --grad_checkpointing=True \
    --shuffle_data=False \
    \
    --preload_checkpoint="/app/suno/data/dpo/models/model_13b_s32.pt" \
    --model_cache_loss_name="13b_dpo_s32" \
    --preload_strict=False \
    --local_cache_dir="/mnt/localdisk/tmp_tony" \
    \
    --wandb_log=True \
    --wandb_project="chirp-30b-dpo-dev" \
    --wandb_run_name="dpo_13b_s32_v34"

rm -rf /mnt/localdisk/tmp_tony
echo working from $TRAIN_PATH
echo DONE