# Model setup
DAC.sample_rate: 48000
DAC.encoder_dim: 64
DAC.encoder_rates: [2, 3, 5, 8, 8]
DAC.decoder_dim: 1536
DAC.decoder_rates: [8, 8, 5, 3, 2]

# Quantization
DAC.n_codebooks: 8
DAC.codebook_size: 4096
DAC.codebook_dim: 8
DAC.quantizer_dropout: 0.5
DAC.quantizer_type: lfq 

# Discriminator
Discriminator.sample_rate: 48000
Discriminator.rates: []
Discriminator.periods: [2, 3, 5, 7, 11]
Discriminator.fft_sizes: [2048, 1024, 512]
Discriminator.bands:
  - [0.0, 0.1]
  - [0.1, 0.25]
  - [0.25, 0.5]
  - [0.5, 0.75]
  - [0.75, 1.0]

# Optimization
AdamW.betas: [0.8, 0.99]
AdamW.lr: 0.0001
ExponentialLR.gamma: 0.999996

amp: false
device: cuda
num_iters: 400000
save_iters: [10000, 50000, 100000, 200000]
valid_freq: 1000
sample_freq: 10000
num_workers: 32
val_idx: [0, 1, 2, 3, 4, 5, 6, 7]
seed: 0
golden_dir: /home/victor/glockenspiel/descript-audio-codec/data/golden
lambdas:
  mel/loss: 15.0
  adv/feat_loss: 2.0
  adv/gen_loss: 1.0
  vq/commitment_loss: 0.01
  vq/codebook_loss: 1.0

VolumeNorm.db: [const, -16]

# Loss setup
MultiScaleSTFTLoss.window_lengths: [2048, 512]
MelSpectrogramLoss.n_mels: [5, 10, 20, 40, 80, 160, 320]
MelSpectrogramLoss.window_lengths: [32, 64, 128, 256, 512, 1024, 2048]
MelSpectrogramLoss.mel_fmin: [0, 0, 0, 0, 0, 0, 0]
MelSpectrogramLoss.mel_fmax: [null, null, null, null, null, null, null]
MelSpectrogramLoss.pow: 1.0
MelSpectrogramLoss.clamp_eps: 1.0e-5
MelSpectrogramLoss.mag_weight: 0.0

# Data
batch_size: 8

train/duration: 1.0
train/memmap_path: /app/suno/data/audio_v0/audio_48khz_2ch_tr.bin

val/duration: 5.0
val/n_examples: 250
val/memmap_path: /app/suno/data/audio_v0/audio_48khz_2ch_val.bin
val/samples_offsets:
  - 0
  - 40000000000
  - 80000000000
  - 120000000000
  - 160000000000
  - 200000000000
  - 240000000000
