{
 "cells": [
  {
   "cell_type": "code",
   "execution_count": 2,
   "metadata": {},
   "outputs": [],
   "source": [
    "\n",
    "import os\n",
    "import IPython\n",
    "import torchaudio\n",
    "import numpy as np\n",
    "import matplotlib.pyplot as plt\n",
    "\n",
    "from suno_utils.utils.text import read_jsonl, write_jsonl\n",
    "from suno_utils.audio import Audio\n",
    "from suno_utils.utils.s3 import read_from_s3"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": 6,
   "metadata": {},
   "outputs": [],
   "source": []
  },
  {
   "cell_type": "code",
   "execution_count": 10,
   "metadata": {},
   "outputs": [
    {
     "name": "stdout",
     "output_type": "stream",
     "text": [
      "Loaded 2101711 audio production metas\n",
      "Loaded 2090002 audio production metas\n"
     ]
    }
   ],
   "source": [
    "youtube_music_audio_production_metas = read_jsonl(\n",
    "    \"/home/christian/code/christian/metadata/youtube_music_metas_audio_production.jsonl\"\n",
    ")\n",
    "print(f\"Loaded {len(youtube_music_audio_production_metas)} audio production metas\")\n",
    "\n",
    "genius_hq_audio_production_metas = read_jsonl(\n",
    "    \"/home/christian/code/christian/metadata/genius_hq_metas_audio_production.jsonl\"\n",
    ")\n",
    "print(f\"Loaded {len(genius_hq_audio_production_metas)} audio production metas\")\n"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": 11,
   "metadata": {},
   "outputs": [],
   "source": [
    "base_metas_dir = \"/app/suno/data/diffusion_mix/vae_100hz_30s\"\n",
    "metas_filename = \"metas_context_aligned\""
   ]
  },
  {
   "cell_type": "code",
   "execution_count": 12,
   "metadata": {},
   "outputs": [],
   "source": [
    "\n",
    "youtube_music_audio_production_metas_dict = {meta[\"id\"]: meta for meta in youtube_music_audio_production_metas}\n",
    "genius_hq_audio_production_metas_dict = {meta[\"id\"]: meta for meta in genius_hq_audio_production_metas}\n",
    "\n",
    "# merge into one dict\n",
    "audio_production_metas_dict = {**youtube_music_audio_production_metas_dict, **genius_hq_audio_production_metas_dict}"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": 16,
   "metadata": {},
   "outputs": [
    {
     "name": "stdout",
     "output_type": "stream",
     "text": [
      "Loaded 3363 base metas\n",
      "Saving 3363 new metas. 3229 (96.02%) metas had audio production features.\n",
      "Loaded 9680359 base metas\n",
      "Saving 9680359 new metas. 9311983 (96.19%) metas had audio production features.\n"
     ]
    }
   ],
   "source": [
    "for dset in [\"val\", \"tr\"]:\n",
    "    # load base metas\n",
    "    base_metas = read_jsonl(os.path.join(base_metas_dir, f\"{metas_filename}_{dset}.jsonl\"))\n",
    "    print(f\"Loaded {len(base_metas)} base metas\")\n",
    "    counter = 0\n",
    "\n",
    "    new_metas = []\n",
    "    for meta in base_metas:\n",
    "        if meta[\"id\"] in audio_production_metas_dict:\n",
    "            features = audio_production_metas_dict[meta[\"id\"]][\"features\"]\n",
    "            meta[\"audio_production_features\"] = features\n",
    "            counter += 1\n",
    "\n",
    "        new_metas.append(meta)\n",
    "\n",
    "    print(f\"Saving {len(new_metas)} new metas. {counter} ({counter/len(new_metas)*100:.2f}%) metas had audio production features.\")\n",
    "    write_jsonl(new_metas, os.path.join(base_metas_dir, f\"{metas_filename}_audio_production_{dset}.jsonl\"))\n"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": 15,
   "metadata": {},
   "outputs": [
    {
     "data": {
      "text/plain": [
       "{'loudness_factor': '-11.076',\n",
       " 'spectral_character': 'bassy',\n",
       " 'spectral_centroid': '1914.064',\n",
       " 'bass_ratio': '0.693',\n",
       " 'mid_ratio': '0.294',\n",
       " 'high_ratio': '0.014',\n",
       " 'stereo_width': '0.273',\n",
       " 'total_clips': 1,\n",
       " 'clips_per_second': '0.005'}"
      ]
     },
     "execution_count": 15,
     "metadata": {},
     "output_type": "execute_result"
    }
   ],
   "source": [
    "new_metas[130][\"audio_production_features\"]\n"
   ]
  },
  {
   "cell_type": "code",
   "execution_count": null,
   "metadata": {},
   "outputs": [],
   "source": []
  }
 ],
 "metadata": {
  "kernelspec": {
   "display_name": "suno_env",
   "language": "python",
   "name": "python3"
  },
  "language_info": {
   "codemirror_mode": {
    "name": "ipython",
    "version": 3
   },
   "file_extension": ".py",
   "mimetype": "text/x-python",
   "name": "python",
   "nbconvert_exporter": "python",
   "pygments_lexer": "ipython3",
   "version": "3.10.9"
  }
 },
 "nbformat": 4,
 "nbformat_minor": 2
}
