
Proses pengolahan musik berbasis AI dimulai dengan pelatihan dari ribuan contoh dunia nyata
Layanan pembuatan musik berbasis AI dilatih menggunakan perpustakaan musik yang sangat luas. Kami akan menjelaskan bagaimana prosesnya bekerja, dan apa yang dapat dilakukan untuk mencegah lagu anda sendiri diasimilasi.
Ketika anda mendengar lagu yang dihasilkan AI untuk pertama kalinya — yang meyakinkan, tidak dengan hasil yang aneh atau tidak realistis seperti beberapa tahun lalu — reaksinya biasanya antara kekaguman dan ketakutan. Teknologi ini berkembang pesat. Layanan seperti Suno & Udio sekarang dapat menghasilkan lagu berkualitas siaran dalam waktu kurang dari satu menit, lengkap dengan vokal, instrumentasi, dan aransemen. Tetapi bagaimana semua ini sebenarnya bekerja ? Bagaimana musik kita sendiri dieksploitasi agar sistem ini dapat berfungsi ? Dan apakah ada yang dapat kita lakukan untuk mencegahnya ?
Ini adalah pertanyaan yang telah saya renungkan selama dua tahun terakhir, baik sebagai musisi maupun sebagai peneliti. Jawabannya ternyata lebih bernuansa — dan lebih penuh harapan — daripada yang disarankan oleh sebagian besar berita utama.
Untuk memahami cara kerja pembuatan musik oleh AI, Anda perlu memahami terlebih dahulu bahwa sistem ini tidak 'mengarang' dalam arti sebenarnya. Mereka tidak memahami harmoni, melodi, atau ritme seperti yang dipahami oleh seorang musisi.
Bagaimana AI Menghasilkan Musik
Untuk memahami cara kerja pembuatan musik oleh AI, anda perlu memahami terlebih dahulu bahwa sistem ini tidak 'mengarang' dalam arti yang sebenarnya. Mereka tidak memahami harmoni, melodi, atau ritme seperti yang dipahami oleh seorang musisi. Sebaliknya, mereka mempelajari pola statistik dari sejumlah besar musik yang sudah ada, dan menghasilkan audio baru yang mengikuti pola serupa. Proses ini dimulai jauh sebelum seseorang mengetikkan perintah. Dimulai dengan pelatihan.
Pada dasarnya, berkas “raw audio” adalah serangkaian angka : nilai amplitudo yang diambil sampelnya puluhan ribu kali per detik. Pada kualitas CD (44,1 kHz), itu berarti 44.100 titik data untuk setiap detik audio mono. Memprosesnya secara langsung akan sangat mahal dalam hal komputasi, sehingga sistem AI mengompres audio menjadi representasi yang lebih mudah dikelola.
Pendekatan yang paling umum adalah mengubah audio menjadi mel spectogram - yang pada dasarnya merupakan peta visual tentang bagaimana amplitudo dalam sebuah audio didistribusikan ke seluruh frekuensi dari waktu ke waktu, dan diberi bobot untuk memperkirakan bagaimana manusia merasakan nada. Jika anda pernah melihat coloured-heatmap dari konten frekuensi lagu di DAW atau spectrum analyser, anda pasti pernah melihat hal serupa. Spektogram ini memadatkan bentuk raw waveform menjadi format yang jauh lebih efisien untuk diproses oleh jaringan saraf, sekaligus menjaga informasi yang paling penting.
Baru-baru ini, sistem seperti EnCodec dari Meta telah membawa hal ini selangkah lebih maju. EnCodec menggunakan neural encoder untuk mengompres audio menjadi token diskrit — kode numerik pendek, yang masing-masing mewakili fragmen suara yang sangat kecil. Bayangkan ini sebagai pengubahan audio menjadi semacam kosakata, di mana setiap 'kata' mewakili kombinasi karakteristik timbre dan tonal tertentu. Encoder memecah audio; decoder merekonstruksinya kemudian. Kompresinya sangat efisien : beberapa detik audio dapat direpresentasikan oleh beberapa token.
EnCodec menggunakan teknik yang disebut Residual Vector Quantisation, yang menggunakan beberapa 'codebooks' yang pada dasarnya adalah tabel pencarian fragmen suara. Alih-alih mencoba menangkap semuanya dalam satu kali proses, setiap codebook menyempurnakan representasi yang ditinggalkan oleh codebook sebelumnya, secara bertahap mengisi detailnya. Ini tidak jauh berbeda dengan cara seorang pelukis membuat bentuk dasar terlebih dahulu, kemudian menambahkan detail yang semakin halus pada setiap proses selanjutnya.
Dua Pendekatan untuk Generasi
Setelah kita memiliki sistem untuk merepresentasikan audio menggunakan token atau spectrogram, proses pembuatan audio sebenarnya dapat dilakukan. Ada 2 pendekatan utama yang digunakan saat ini, dan sebagian besar layanan komersial menggunakan kombinasi keduanya.
Autoregressive Model bekerja mirip dengan fitur prediksi teks di ponsel anda. Dengan urutan token audio yang diberikan, model memprediksi apa yang akan datang selanjutnya, satu token pada satu waktu. MusicGen dari Meta adalah contoh yang paling terkenal. Model ini menggunakan transformer — jenis arsitektur yang sama yang mendukung power large language model seperti ChatGPT — untuk memprediksi token audio berikutnya berdasarkan semua yang telah ada sebelumnya. Pengkondisian dapat berasal dari deskripsi teks (seperti : "upbeat jazz piano dengan brushed-drum") atau bahkan referensi melodi. Model ini tidak memahami jazz atau piano; model ini telah mempelajari hubungan statistik antara jutaan token audio yang diberi label dengan deskripsi serupa.
Model difusi mengambil pendekatan yang berbeda. Alih-alih membangun token audio satu per satu, model ini dimulai dengan noise murni dan secara bertahap memperhalusnya menjadi audio yang koheren, dipandu oleh perintah teks. Pada setiap langkah, model akan menghilangkan sedikit noise, mendekatkan output ke sesuatu yang sesuai dengan deskripsi yang diminta.
Banyak sistem menggunakan difusi laten, di mana proses penghilangan noise ini terjadi dalam representasi audio yang terkompresi daripada pada bentuk gelombang mentah itu sendiri, sehingga jauh lebih efisien secara komputasi.

Dalam praktiknya, banyak sistem menggabungkan elemen dari keduanya. Suno, misalnya, tampaknya menggunakan autoregressive generation yang dikombinasikan dengan difussion based-upscaling untuk keluaran dengan fidelitas tinggi. Detail arsitektur komersial ini bersifat rahasia, tetapi prinsip-prinsip umumnya telah mapan.
®
Oleh : Joshua Stewart