
Sebanyak 5,6 miliar data video TikTok kini dapat diakses secara bebas oleh siapa saja melalui repositori kecerdasan buatan, Hugging Face.
Data yang dikumpulkan oleh pengembang dengan nama samaran hashfunction tersebut mencakup arsip konten yang direkam dari Juli 2014 hingga Oktober 2026. Koleksi masif ini tersedia dalam bentuk file Parquet dengan total ukuran mencapai 460 GB.
Perlu dicatat, data ini bukan berupa cuplikan video asli melainkan metadata terkait konten tersebut. Setiap baris data memuat informasi rinci seperti keterangan unggahan, tagar, ID suara, teks di layar, hingga ID produk TikTok Shop yang terkait. Selain itu, terdapat pula angka statistik berupa jumlah penayangan, suka, komentar, serta frekuensi penyimpanan dan unduhan dari setiap video.
Kumpulan data ini juga mencakup label internal milik TikTok, termasuk penanda apakah sebuah video dihasilkan oleh kecerdasan buatan atau apakah konten tersebut disaring dari halaman rekomendasi atau For You Page. Meski seringkali kosong untuk video lama, label ini menjadi sangat berharga bagi pihak yang ingin melatih model kecerdasan buatan.
Hingga saat ini, repositori tersebut telah diunduh lebih dari 1.181 kali oleh publik. Situs datasocial.ai menjadi pintu akses lain bagi mereka yang ingin menelusuri data tersebut tanpa batasan akses yang ketat seperti pada jalur riset resmi.
TikTok sendiri sebenarnya memiliki alat riset resmi yang terbuka bagi akademisi di Amerika Serikat, Uni Eropa, hingga Swiss. Namun, proses pengajuannya sangat ketat dan memerlukan persetujuan khusus dari platform.
Aksi pengumpulan data ini melanggar ketentuan layanan TikTok, khususnya pada bagian 3.4 yang melarang penggunaan perangkat lunak otomatis untuk mengekstrak informasi. Pembuat data mengeklaim mereka menggunakan API seluler pribadi TikTok dengan memanipulasi identitas perangkat agar terbaca seperti ponsel Android biasa.
Sistem tersebut berhasil mengumpulkan 3,23 miliar profil kreator, 5,94 miliar video, dan 2,8 miliar komentar hanya dalam waktu tiga minggu. Proses ini dilakukan tanpa memerlukan login akun sama sekali.
Data ini tersedia di bawah lisensi Creative Commons Attribution-NonCommercial 4.0 yang membolehkan penggunaan untuk riset pribadi saja. Untuk kebutuhan komersial, pemilik data mengarahkan pengguna ke layanan berbayar di situs web mereka. Sementara itu, kode sumber yang digunakan untuk melakukan peretasan data dijual seharga USD 1.699 (sekitar Rp26,6 juta).
Kasus ini menambah daftar panjang perselisihan mengenai praktik pengumpulan data untuk kecerdasan buatan di ranah hukum. Sebelumnya, Reddit telah menggugat beberapa perusahaan pengumpul data atas tuduhan penggunaan konten secara industri untuk melatih kecerdasan buatan.
Keberadaan data ini menjadi tantangan besar bagi privasi pengguna TikTok secara global. Belum ada pernyataan resmi dari TikTok terkait langkah hukum yang akan diambil untuk menanggapi kebocoran data berskala masif tersebut.
Baca juga tulisan lainnya dari Fajar Nugroho
Penulis: Fajar Nugroho
Editor: Beritana Editor