Weple

Panduan

Data Sudah Terkumpul, Lalu Tidak Bisa Dipakai

Yang Menentukan Boleh Tidaknya Adalah Syarat Penggunaan

Secara teknis, situs yang bisa diambil datanya banyak sekali. Pertanyaan sebenarnya bukan bisa atau tidak, melainkan boleh atau tidak. Sebagian besar situs mencantumkan larangan atau pembatasan pengumpulan otomatis di syarat penggunaannya, dan sebagian menandai jalur mana yang terbuka lewat robots.txt. Sebelum pekerjaan ini diserahkan ke pihak luar, bukalah syarat penggunaan dan robots.txt situs sasaran. Melompati langkah tersebut berujung pada data yang menumpuk penuh tapi tidak bisa dipakai.

Mengabaikan robots.txt Meninggalkan Jejak

robots.txt bukan dokumen hukum yang mengikat. Isinya permintaan dari pengelola situs kepada robot pengumpul. Dari sisi teknis, mengabaikannya tetap menghasilkan data. Persoalannya muncul belakangan. Fakta bahwa robots.txt diabaikan bisa dipakai untuk menilai unsur kesengajaan ketika sengketa terjadi. Hindari jalur yang ditutup, dan kalau data di jalur itu benar-benar diperlukan, kirim pertanyaan resmi ke pengelola situsnya.

Begitu Informasi Pribadi Ikut Terbawa

Unggahan yang terbuka untuk umum pun sering membawa nama penulis, kontak, dan foto profil. Begitu bagian itu ikut terkumpul, datanya masuk ke ranah Undang-Undang Perlindungan Data Pribadi. Anggapan “sudah publik, jadi aman” berbahaya. Mengumpulkan, menyimpan, dan memanfaatkan data pribadi menuntut dasar hukum tersendiri. Kalau sasaran pengumpulan bercampur informasi pribadi, bagian tersebut tidak bisa dilewati tanpa peninjauan terpisah.

Hak Cipta Menagih di Tahap Penayangan

Artikel berita, foto, dan teks ulasan punya pemilik hak cipta, dan masalahnya membesar bukan saat mengambil, melainkan saat menayangkannya ulang di layanan sendiri. Merangkum lalu menautkan ke sumber diperlakukan sangat berbeda dari menyalin naskah utuh dan menampilkannya kembali. Kedalaman peninjauannya juga bergantung pada tujuan. Data yang hanya menumpuk untuk analisis internal dan data yang akan tampil di layanan publik tidak bisa diukur dengan penggaris yang sama.

Tiga Jawaban yang Disiapkan Sebelum Menyerahkan Pekerjaan

Menyerahkan pekerjaan scraping ke pihak luar berjalan lebih cepat kalau tiga hal ini sudah ada jawabannya.

  • Syarat penggunaan dan robots.txt situs sasaran sudah dibaca atau belum
  • Data yang dikumpulkan memuat informasi pribadi atau tidak, dan kalau ya, ditangani bagaimana
  • Data yang terkumpul dipakai di internal saja atau ditampilkan ke luar

Dengan jawaban yang sudah pasti, pihak yang mengerjakan bisa mengunci lingkup jauh lebih rapat, dan situasi data terkumpul tapi tidak terpakai bisa dihindari.

Mari Periksa Sasaran Pengumpulannya Bersama

Menyusun lingkup crawling sambil menimbang batas hukumnya memang membingungkan kalau baru pertama kali. Weple menempatkan perapian lingkup ini sebagai langkah pertama setiap pekerjaan pengumpulan data. Sebutkan situs yang ingin dikumpulkan datanya beserta rencana pemakaiannya, lalu kami jawab dulu sampai di mana pekerjaan tersebut bisa dijalankan.

Kalau situasi Anda mirip

Kirimkan situasi Anda sekarang, kami balas dengan cakupan dan harga dalam 24 jam.