คู่มือ
ข้อมูลที่ crawl มาครบแล้วใช้ไม่ได้
ข้อกำหนดการใช้งานเป็นตัวตัดสินว่า crawl ได้ไหม
เว็บที่ดึงข้อมูลออกมาได้ในทางเทคนิคมีอยู่เยอะ คำถามจริงไม่ใช่ว่าทำได้ไหม แต่คือทำได้หรือเปล่า เว็บไซต์ส่วนใหญ่เขียนข้อกำหนดการใช้งานห้ามหรือจำกัดการเก็บข้อมูลอัตโนมัติ (crawling·scraping) ไว้ และหลายแห่งยังใช้ robots.txt บอกอีกชั้นว่าเส้นทางไหนเปิดให้เก็บได้ ก่อนจ้างงานภายนอก ลำดับที่ถูกคือเปิดข้อกำหนดการใช้งานกับ robots.txt ของเว็บเป้าหมายดูก่อน ข้ามขั้นนี้ไปแล้วมีสิทธิ์เก็บข้อมูลมาครบแต่เอาไปใช้ไม่ได้
robots.txt ไม่ใช่กฎหมาย แต่ถูกหยิบมาใช้เป็นหลักฐาน
robots.txt ไม่ใช่เอกสารทางกฎหมายที่มีผลบังคับ เป็นคำขอที่ผู้ดูแลเว็บส่งถึงบอทเก็บข้อมูล มองเฉพาะเรื่องเทคนิค เมินแล้วดึงข้อมูลต่อก็ยังได้ข้อมูลมา ปัญหาอยู่ที่ทีหลัง ข้อเท็จจริงที่ว่าเมินคำขอนั้นแล้วยังเก็บต่อ อาจถูกหยิบไปใช้ประกอบการพิจารณาเรื่องเจตนาเมื่อเกิดข้อพิพาท เส้นทางที่เขาปิดไว้ควรเลี่ยงให้มากที่สุด ถ้าจำเป็นจริงก็ติดต่อไปที่เว็บนั้นอย่างเป็นทางการไว้ก่อนจะปลอดภัยกว่า
พอมีข้อมูลส่วนบุคคลปนเข้ามา เกณฑ์ก็เปลี่ยน
โพสต์ที่เปิดเผยต่อสาธารณะ ถ้ามีชื่อผู้เขียน ข้อมูลติดต่อ หรือรูปโปรไฟล์ติดมาด้วย ข้อมูลชุดนั้นก็เข้าข่าย PDPA ทันที การคิดว่า “เปิดเผยอยู่แล้วคงไม่เป็นไร” เป็นความคิดที่เสี่ยง การเก็บ จัดเก็บ และนำข้อมูลส่วนบุคคลไปใช้ ต้องมีฐานทางกฎหมายรองรับแยกต่างหาก ถ้าของที่จะเก็บมีข้อมูลส่วนบุคคลปนอยู่ ส่วนนั้นต้องแยกออกมาพิจารณาก่อน ข้ามไปเลยไม่ได้
ลิขสิทธิ์ไปสะดุดตอนใช้ซ้ำ ไม่ใช่ตอนเก็บ
ข่าว รูปภาพ เนื้อหารีวิวฉบับเต็ม คอนเทนต์ที่มีลิขสิทธิ์พวกนี้ ความเสี่ยงบานปลายตอนเอาขึ้นบริการของตัวเองมากกว่าตอนดึงมา การสรุปย่อแล้วใส่ลิงก์อ้างแหล่งที่มา กับการคัดลอกต้นฉบับทั้งชิ้นมาแสดง กฎหมายมองสองอย่างนี้ต่างกันคนละเรื่อง ระดับการตรวจสอบยังขึ้นกับจุดประสงค์ด้วย ข้อมูลที่กองไว้วิเคราะห์ภายในกับข้อมูลที่จะโชว์ออกไปข้างนอก ใช้ไม้บรรทัดอันเดียวกันวัดไม่ได้
เคาะคำตอบไว้ก่อนจ้าง
มีคำตอบของสามข้อนี้อยู่ในมือก่อนจ้างงาน crawling ภายนอก งานจะเดินเร็วขึ้น
- เปิดข้อกำหนดการใช้งานกับ robots.txt ของเว็บเป้าหมายดูแล้วหรือยัง
- ข้อมูลที่จะเก็บมีข้อมูลส่วนบุคคลปนอยู่ไหม ถ้ามีจะจัดการอย่างไร
- ข้อมูลที่เก็บมาจะใช้เฉพาะภายใน หรือจะแสดงออกสู่ภายนอก
คำตอบนิ่งแล้ว ฝ่ายที่รับงานก็กำหนดขอบเขตได้ชัดขึ้นมาก และสถานการณ์ที่เก็บข้อมูลมาครบแล้วเอาไปใช้ไม่ได้ก็เลี่ยงได้
เริ่มจากดูเว็บเป้าหมายไปด้วยกัน
การกำหนดขอบเขตการเก็บข้อมูลไปพร้อมกับชั่งน้ำหนักเรื่องกฎหมาย ทำครั้งแรกย่อมตัน Weple วางการเคลียร์ขอบเขตนี้ไว้เป็นลำดับแรกเมื่อเริ่มงานเก็บข้อมูล บอกมาว่าอยากเก็บจากเว็บไหนและจะเอาข้อมูลไปใช้ทำอะไร เราจะตอบก่อนว่างานนี้เดินได้ถึงไหน
ถ้าคุณอยู่ในสถานการณ์คล้ายกัน
ส่งสถานการณ์ตอนนี้มาให้เรา เราตอบกลับขอบเขตและราคาภายใน 24 ชั่วโมง