指南
爬完才發現不能用的資料
能不能爬,由使用條款決定
技術上抓得下來的網站很多。真正的問題不是做不做得到,是可不可以做。多數網站的使用條款裡都有一條限制或禁止自動蒐集(爬蟲、抓取),有些網站另外用 robots.txt 標出開放給機器人的路徑。發包之前,先把目標網站的條款和 robots.txt 打開來看,順序是這樣。跳過這一步,很可能資料全部抓完了才發現不能用。
robots.txt 沒有強制力,但會被拿去當證據
robots.txt 不是有法律效力的文件,它是網站營運方對蒐集機器人提出的請求。單看技術,無視它照樣抓得到。麻煩的是後面。發生糾紛的時候,「明知道被擋還是繼續抓」這件事本身,會被拿來判斷有沒有故意。擋起來的路徑盡量避開,真的非抓不可,先正式向對方詢問過再說。
資料裡夾到個資,標準就換了
就算是公開發布的貼文,只要一起帶回了作者姓名、聯絡方式、大頭照這類個人資料,那份資料就落進個資法的管轄。「反正是公開的」這個判斷很危險。蒐集、保存、利用個人資料,各自都要有站得住的法律依據。要抓的東西裡混著個資,那一塊沒辦法不拆開來看就直接帶過。
著作權卡的是再利用
新聞、照片、整篇評論這類有著作權的內容,抓回來的那一步問題還小,原封不動放上自己的服務才會變大。做成摘要並附上出處連結,跟整篇複製過來展示,法律上是兩回事。審視的強度也看目的。只堆在內部做分析的資料,跟要對外露出的資料,不能用同一把尺量。
發包之前先把答案想好
發包爬蟲工作之前,下面三件先有答案,專案會跑得快很多。
- 目標網站的使用條款和 robots.txt 確認過了嗎
- 要抓的資料裡有沒有個人資料,有的話打算怎麼處理
- 抓回來的資料只在內部用,還是會對外露出
答案定下來,接案方也能把範圍劃得準得多,資料全部到手卻用不了的局面也就避開了。
先一起確認要抓的對象
要一邊顧法律邊界一邊劃爬蟲範圍,第一次做確實不知道從哪裡下手。Weple 接資料蒐集的案子,第一個動作就是把這個範圍理出來。告訴我們想抓哪個網站、抓回來要用在哪裡,我們先回答這件事做得到哪一步。
如果你也是這種情況
把現在的情況傳給我們,我們會在 24 小時內回覆範圍與價格。