Weple

指南

全都爬完了,却用不上的数据

能不能爬,用户协议说了算

技术上爬得动的网站很多。真正的问题不是能不能爬,是允不允许爬。多数网站在用户协议里禁止或者限制自动采集,另外用 robots.txt 单独标出哪些路径开放给采集程序。外包之前,先打开目标站的协议和 robots.txt,这才是顺序。跳过这一步,常见的结果是数据全都爬回来了,却一条也用不上。

robots.txt 不是法律,但会被当成证据

robots.txt 不是有强制力的法律文件,是站点运营方对采集程序发出的请求。单看技术,无视它照样采得到。麻烦在后面。真起了纠纷,“明知被挡还继续采”这件事本身,可能被拿去判断主观故意。被挡住的路径尽量绕开;确实非采不可,正式发函向对方问一句,稳当得多。

数据里混进个人信息,尺子就换了

就算是公开发布的帖子,只要姓名、联系方式、头像这类信息跟着一起进来,这份数据就落进《个人信息保护法》的管辖。“反正是公开的”这个判断很危险。收集、存储、使用个人信息需要单独的合法性基础。采集对象里夹着个人信息,这一部分不能不单独审一遍就往下走。

版权卡在再利用,不卡在采集

新闻稿、图片、评论正文这类有版权的内容,风险大头不在取回来那一步,而在原样搬到自己服务上展示那一步。做摘要、附来源链接,和把原文整段复制出来对外呈现,法律上完全是两回事。审的尺度也随用途变。只堆在内部做分析的数据,和要放进对外产品里的数据,不能用同一把尺子量。

外包之前先把答案定下来

发外包的时候,下面三个问题手上已经有答案,推进会快得多。

  • 目标站的用户协议和 robots.txt,确认过了吗
  • 要采的数据里有没有个人信息,有的话打算怎么处理
  • 采回来的数据只在内部用,还是要对外展示

答案定了,接活的一方也能把范围划得清楚得多,也就躲开了“数据采完才发现用不了”。

先一起确认采集对象

要把法律边界也考虑进去再划爬取范围,第一次做确实容易没底。Weple 接数据采集的活,第一道工序就是把这个范围理出来。想采哪个站、采回来打算用在什么地方,告诉我们,能做到哪一步,我们先给答案。

如果你也是这种情况

把现在的情况发给我们,我们在 24 小时内回复范围和价格。