小红书为什么不把他们公司数据API接口卖给舆情监测软件厂商?
据小编统计,国内各大舆情监测软件厂商每天通过爬虫或者插件等方式爬小红书的数据消耗的成本要超过1个亿,而且爬到的数据总量不到小红书的数据总量的60%,而小红书每年为了做发爬虫技术,防止各大舆情监测软件厂商轻松爬到自己网站的数据,也是消耗了大量的财力物力,而且他们又没有足够的证据去起诉那些舆情监测软件厂商,而且小红书做反爬,提升了用户访问小红书网站的难度,给用户带来了极大的不便,这也是一笔非常不小的损失,那么小红书为什么这样做?为什么不直接把API接口数据高价卖给各大舆情监测软件厂商呢?那么小编来给大家分析一下:主要分为法律合规风险、用户版权隐私、商业利益、技术管控、业务定位五大原因:
一、法律与监管风险(最核心)
- 用户著作权问题:小红书笔记、评论的著作权属于发布用户。平台只拿到平台内展示、分发的授权,没有权利批量转售、对外批发给第三方舆情公司做商业检索分析南方+。
如果把海量笔记、评论通过 API 卖给舆情厂商,属于把用户创作内容二次商用,会直接侵犯用户著作权。
- 个人信息保护法风险:笔记、评论里混杂大量用户昵称、头像、个人表达、评论内容。即便做脱敏,批量对外输出海量 UGC 内容,很容易触碰个人信息保护的红线,平台要承担主体责任小红书。
- 监管导向,不鼓励平台 “数据售卖”
《网络数据安全管理条例》要求平台严格管控对外输出用户生成内容,不鼓励平台把平台 UGC 当成商品对外售卖;一旦对外售卖全量舆情接口,一旦舆情厂商拿数据做网暴、扒个人信息、恶意集纳负面,小红书要承担连带责任中国政府网。
案例:小红书曾起诉蝉小红(蝉妈妈),对方通过爬虫大规模抓取笔记、评论商业化售卖,法院判决高额赔偿,爬虫批量获取 UGC 做舆情服务本身就存在法律争议。
二、开放平台的业务定位:只服务站内,不做 “数据中间商”
小红书开放平台 API 的设计初衷,服务小红书入驻商家、自研 ERP,解决店铺经营(订单、商品、自家账号笔记管理),天生就不是对外输出全网公开内容给外部舆情行业小红书。
- ✅允许:商家拿 API 读取自己店铺、自己账号下的笔记、评论;
- ❌禁止:第三方舆情厂商通过 API 输入任意关键词,批量抓取全网全部用户笔记、评论做品牌全网监听。
也就是说:你可以拿 API 看你自己的小红书账号下面的内容,但不能拿 API 搜全网所有别人发的笔记做舆情监控。
三、商业层面的顾虑
- 数据定价与权责很难划分
如果把舆情 API 卖给舆情厂商:卖多少钱?调用量怎么限制?如果厂商滥用数据(扒竞品、恶意收集用户言论、生成黑料库),出了事,法律责任首先追责小红书,收钱的同时背巨大风险,商业收益抵不过风险成本。 - 和自有商业产品冲突
小红书内部有面向大客户的品牌后台、商业洞察工具,品牌方可以在小红书官方后台,看自己品牌在小红书站内的声量、笔记、评论。
如果对外廉价把全量 API 卖给外部舆情厂商,等于变相分流自己的商业付费业务。 - 市场生态现实:就算官方不卖,很多厂商会用爬虫
就算官方开放付费 API,大量中小舆情厂商依旧会选择低成本爬虫,不会付费采购官方接口;平台投入巨大人力维护一套对外舆情 API,商业回报很低。
四、技术层面的巨大压力
舆情监测的特点:关键词全量检索、高频实时扫描、海量评论拉取。
- 如果开放给几十家舆情厂商,会产生巨量 API 调用,给小红书搜索、数据库、服务器带来极大压力;
- 舆情厂商会疯狂调用接口实时抓新增笔记,会挤占普通用户正常访问的系统资源。
五、现实行业现状(很多舆情系统的小红书数据从哪来)
- 合规路径:企业自己在小红书品牌后台,手动导出自己品牌相关内容,给到舆情系统做加工;
- 灰色路径:大量舆情厂商靠爬虫抓取小红书公开笔记评论(有法律风险,平台持续打击);
- 极少数深度大客户:和小红书做定制化商业合作,不是售卖标准化 API,是平台内部定向输出脱敏统计结果,不输出原始笔记、原始评论文本。