近日百度和药监局达成战略合作,百度将使用药监局的的药品数据为人们提供用药相关的查询
百度为这批数据付出的代价并未提及
天下没有免费的午餐,药监局虽然是要造福于民,但是这批数据显然不会白给
这意味着搜索引擎为数据买单的时代已经到来
笔者今天想谈谈关于搜索和数据关系的一些看法
注意,大数据离我们太远,这不是谈大数据
360与即刻此前已达成战略合作,共同运营食品安全和曝光栏栏目外,且360将与即刻共享药监局的数据
再前,360搜索引擎通过云云搜索接入了微博搜索结果,再之前,Google购买Twitter数据以提供Twitter搜索结果
谷歌干的事情是“整合全球信息,使人人皆可访问并从中受益”和“加速信息流动”
百度简单可依赖,干的事情是“让人们最便捷地获取信息,找到所求”
不同的表示,搜索引擎本质却是一致的:帮助人们找到想要的信息
伴随着社会化和移动互联网的浪潮,网络上的数据爆炸式的增长
如何应对这些爆炸的数据,既是搜索引擎面临的挑战,也是搜索引擎们的机遇
具体分析如下:一、比暗网更暗的大数据网聚合所有网络上的信息,一直是有抱负的搜索引擎的梦想,但这是不可能完成的任务
1994年Dr.JillEllsworth便提出”暗网“的概念
指存储在网络数据库里、不能通过超链接访问,不属于那些可以被标准搜索引擎索引的表面网络
暗网的规模也远超我们的想象,据科学家研究,人类信息只有不到1%的实现了WEB化,而WEB化的网页中,搜索引擎能抓取的大概为1%500
不能抓取的既有网站本身非主观的问题(不符合网页规范,对搜素引擎不友好等),也有网站本身的主观屏蔽的问题,如淘宝、优酷等网站屏蔽百度的爬虫既是这类
搜索引擎在解决这两类问题上已经做过很多努力
包括爬虫爬取技术的优化、合法SEO的推动以及类似百度阿拉丁计划
百度的阿拉丁计划通过提供接口的方式,第三方网站主动接入自己的结构化数据,用户在搜索时