佛山E网工作室
www.gdasp.com
专业网站建设和推广 信心保证
热线电话:0757-6331 5297,158 1783 3537
琛屼笟璧勮 - 浣涘北E缃

琛屼笟璧勮

浜嗚В鏈鏂扮殑琛屼笟璧勮鍜岀綉缁滆惀閿鐭ヨ瘑

鏂伴椈鍒楄〃

绗 1 椤碉紝鍏 46 椤

鍒嗙被 鏍囬 鍙戝竷鏃ユ湡
SEO浼樺寲 骞翠腑浼樻儬锛屾満涓嶅彲澶憋細鏍囧噯鍨嬪椁(浜у搧灞曠ず鍨) 1800鍏冿紝0鍏冨欢闀夸竴骞寸綉绔 2012-12-28
缃戠珯寤鸿 鎵嬫満缃戦〉璁捐鎸囧崡 2012-12-28
缃戠粶鎺ㄥ箍 浣涘北姘哥綉锛圗缃戝伐浣滃锛2013骞存槬鑺備紤鍋囬氱煡 2012-12-28
鍩熷悕绌洪棿 鐧惧害鏀舵定4.83% 鑲′环鍐嶄笂100缇庡厓 杩戞湡娉㈠姩杈冨ぇ 2012-12-28
寤虹珯妗堜緥 Facebook闄峰叆鎶勮椋庢尝 绀句氦娓告垙鎴愭妱琚噸鐏惧尯 2012-12-28
SEO浼樺寲 浜笢鍟嗗煄闄峰叆璋冩暣婕╂丁 CMO钃濈儴鎺ョ寮鏀惧钩鍙 2012-12-28
缃戠珯寤鸿 鍞搧浼氬懆鍥涜穼5.32% 鎶ユ敹16.9缇庡厓 2012-12-28
缃戠粶鎺ㄥ箍 缇庡浗鐢靛晢娑堣垂鑰呮弧鎰忓害璋冩煡缁撴灉鍑虹倝锛氫簹椹婄涓 2012-12-28
鍩熷悕绌洪棿 骞村簳鐢靛晢涔辫薄锛氶樋閲2015骞翠笂甯 浜笢闄风鑱屾疆 2012-12-28
寤虹珯妗堜緥 浼犫滃紑蹇冨啘鍦衡濆紑鍙戝洟闃熲滀簲鍒嗛挓鈥濇槑骞1鏈堝叧闂 2012-12-28
SEO浼樺寲 鏉ㄥ厓搴嗗噺鎸2900涓囪仈鎯抽泦鍥㈣偂浠 濂楃幇2浜挎腐甯 2012-12-28
缃戠珯寤鸿 寮犺繎涓滃洖搴旇嫃瀹佹棤鐢靛晢鍩哄洜锛氫笉鏄細鍙戝嚑鏉″井鍗氬氨鏈 2012-12-28
缃戠粶鎺ㄥ箍 鏂版氮璋冩暣鏋舵瀯鍒掑垎闂ㄦ埛鍙婂井鍗氫袱澶т笟鍔 鏉滅孩璐熻矗闂ㄦ埛 2013-02-06
鍩熷悕绌洪棿 鏇瑰浗浼熼偖浠舵洕鍏夋柊娴2013骞存牳蹇冩垬鐣ワ細绉诲姩涓哄厛 2013-06-20
寤虹珯妗堜緥 浜哄ぇ甯稿浼氫粖鏃ヨ〃鍐冲姞寮虹綉缁滀俊鎭繚鎶ょ殑鍐冲畾 2013-07-16
SEO浼樺寲 鍒嗘瀽绉版柊娴井鍗氭垨灏嗚笍涓婂皝闂箣璺 2012-07-25
缃戠珯寤鸿 浼犻樋閲屽反宸存垬鐣ユ姇璧勬柊娴井鍗 鍗犺偂15%-20% 2012-07-25
缃戠粶鎺ㄥ箍 鐧惧害甯傚奸娆¤秴瓒婅吘璁 浠呮浜庤胺姝屼簹椹 2012-07-25
鍩熷悕绌洪棿 CNNIC锛氫腑鍥界綉姘戣妯¤揪4.85浜 绋冲眳涓栫晫绗竴 2012-10-21
寤虹珯妗堜緥 璋锋瓕鍦板浘鍗囩骇鏂板2500涓囧骇寤虹瓚鐗 瀹樻柟绉版洿缁嗚嚧 2012-10-21
SEO浼樺寲 璋锋瓕涓嶄細鍚戠敤鎴烽忛湶鐨10浠朵簨 2012-10-21
缃戠珯寤鸿 璋锋瓕椋庢姇绗笁瀛e害瀹屾垚21椤规姇璧 2012-10-21
缃戠粶鎺ㄥ箍 澶╃尗鑱斿悎48瀹剁數鍟嗚繋鎴樷11.11鈥 澶囪揣20浜 2012-10-21
鍩熷悕绌洪棿 涓氱晫鍛煎悂瑙嗛缃戠珯鎺掕缁熶竴鏍囧噯 2012-10-21
寤虹珯妗堜緥 缃戠粶鍏徃鍦ㄥ姙鍏湴鐐瑰吇缇 鐢ㄧ儰鍏ㄧ緤瀹磋瀹㈡埛 2012-10-21
SEO浼樺寲 涓叴閫氳20浜垮厓宸ㄤ簭 缇庡浗瀹夊叏璋冩煡缁撴潫鎬濈鍚堜綔 2012-10-21
缃戠珯寤鸿 鐧惧害鎴愮珛LBS浜嬩笟閮 鎷ユ湁鍦板浘灏辨嫢鏈夌敤鎴 2012-10-21
缃戠粶鎺ㄥ箍 鏈濋矞涓囧悕绉戞妧浜烘墠鍏ュ崕锛氭湀宸ヨ祫1500鍏 60%涓婄即缁勭粐 2012-10-21
鍩熷悕绌洪棿 Twitter闃愯堪鏈潵鍙戝睍鏂瑰悜锛氬寮烘湇鍔″疄鐢ㄦ 2012-12-28
寤虹珯妗堜緥 璋锋瓕6鏈堣潐鑱斿叏缇庤闂噺绗竴瀹濆骇 2012-12-28
      最新资讯
年中优惠,机不可失:标
手机网页设计指南
佛山永网(E网工作室)
百度收涨4.83% 股
Facebook陷入抄
京东商城陷入调整漩涡
唯品会周四跌5.32%
美国电商消费者满意度调
年底电商乱象:阿里20
传“开心农场”开发团队
杨元庆减持2900万联
张近东回应苏宁无电商基
新浪调整架构划分门户及
曹国伟邮件曝光新浪20
人大常委会今日表决加强
分析称新浪微博或将踏上
传阿里巴巴战略投资新浪
百度市值首次超越腾讯
CNNIC:中国网民规
谷歌地图升级新增250
         行业资讯 >> 搜索引擎算法之复制网页
搜索引擎算法之复制网页
发布人:管理员  发布时间:2007年6月12日  浏览 4580 次
分享 |


  
    搜索引擎复制网页的算法

    春节这几天,看了一些搜索引擎基本原理的书,下面把了解到关于复制网页的算法写下来。

    关键词:搜索引擎,复制网页,算法,信息指纹,Fingerprint,关键词

    搜索引擎判断复制网页一般都基于这么一个思想:为每个网页计算出一组信息指纹(Fingerprint),若两个网页有一定数量相同的信息指纹,则认为这两个网页的内容重叠性很高,也就是说两个网页是内容复制的。

    很多搜索引擎判断内容复制的方法都不太一样,主要是以下两点的不同:

1、计算信息指纹(Fingerprint)的算法;
2、判断信息指纹的相似程度的参数。

    在描述具体的算法前,先说清楚两点:
1、什么是信息指纹?信息指纹就是把网页里面正文信息,提取一定的信息,可以是关键字、词、句子或者段落及其在网页里面的权重等,对它进行加密,如MD5加密,从而形成的一个字符串。信息指纹如同人的指纹,只要内容不相同,信息指纹就不一样。
2、算法提取的信息不是针对整张网页,而是把网站里面共同的部分如导航条、logo、版权等信息(这些称之为网页的“噪音”)过滤掉后剩下的文本。

    分段签名算法

    这种算法是按照一定的规则把网页切成N段,对每一段进行签名,形成每一段的信息指纹。如果这N个信息指纹里面有M个相同时(m是系统定义的阙值),则认为两者是复制网页。

    这种算法对于小规模的判断复制网页是很好的一种算法,但是对于像google这样海量的搜索引擎来说,算法的复杂度相当高。

    基于关键词的复制网页算法

    像google这类搜索引擎,他在抓取网页的时候都会记下以下网页信息:

1、网页中出现的关键词(中文分词技术)以及每个关键词的权重(关键词密度);
2、提取meta descrīption或者每个网页的512个字节的有效文字。
    关于第2点,baidu和google有所不同,google是提取你的meta descrīption,如果没有查询关键字相关的512个字节,而百度是直接提取后者。这一点大家使用过的都有所体会。

    在以下算法描述中,我们约定几个信息指纹变量:

    Pi表示第i个网页;
    该网页权重最高的N个关键词构成集合Ti={t1,t2,...tn},其对应的权重为Wi={w1,w2,...wi}
    摘要信息用Des(Pi)表示,前n个关键词拼成的字符串用Con(Ti)表示,对这n个关键词排序后形成的字符串用Sort(Ti)表示。

    以上信息指纹都用MD5函数进行加密。

    基于关键词的复制网页算法有以下5种:
1、MD5(Des(Pi))=MD5(Des(Pj)),就是说摘要信息完全一样,i和j两个网页就认为是复制网页;
2、MD5(Con(Ti))=MD5(Con(Tj)),两个网页前n个关键词及其权重的排序一样,就认为是复制网页;
3、MD5(Sort(Ti))=MD5(Sort(Tj)),两个网页前n个关键词一样,权重可以不一样,也认为是复制网页。
4、MD5(Con(Ti))=MD5(Con(Tj))并且Wi-Wj的平方除以Wi和Wj的平方之和小于某个阙值a,则认为两者是复仆场?BR>5、MD5(Sort(Ti))=MD5(Sort(Tj))并且Wi-Wj的平方除以Wi和Wj的平方之和小于某个阙值a,则认为两者是复制网页。

    关于第4和第5的那个阙值a,主要是因为前一个判断条件下,还是会有很多网页被误伤,搜索引擎开发根据权重的分布比例进行调节,防止误伤。

    这个是北大天网搜索引擎的去重算法(可以参考:《搜索引擎--原理、技术与系统》一书),以上5种算法运行的时候,算法的效果取决于N,就是关键词数目的选取。当然啦,选的数量越多,判断就会越精确,但是谁知而来的计算速度也会减慢下来。所以必须考虑一个计算速度和去重准确率的平衡。据天网试验结果,10个左右关键词最恰当。

后记
    以上肯定无法覆盖一个大型搜索引擎复制网页的所有方面,他们必定还有一些辅助的信息指纹判断,本文作为一个思路,给做搜索引擎优化的一个思路。

PS:从点石上转载来的,不知道是不是原创,访问发帖人的网站显示关闭中,故不确定原作者,有知道的评论里留一下,我把相关信息加上。
 
 




    (本站大部分文章来自网络收集和整理,如有侵权请联系我们,24小时内处理.)



佛山市红盾信息网
网络110报警