百度是怎樣判斷原創(chuàng)文章的

信息量巨大的網絡現(xiàn)狀,讓我們從信息匱乏變到信息多到無所適從,一天之中有這么多的信息不斷出現(xiàn),不斷重復的刷著我們的各種屏幕,這些信息究竟有沒有價值,值不值得我們去看。作為編輯,更是希望看到有價值的原創(chuàng),百度也一樣,百度是怎樣判斷原創(chuàng)文章的呢?
一、搜索引擎為什么要重視原創(chuàng)
1.1采集泛濫化
來自百度的一項調查顯示,超過80%的新聞和資訊等都在被人工轉載或機器采集,從傳統(tǒng)媒體的報紙到娛樂網站花邊消息、從游戲攻略到產品評測,甚至高校圖書館發(fā)的催還通知都有站點在做機器采集??梢哉f,優(yōu)質原創(chuàng)內容是被包圍在采集的汪洋大海中之一粟,搜索引擎在海中淘粟,是既艱難又具有挑戰(zhàn)性的事情。
1.2提高搜索用戶體驗
數字化降低了傳播成本,工具化降低了采集成本,機器采集行為混淆內容來源降低內容質量。采集過程中,出于無意或有意,導致采集網頁內容殘缺不全,格式錯亂或附加垃圾等問題層出不窮,這已經嚴重影響了搜索結果的質量和用戶體驗。搜索引擎重視原創(chuàng)的根本原因是為了提高用戶體驗,這里講的原創(chuàng)為優(yōu)質原創(chuàng)內容。
1.3鼓勵原創(chuàng)作者和文章
轉載和采集,分流了優(yōu)質原創(chuàng)站點的流量,不再具屬原創(chuàng)作者的名稱,會直接影響到優(yōu)質原創(chuàng)站長和作者的收益。長期看會影響原創(chuàng)者的積極性,不利于創(chuàng)新,不利于新的優(yōu)質內容產生。鼓勵優(yōu)質原創(chuàng),鼓勵創(chuàng)新,給予原創(chuàng)站點和作者合理的流量,從而促進互聯(lián)網內容的繁榮,理應是搜索引擎的一個重要任務。
二、采集很狡詐,識別原創(chuàng)很艱難
2.1采集冒充原創(chuàng),篡改關鍵信息
當前,大量的網站批量采集原創(chuàng)內容后,用人工或機器的方法,篡改作者、發(fā)布時間和來源等關鍵信息,冒充原創(chuàng)。此類冒充原創(chuàng)是需要搜索引擎識別出來予以適當調整的。
2.2內容生成器,制造偽原創(chuàng)
利用自動文章生成器等工具,“獨創(chuàng)”一篇文章,然后安一個吸引眼球的title,現(xiàn)在的成本也低得很,而且一定具有獨創(chuàng)性。然而,原創(chuàng)是要具有社會共識價值的,而不是胡亂制造一篇根本不通的垃圾就能算做有價值的優(yōu)質原創(chuàng)內容。內容雖然獨特,但是不具社會共識價值,此類偽原創(chuàng)是搜索引擎需要重點識別出來并予以打擊的。
2.3網頁差異化,結構化信息提取困難
不同的站點結構化差異比較大,html標簽的含義和分布也不同,因此提取關鍵信息如標題、作者和時間的難易程度差別也比較大。做到既提得全,又提得準,還要最及時,在當前的中文互聯(lián)網規(guī)模下實屬不易,這部分將需要搜索引擎與站長配合好才會更順暢的運行,站長們如果用更清晰的結構告知搜索引擎網頁的布局,將使搜索引擎高效地提取原創(chuàng)相關的信息。
三、百度識別原創(chuàng)之路如何走?
3.1成立原創(chuàng)項目組,打持久戰(zhàn)
面對挑戰(zhàn),為了提高搜索引擎用戶體驗、為了使優(yōu)質原創(chuàng)者原創(chuàng)網站得到應有的收益、為了推動中文互聯(lián)網的前進,我們抽調大量人員組成原創(chuàng)項目組:技術、產品、運營、法務等等,這不是臨時組織不是1個月2個月的項目,我們做好了打持久戰(zhàn)的準備。
3.2原創(chuàng)識別“起源”算法
互聯(lián)網動輒上百億、上千億的網頁,從中挖掘原創(chuàng)內容,可以說是大海撈針,千頭萬緒。我們的原創(chuàng)識別系統(tǒng),在百度大數據的云計算平臺上開展,能夠快速實現(xiàn)對全部中文互聯(lián)網網頁的重復聚合和鏈接指向關系分析。
首先,通過內容相似程度來聚合采集和原創(chuàng),將相似網頁聚合在一起作為原創(chuàng)識別的候選集合;
其次,對原創(chuàng)候選集合,通過作者、發(fā)布時間、鏈接指向、用戶評論、作者和站點的歷史原創(chuàng)情況、轉發(fā)軌跡等上百種因素來識別判斷出原創(chuàng)網頁;
最后,通過價值分析系統(tǒng)判斷該原創(chuàng)內容的價值高低進而適當的指導最終排序。
目前,通過我們的實驗以及真實線上數據,“起源”算法已經取得了一定的進展,在新聞、資訊等領域解決了絕大部分問題。當然,其他領域還有更多的原創(chuàng)問題等待“起源”去解決,我們堅定的走著。
3.3原創(chuàng)星火計劃
我們一直致力于原創(chuàng)內容的識別和排序算法調整,但在當前互聯(lián)網環(huán)境下,快速識別原創(chuàng)解決原創(chuàng)問題確實面臨著很大的挑戰(zhàn),計算數據規(guī)模龐大,面對的采集方式層出不窮,不同站點的建站方式和模版差異巨大,內容提取復雜等等問題。這些因素都會影響原創(chuàng)算法識別,甚至導致判斷出錯。這時候就需要百度和站長共同努力來維護互聯(lián)網的生態(tài)環(huán)境,站長推薦原創(chuàng)內容,搜索引擎通過一定的判斷后優(yōu)待原創(chuàng)內容,共同推進生態(tài)的改善,鼓勵原創(chuàng),這就是“原創(chuàng)星火計劃”,旨在快速解決當前面臨的嚴重問題。另外,站長對原創(chuàng)內容的推薦,將應用于“起源”算法,進而幫助百度發(fā)現(xiàn)算法的不足,不斷改進,用更加智能的識別算法自動識別原創(chuàng)內容。
目前,原創(chuàng)星火計劃也取得了初步的效果,一期對部分重點原創(chuàng)新聞站點的原創(chuàng)內容在百度搜索結果中給予了原創(chuàng)標記、作者展示等等,并且在排序及流量上也取得了合理的提升。
最后,原創(chuàng)是生態(tài)問題,需要長期的改善,我們將持續(xù)投入,與站長攜手推動互聯(lián)網生態(tài)的進步;原創(chuàng)是環(huán)境問題,需要大家來共同維護,站長們多做原創(chuàng),多推薦原創(chuàng),百度將持續(xù)努力改進排序算法,鼓勵原創(chuàng)內容,為原創(chuàng)作者、原創(chuàng)站點提供合理的排序和流量。
相關文章
- 相信很多站長都遇到過這樣的問題,自己網站中明明都是自己原創(chuàng)的內容,卻不被收錄,而發(fā)到其他論壇或者被別人轉載之后卻被快速收錄。這是什么原因?下面小編為大家?guī)戆俣?/div> 2016-11-30
如何更有效的去進行原創(chuàng)?編輯網站資訊方法及技巧
原創(chuàng)文章增加網站文章收錄,.在收錄后可以給網站帶來排名,有了排名可以帶來流量。那么如何更有效的去進行原創(chuàng)?下面小編就為大家分享編輯網站資訊方法及技巧,來看看吧2016-09-20搜索引擎一定喜歡原創(chuàng)嗎?站長做SEO原創(chuàng)的正確方法和流程
原創(chuàng)一直是站長們討論熱門的話題,但卻有很多站長因為原創(chuàng)而費盡心思,整天撰寫原創(chuàng),或者尋找原創(chuàng),搜索引擎一定喜歡原創(chuàng)嗎?如何進行SEO原創(chuàng)?本文將提供站長做SEO原創(chuàng)的2016-09-12SEO優(yōu)化過程中原創(chuàng)有效文章有多么重要?
一篇文章原創(chuàng)的,但是沒有用,沒有人閱讀,那么這篇文章還是屬于無效。SEO優(yōu)化過程中最不能忽視的就文章,原創(chuàng)有效文章到底有多么重要?它在網站關鍵詞排名當中又能夠產生哪2016-08-17為了排名網站采取大量原創(chuàng)內容是否是最佳的優(yōu)化路徑?
為了排名網站采取大量原創(chuàng)內容是否是最佳的優(yōu)化路徑?現(xiàn)在百度很支持原創(chuàng),有些網站為了更好的排名,都大批量的發(fā)原創(chuàng),這是否是最佳的優(yōu)化路徑?下面我們就來看看詳細的內2016-08-04原創(chuàng)文章的網站不但排名不好而且被降權了該怎么辦?
原創(chuàng)文章的網站不但排名不好而且被降權了該怎么辦?很多人認為原創(chuàng)性網站排名會很好,但是運營的時候發(fā)現(xiàn),原創(chuàng)網站排名非但不好,而且總是被降權,這是怎么回事?下面我們2016-08-03原創(chuàng)的文章并非就是好的文章:什么樣的原創(chuàng)文章是垃圾文章?
對于seo而來說,想要做好網站排名,原創(chuàng)內容必不可少,采集的文章百度連收錄都沒有,所以逼著我們要原創(chuàng),沒收錄談不了網站排名。有原創(chuàng)呢?為什么也不收錄,憑什么也評為2016-07-25怎么才能寫出吸引別人點擊的原創(chuàng)文章?現(xiàn)在百度不會因為大站就讓文章排名考前,而是更關注原創(chuàng)類的文章,今天我們就來看看該怎么寫出讓用戶想要去點擊的原創(chuàng)文章,需要的朋2016-07-17如何寫一篇高質量的原創(chuàng)文章?高質量的原創(chuàng)文章的寫作技巧匯總
如何才能出一篇高質量的原創(chuàng)文章?高質量的原創(chuàng)文章需要注意什么?本文將提供高質量的原創(chuàng)文章的寫作技巧匯總供大家了解,希望對大家有所幫助和啟發(fā)2016-06-12對于seo來說,原創(chuàng)文章是網站優(yōu)化的一個非常重要的環(huán)節(jié),也是很多seo方面的新人都必須經歷的環(huán)節(jié),下面筆者就來談一下關于原創(chuàng)文章內容的SEO經驗總結2016-05-18最新評論