使用aggregate在MongoDB中查詢重復(fù)數(shù)據(jù)記錄的方法
MongoDB中聚合(aggregate)主要用于處理數(shù)據(jù)(諸如統(tǒng)計(jì)平均值,求和等),并返回計(jì)算后的數(shù)據(jù)結(jié)果。有點(diǎn)類似sql語句中的 count(*)。
aggregate() 方法
MongoDB中聚合的方法使用aggregate()。
語法
aggregate() 方法的基本語法格式如下所示:
>db.COLLECTION_NAME.aggregate(AGGREGATE_OPERATION)
我們知道,MongoDB屬于文檔型數(shù)據(jù)庫,其存儲的文檔類型都是JSON對象。正是由于這一特性,我們在Node.js中會經(jīng)常使用MongoDB進(jìn)行數(shù)據(jù)的存取。但由于Node.js是異步執(zhí)行的,這就導(dǎo)致我們無法保證每一次的數(shù)據(jù)庫save操作都是原子型的。也就是說,如果客戶端連續(xù)兩次發(fā)起同一事件將數(shù)據(jù)存入數(shù)據(jù)庫,很可能會導(dǎo)致數(shù)據(jù)被重復(fù)保存。高并發(fā)的情況下,哪怕是你在代碼中已經(jīng)做了非常嚴(yán)格的校驗(yàn),例如插入數(shù)據(jù)前判斷要保存的數(shù)據(jù)是否已經(jīng)存在,但仍然有可能會出現(xiàn)數(shù)據(jù)被重復(fù)保存的風(fēng)險(xiǎn)。因?yàn)樵诋惒綀?zhí)行中,你沒有辦法保證哪個(gè)線程先執(zhí)行,哪個(gè)線程后執(zhí)行,客戶端發(fā)起的所有請求并非按我們想象的都是順序執(zhí)行的。一個(gè)較好的解決辦法是在Mongo數(shù)據(jù)庫的所有表中創(chuàng)建唯一索引。事實(shí)上,MongoDB默認(rèn)會為所有表創(chuàng)建一個(gè)_id字段的唯一索引(可以取消)。如果你想在Node.js中通過mongoose.schema來自動(dòng)創(chuàng)建索引,可以參考下面的代碼:
var mongoose = require('mongoose'); var Schema = mongoose.Schema; var customerSchema = new mongoose.Schema({ cname: String, cellPhone, String, sender: String, tag: String, behaviour: Number, createTime: { type: Date, default: Date.now }, current:{ type: Boolean, default: true } }, { versionKey: false }); customerSchema.index({cname:1,cellPhone:1,sender:1,tag:1,behaviour:1}, {unique: true});module.exports = mongoose.model('customer', customerSchema);
上面的model中我們定義了表customer的結(jié)構(gòu),并通過index()方法在字段cname,cellPhone,sender,tag,behaviour上創(chuàng)建了唯一索引,這樣當(dāng)包含這些字段的重復(fù)數(shù)據(jù)被插入時(shí),數(shù)據(jù)庫會拋出異常。借用mongoose,如果數(shù)據(jù)庫表之前已經(jīng)被創(chuàng)建并且程序正在運(yùn)行中,當(dāng)我們修改model并添加索引,然后重新啟動(dòng)app,只要有對該model的訪問,mongoose會自動(dòng)進(jìn)行檢測并創(chuàng)建索引。當(dāng)然,如果數(shù)據(jù)出現(xiàn)重復(fù),則索引創(chuàng)建會失敗。此時(shí)我們可以通過在創(chuàng)建索引時(shí)添加dropDups選項(xiàng),讓數(shù)據(jù)庫自動(dòng)將重復(fù)的數(shù)據(jù)刪除,如:
customerSchema.index({cname:1,cellPhone:1,sender:1,tag:1,behaviour:1}, {unique: true, dropDups: true});
不過據(jù)MongoDB的官方說明,自3.0以后的版本不再使用該選項(xiàng),而且也并沒有提供替代的解決辦法。貌似官方不再提供創(chuàng)建索引時(shí)自動(dòng)刪除重復(fù)記錄的功能。那如何才能快速有效地找出重復(fù)的記錄并且刪除呢?首先我們要找出這些記錄,然后通過remove()方法進(jìn)行刪除。下面的查詢語句可以找出給定字段有重復(fù)數(shù)據(jù)的記錄:
db.collection.aggregate([ { $group: { _id: { firstField: "$firstField", secondField: "$secondField" }, uniqueIds: { $addToSet: "$_id" }, count: { $sum: 1 } }}, { $match: { count: { $gt: 1 } }} ])
替換_id屬性的值以指定你想要進(jìn)行判斷的字段。相應(yīng)地,在Node.js中代碼如下:
var deferred = Q.defer(); var group = { firstField: "$firstField", secondField: "$secondField"}; model.aggregate().group({ _id: group, uniqueIds: {$addToSet: '$_id'}, count: {$sum: 1} }).match({ count: {$gt: 1}}).exec(deferred.makeNodeResolver()); return deferred.promise;
上述代碼使用了Q來替換函數(shù)執(zhí)行中的回調(diào)。在Node.js的異步編程中,使用Q來處理回調(diào)是個(gè)不錯(cuò)的選擇。
下面是返回的結(jié)果:
/* 1 */ { "result" : [ { "_id" : { "cellPhone" : "15827577345", "actId" : ObjectId("5694565fa50fea7705f01789") }, "uniqueIds" : [ ObjectId("569b5d03b3d206f709f97685"), ObjectId("569b5d01b3d206f709f97684") ], "count" : 2.0000000000000000 }, { "_id" : { "cellPhone" : "18171282716", "actId" : ObjectId("566b0d8dc02f61ae18e68e48") }, "uniqueIds" : [ ObjectId("566d16e6cf86d12d1abcee8b"), ObjectId("566d16e6cf86d12d1abcee8a") ], "count" : 2.0000000000000000 } ], "ok" : 1.0000000000000000 }
從結(jié)果中可以看到,一共有兩組數(shù)據(jù)相同的記錄,所以返回的result數(shù)組的長度為2。uniqueIds屬性為一個(gè)數(shù)組,其中存放了重復(fù)記錄的_id字段的值,通過該值我們可以使用remove()方法來查找并刪除對應(yīng)的數(shù)據(jù)。
相關(guān)文章
MongoDB客戶端工具NoSQL?Manager?for?MongoDB介紹
這篇文章介紹了MongoDB客戶端工具NoSQL?Manager?for?MongoDB,對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2022-06-06SpringBoot系列之MongoDB?Aggregations用法詳解
MongoDB?中使用聚合(Aggregations)來分析數(shù)據(jù)并從中獲取有意義的信息,本文重點(diǎn)給大家介紹SpringBoot系列之MongoDB?Aggregations用法,感興趣的朋友跟隨小編一起看看吧2022-02-02在mac系統(tǒng)下安裝與配置mongoDB數(shù)據(jù)庫
這篇文章主要介紹了在mac系統(tǒng)下安裝與配置mongoDB數(shù)據(jù)庫的操作步驟,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2021-09-09MongoDB aggregate 運(yùn)用篇個(gè)人總結(jié)
最近一直在用mongodb,有時(shí)候會需要用到統(tǒng)計(jì),在網(wǎng)上查了一些資料,最適合用的就是用aggregate,以下介紹一下自己運(yùn)用的心得2016-11-11詳解Mongodb?多文檔聚合操作處理方法(Map-reduce?函數(shù))
這篇文章主要介紹了Mongodb多文檔聚合操作處理方法(Map-reduce函數(shù)),本文通過示例代碼給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2023-07-07mongodb增量備份腳本的實(shí)現(xiàn)和原理詳解
MongoDB本身不支持增量備份,所以這里介紹我找到的方法,下面這篇文章主要給大家介紹了關(guān)于mongodb增量備份腳本的實(shí)現(xiàn)和原理的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),需要的朋友可以參考下2018-09-09mongodb中按天進(jìn)行聚合查詢的實(shí)例教程
這篇文章主要給大家介紹了關(guān)于mongodb中按天進(jìn)行聚合查詢的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對大家學(xué)習(xí)或者使用mongodb具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面來一起學(xué)習(xí)學(xué)習(xí)吧2019-07-07Ubuntu系統(tǒng)中安裝MongoDB及其啟動(dòng)命令mongod的教程
這篇文章主要介紹了Ubuntu系統(tǒng)中安裝MongoDB及其啟動(dòng)命令mongod的教程,包括設(shè)置MongoDB開機(jī)啟動(dòng)的腳本示例,非常推薦,需要的朋友可以參考下2016-01-01