快捷導(dǎo)航

python實(shí)現(xiàn)兩個(gè)文件夾的同步

更新時(shí)間：2019年08月29日 10:44:57 作者：Geek_Arking

這篇文章主要為大家詳細(xì)介紹了利用python實(shí)現(xiàn)兩個(gè)文件夾的同步，具有一定的參考價(jià)值，感興趣的小伙伴們可以參考一下

其實(shí)無(wú)論windows還是Linux，簡(jiǎn)單地去實(shí)現(xiàn)兩個(gè)兩個(gè)文件夾的同步只需系統(tǒng)自帶的復(fù)制命令加參數(shù)就可以了。

WINDOWS：

xcopy 源文件夾\* 目標(biāo)文件夾 /s /e /y

Linux：

cp -r 源文件夾/* 目標(biāo)文件夾

這里使用python來(lái)實(shí)現(xiàn)這些基本功能，并增加一些去重之類的增強(qiáng)功能。

1、復(fù)制源文件夾中文件至目標(biāo)文件夾

要想同步兩個(gè)文件夾中的數(shù)據(jù)，基本思路首先需要遍歷源文件夾中的信息，將源文件夾中的文件復(fù)制到目標(biāo)文件夾。

遍歷文件夾采用os中的listdir函數(shù)就可以了。

import os
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
 
for filename in os.listdir(path_s):
 filename_s = path_s+os.sep+filename
 print '[*] Source :',filename_s
 filename_t = path_t+os.sep+filename
 print '[*] Target :',filename_t
 with open(filename_s,'rb') as f_s:
 with open(filename_t,'wb') as f_t:
  f_t.write(f_s.read())

但是很明顯這里沒(méi)有考慮源文件夾中還會(huì)存在文件夾甚至多重文件夾的情況。

2、源文件夾中存在多重文件夾

一個(gè)簡(jiǎn)單的思路就是：在遍歷源文件夾內(nèi)的文件時(shí)，先判定當(dāng)前文件這是文件還是文件夾。如果當(dāng)前文件是文件夾的話，開(kāi)始遍歷此文件夾內(nèi)的文件，如果里面還有文件夾，遍歷這個(gè)文件夾，依次類推。利用遞歸的方法，代碼如下：

import os
 
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
 
def copy_file(paths,patht):
 for filename in os.listdir(paths):
 filename_s = paths+os.sep+filename
 filename_t = patht+os.sep+filename
 if os.path.isdir(filename_s):
  if not os.path.exists(filename_t):
  os.mkdir(filename_t) #在目標(biāo)文件夾中創(chuàng)建對(duì)應(yīng)的文件夾
  copy_file(filename_s,filename_t) # 遞歸
 else:
  print '[*] Source :',filename_s
 
  print '[*] Target :',filename_t
  with open(filename_s,'rb') as f_s:
  with open(filename_t,'wb') as f_t:
   f_t.write(f_s.read())
 
 
copy_file(path_s,path_t)

目前，簡(jiǎn)單的文件夾復(fù)制功能已經(jīng)實(shí)現(xiàn)了。

3、目標(biāo)文件夾中已有文件不再?gòu)?fù)制

一個(gè)簡(jiǎn)單的方法就是在目標(biāo)文件夾中復(fù)制文件之前先利用函數(shù)“os.path.exists”判定這個(gè)文件是否存在。

import os
 
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
 
def copy_file(paths,patht):
 for filename in os.listdir(paths):
 filename_s = paths+os.sep+filename
 filename_t = patht+os.sep+filename
 if os.path.isdir(filename_s):
  if not os.path.exists(filename_t):
  os.mkdir(filename_t)
  copy_file(filename_s,filename_t)
 else:
  if os.path.exists(filename_t):
  print '[*] "%s" already exists! ' % filename_t
  else:
  print '[*] Source :',filename_s
 
  print '[*] Target :',filename_t
  with open(filename_s,'rb') as f_s:
   with open(filename_t,'wb') as f_t:
   f_t.write(f_s.read())
 
copy_file(path_s,path_t)

這個(gè)辦法避免了一部分已有文件的重復(fù)復(fù)制操作，減少了部分不必要的讀寫(xiě)操作，但是卻無(wú)法消除內(nèi)容相同但名稱、路徑不同的重復(fù)文件。

4、利用MD5判定重復(fù)文件

目前判定兩個(gè)文件是否相同，除了按字節(jié)逐個(gè)對(duì)比這個(gè)笨方法外，簡(jiǎn)單常用的辦法就是利用MD5和CRC校驗(yàn)，或是按一定規(guī)律挑取文件的指定位置的數(shù)據(jù)塊就行對(duì)比。

這次利用文件的MD5值，將目標(biāo)文件夾中已有文件的MD5值保存到列表或字典中，每在源文件夾中讀取一個(gè)文件就判定該文件的MD5值是否已經(jīng)存在于MD5列表，沒(méi)有的話再進(jìn)行復(fù)制操作，并將該文件的MD5值寫(xiě)入列表。

import os
import hashlib
 
path_s = 'F:\\test\\s'
path_t = 'F:\\test\\t'
list_file = {}
 
def create_file_list(path):
 for name in os.listdir(path):
 filename = path+os.sep+name
 if os.path.isdir(filename):
  create_file_list(filename)
 else:
  with open(filename,'rb') as f:
  md5 = hashlib.md5(f.read()).hexdigest()
  if md5 not in list_file:
   list_file[md5] = 1
 
def copy_file(paths,patht):
 for filename in os.listdir(paths):
 filename_s = paths+os.sep+filename
 filename_t = patht+os.sep+filename
 if os.path.isdir(filename_s):
  if not os.path.exists(filename_t):
  os.mkdir(filename_t)
  copy_file(filename_s,filename_t)
 else:
  if os.path.exists(filename_t):
  print '[*] "%s" already exists! ' % filename_t
  else:
  with open(filename_s,'rb') as f_s:
   data = f_s.read()
   file_md5 = hashlib.md5(data).hexdigest()
   if file_md5 not in list_file:
   list_file[file_md5] = 1
   print '[*] Source :',filename_s
   print '[*] Target :',filename_t
   with open(filename_t,'wb') as f_t:
    f_t.write(data)
   else:
   print '[*] "%s"\'s MD5 already exists! ' % filename_t
 
create_file_list(path_t)
copy_file(path_s,path_t)

如下圖，運(yùn)行后內(nèi)容相同的幾個(gè)文件，只有第一次讀取到的時(shí)候才寫(xiě)入目標(biāo)文件夾，其他路徑下的文件并沒(méi)有復(fù)制到目標(biāo)文件夾。