import langid                             #引入langid模塊 
  
def translate(inputFile, outputFile): 
  fin = open(inputFile, 'r')                  #以讀的方式打開輸入文件 
  fout = open(outputFile, 'w')                 #以寫的方式打開輸出文件 
  
  for eachLine in fin:                     #依次讀入每一行 
    line = eachLine.strip().decode('utf-8', 'ignore')   #去除每行的首位空格等，并統(tǒng)一轉(zhuǎn)化成Unicode 
    lineTuple = langid.classify(line)           #調(diào)用langid來對該行進(jìn)行語言檢測 
    if lineTuple[0] == "zh":               #如果該行語言大部分為中文，則不進(jìn)行任何處理 
      continue 
  
    outstr = line                     #如果該行語言為非中文，則準(zhǔn)備輸出 
    fout.write(outstr.strip().encode('utf-8') + '\n')   #輸出非中文的行，從Unicode轉(zhuǎn)化成utf-8輸出 
  
  fin.close() 
  fout.close() 
  
if __name__ == '__main__':                      #相當(dāng)于main函數(shù) 
  translate("myInputFile.txt", "myOutputFile.txt")

以上代碼是用來處理一個文本，將不屬于中文的行依次輸出到一個新的文件。

3.注意

第9、10行代碼，langid.classify(line)的輸出結(jié)果是一個二元組，二元組的第一項表示該文本所屬的語系，如：zh表示中文、en表示英語、等等；二元組的第二項表示該文本中屬于第一項中語系的所占比例。

希望對大家有所幫助。

您可能感興趣的文章: