Конкатат всех текстовых файлов и их содержимого, содержащихся во всех ZIP-файлах в текстовом файле с использованием Python - PullRequest
2 голосов
/ 16 ноября 2011

Я пытаюсь написать программу, которая будет читать все файлы в папке и выводить все их содержимое в один файл. Файлы архивируются с расширением .gz. Мне удалось прочитать один файл, но не все его содержимое и не остальные файлы. Вот мой код:

import glob, gzip, re
import pickle

filed = open('Logs.txt', 'w')


logfilenames = glob.glob('*.gz')




logformat = re.compile(r'^\S+ \S+ \S+ \[([\w:/]+\s[+\-]\d{4})\] "(\S+) (\S+) .*" (\d+) (\d+) "([^"]*)" "[^"]*"')
with gzip.GzipFile(logfilenames[0],'r') as f:
    for i in glob.glob('*.gz'):
        txtline = f.readline()
        parsedline = logformat.match(txtline)
        print "time={t} size={s} url={u}".format(t=parsedline.group(1), s=parsedline.group(5), u=parsedline.group(3))

        pickle.dump(["time={t} size={s} url={u}".format(t=parsedline.group(1), s=parsedline.group(5), u=parsedline.group(3))],filed)

filed.close()

Ответы [ 2 ]

3 голосов
/ 16 ноября 2011

Попробуйте это (не коснулся вашего регулярного выражения):

import glob, gzip, re
import cPickle

logformat = re.compile(r'^\S+ \S+ \S+ \[([\w:/]+\s[+\-]\d{4})\] "(\S+) (\S+) .*" (\d+) (\d+) "([^"]*)" "[^"]*"')

with open('Logs.txt', 'w') as f_out:
    for i in glob.glob('*.gz'):
        with gzip.GzipFile(i,'r') as f_in:
            for txtline in f_in:
                parsedline = logformat.match(txtline)
                if parsedline:
                    f_out.write("time={t} size={s} url={u}".format(t=parsedline.group(1), s=parsedline.group(5), u=parsedline.group(3)))
0 голосов
/ 16 ноября 2011

сохранить как xD.sh

mkdir dir
mv $file dir
cd dir
tar -zxvf $file
for file in `ls -w 1 | grep -v ".gz"`; do
cat $file >> joint-file
done
mv joint-file ../
rm -rf dir

и затем используйте его из python с

import os
cmd = './xd.sh'
os.system(cmd)

=)

...