Ich habe eine riesige Dateien von 3.000.000 Zeilen und jede Zeile haben 20-40 Wörter. Ich muss 1 bis 5 Negramme aus dem Korpus extrahieren. Meine Eingabedateien werden in Token aufgeteilt Klartext, zB:Effektive 1-5 Gramm Extraktion mit Python
This is a foo bar sentence .
There is a comma , in this sentence .
Such is an example text .
Derzeit mache ich es wie unten aber das scheint nicht ein effizienter Weg zu sein, um die 1-5grams zu extrahieren:
#!/usr/bin/env python -*- coding: utf-8 -*-
import io, os
from collections import Counter
import sys; reload(sys); sys.setdefaultencoding('utf-8')
with io.open('train-1.tok.en', 'r', encoding='utf8') as srcfin, \
io.open('train-1.tok.jp', 'r', encoding='utf8') as trgfin:
# Extract words from file.
src_words = ['<s>'] + srcfin.read().replace('\n', ' </s> <s> ').split()
del src_words[-1] # Removes the final '<s>'
trg_words = ['<s>'] + trgfin.read().replace('\n', ' </s> <s> ').split()
del trg_words[-1] # Removes the final '<s>'
# Unigrams count.
src_unigrams = Counter(src_words)
trg_unigrams = Counter(trg_words)
# Sum of unigram counts.
src_sum_unigrams = sum(src_unigrams.values())
trg_sum_unigrams = sum(trg_unigrams.values())
# Bigrams count.
src_bigrams = Counter(zip(src_words,src_words[1:]))
trg_bigrams = Counter(zip(trg_words,trg_words[1:]))
# Sum of bigram counts.
src_sum_bigrams = sum(src_bigrams.values())
trg_sum_bigrams = sum(trg_bigrams.values())
# Trigrams count.
src_trigrams = Counter(zip(src_words,src_words[1:], src_words[2:]))
trg_trigrams = Counter(zip(trg_words,trg_words[1:], trg_words[2:]))
# Sum of trigram counts.
src_sum_trigrams = sum(src_bigrams.values())
trg_sum_trigrams = sum(trg_bigrams.values())
Gibt es eine andere Möglichkeit, dies effizienter zu tun?
Wie kann man verschiedene N-ngrams gleichzeitig optimal extrahieren?
Von Fast/Optimize N-gram implementations in python, im Wesentlichen diese:
zip(*[words[i:] for i in range(n)])
wenn hartcodiert ist dies für Bigramme, n=2
:
zip(src_words,src_words[1:])
und das ist für Trigramme, n=3
:
zip(src_words,src_words[1:],src_words[2:])
Wie ist das Format der Eingabedateien? – mbatchkarov