Ich arbeite an einem Projekt, das sich mit Daten in Fremdsprachen beschäftigt. Meine Perl-Skripte liefen gut.Warum scheitert mein Perl-Programm mit der Encodierung von Tie :: File und Unicode/UTF-8?
Ich wollte dann Tie :: File verwenden, da dies ein nettes Konzept ist (und spart Zeit und Codierung).
Es scheint, dass Tie: Datei unter Unicode/UTF-8 fehlschlägt (es sei denn, ich vermisse etwas). Hier
ist ein Programm, das das Problem zeigt: (Die Daten ist eine Mischung aus Englisch, Griechisch und Hebräisch):
use strict;
use warnings;
use 5.014;
use Win32::Console;
use autodie;
use warnings qw< FATAL utf8 >;
use Carp;
use Carp::Always;
use utf8;
use feature qw< unicode_strings>;
use charnames qw< :full>;
use Tie::File;
my ($i);
my ($FileName);
my (@Tied);
binmode STDOUT, ':unix:utf8';
binmode STDERR, ':unix:utf8';
binmode $DB::OUT, ':unix:utf8' if $DB::OUT; # for the debugger
Win32::Console::OutputCP(65001); # Set the console code page to UTF8
$FileName = 'E:\\My Documents\\Technical\\Perl\\Eclipse workspace\\Work\\'.
'Tie File test res.txt';
tie @Tied, 'Tie::File', $FileName, recsep => "\x0D\x0A", discipline => ':encoding(utf8)'
or confess 'tie @Tied failed';
$i =0;
while (<DATA>) {
chomp;
$Tied[$i] = $_;
++$i;
} # end while (<DATA>)
$i =0;
foreach (@Tied) {
say "$i $Tied[$i]";
++$i;
} # end foreach (@Tied)
untie $FileName;
__DATA__
τι κάνετε;
πάρτε το ή αφήστε το
שלום חברים
abc לא כןכן efg
מתי ולאן This is it
מעכשיו לעכשיו
Σήμερα είναι Τρίτη
Θέλω να φάω
τι κάνετε;
שורה מס' 5
dies eine große Kaskade von Warnungen erzeugt: hier einige sind:
utf8 "\xCE" does not map to Unicode at F:/Win7programs/Dwimperl/perl/lib/Tie/File.pm line 917
Tie::File::_read_record('Tie::File=HASH(0x24cb72c)') called at F:/Win7programs/Dwimper
l/perl/lib/Tie/File.pm line 175
Tie::File::_fetch('Tie::File=HASH(0x24cb72c)', 0) called at F:/Win7programs/Dwimperl/p
erl/lib/Tie/File.pm line 210
Tie::File::STORE('Tie::File=HASH(0x24cb72c)', 0, 'τι κάνετε;') called at tie file test
.pl line 31
utf8 "\xCF" does not map to Unicode at F:/Win7programs/Dwimperl/perl/lib/Tie/File.pm line 917
Tie::File::_read_record('Tie::File=HASH(0x24cb72c)') called at F:/Win7programs/Dwimper
l/perl/lib/Tie/File.pm line 175
Tie::File::_fetch('Tie::File=HASH(0x24cb72c)', 0) called at F:/Win7programs/Dwimperl/p
erl/lib/Tie/File.pm line 210
Tie::File::STORE('Tie::File=HASH(0x24cb72c)', 0, 'τι κάνετε;') called at tie file test
.pl line 31
utf8 "\xD7" does not map to Unicode at F:/Win7programs/Dwimperl/perl/lib/Tie/File.pm line 917
Tie::File::_read_record('Tie::File=HASH(0x24cb72c)') called at F:/Win7programs/Dwimper
l/perl/lib/Tie/File.pm line 175
Tie::File::_fetch('Tie::File=HASH(0x24cb72c)', 0) called at F:/Win7programs/Dwimperl/p
erl/lib/Tie/File.pm line 210
Tie::File::STORE('Tie::File=HASH(0x24cb72c)', 0, 'τι κάνετε;') called at tie file test
.pl line 31
utf8 "\xD7" does not map to Unicode at F:/Win7programs/Dwimperl/perl/lib/Tie/File.pm line 917
Tie::File::_read_record('Tie::File=HASH(0x24cb72c)') called at F:/Win7programs/Dwimper
l/perl/lib/Tie/File.pm line 175
Tie::File::_fetch('Tie::File=HASH(0x24cb72c)', 0) called at F:/Win7programs/Dwimperl/p
erl/lib/Tie/File.pm line 210
Tie::File::STORE('Tie::File=HASH(0x24cb72c)', 0, 'τι κάνετε;') called at tie file test
.pl line 31
Dann druckt er dies auf STDOUT:
0 τι κάνετε;
1 πάρτε το ή αφήστε το
2 שלום חברים
3 abc לא כןכן efg
4 מתי ולאן This is it
5 מעכשיו לעכשיו
6 Σήμερα είναι Τρίτη
7 Θέλω να φάω
8 τι κάνετε;
9 שורה מס' 5
10
11
12
13
14 \xA4\xΘέλω\xA8\x
15
16
17
18
19
Beachten sie, dass die ersten 10 Zeilen in Ordnung sind, aber Linien 10 bis 19 kamen aus dem Nichts !? Darüber hinaus ist die Ausgabe der gebundenen Datei enthält beschädigte Daten:
τι κάνϏN͏Ŏՠτήστε של חברءbc לؗܗࠗܗߠeמתולאן This is מעיו לעכ؎Ďώݎ֏ναι ΤρΘέώގѠφϏŎ٠κτε;שרה מס'
\xA4\xΘέλω\xA8\x
Etwas ist sehr falsch hier. Entweder fehlt mir etwas, oder Krawatte: Datei kann nicht mit Unicode/UTF-8 umgehen? Ich verwende Strawberry Perl 5.14 auf einem Windows 7-System.
Viele TIA - Helen
Hinweis: posted on http://perlmonks.org/?node_id=1002104 auch
Das (wahrscheinlich wahrscheinlichste) Problem könnte sein, dass Ihre Daten nicht richtig codiert sind. Das sagen dir die Warnungen trotzdem. – Mat
@Mat: Die Daten sind richtig codiert. Wie ich oben sagte, ohne Tie :: File funktioniert alles gut. Beachten Sie auch, dass der Ausdruck auf STDOUT in Ordnung ist (für die ersten 9 Zeilen) –
Welchen Editor benutzen Sie und sind Sie sicher, dass er die Quelldatei als UTF-8 speichert? (Und Sie müssen nicht angeben, verwenden Sie Feature qw; ', da dies mit' v5.14; 'aktiviert wird.) –
titanofold