| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 1 | #!/usr/bin/env perl |
| 2 | use strict; |
| 3 | use warnings; |
| 4 | use POSIX; |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 5 | use Getopt::Long qw(GetOptions :config no_auto_abbrev); |
| 6 | use Log::Any '$log'; |
| 7 | use Log::Any::Adapter; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 8 | use Encode; |
| 9 | use IO::Compress::Zip qw(zip $ZipError :constants); |
| 10 | use File::Basename; |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 11 | use Pod::Usage; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 12 | |
| 13 | my $_COMPRESSION_METHOD = ZIP_CM_DEFLATE; |
| 14 | my %opts; |
| 15 | my %processedFilenames; |
| 16 | |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 17 | our $VERSION = '0.7.0'; |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 18 | our $VERSION_MSG = "\nconllu2korapxml - v$VERSION\n"; |
| Marc Kupietz | 4cc243a | 2021-10-11 17:15:16 +0200 | [diff] [blame] | 19 | |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 20 | use constant { |
| 21 | # Set to 1 for minimal more debug output (no need to be parametrized) |
| 22 | DEBUG => $ENV{KORAPXMLCONLLU_DEBUG} // 0 |
| 23 | }; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 24 | |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 25 | GetOptions( |
| 26 | 'force-foundry|f=s' => \(my $foundry_name = ''), |
| Akron | 8dabdc1 | 2026-06-02 16:36:07 +0200 | [diff] [blame] | 27 | 'text-sigle|s=s' => \(my $text_sigle_template = ''), |
| Akron | 982dd1e | 2026-06-03 11:52:48 +0200 | [diff] [blame] | 28 | 'base-text' => \(my $base_text = 0), |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 29 | 'log|l=s' => \(my $log_level = 'warn'), |
| Marc Kupietz | 187abd7 | 2024-06-25 14:30:01 +0200 | [diff] [blame] | 30 | 'output|o=s' => \(my $outh = '-'), |
| Akron | cdabed8 | 2026-06-03 15:35:39 +0200 | [diff] [blame^] | 31 | 'base-tokens' => \(my $base_tokens = 0), |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 32 | 'help|h' => sub { |
| 33 | pod2usage( |
| 34 | -verbose => 99, |
| 35 | -sections => 'NAME|DESCRIPTION|SYNOPSIS|ARGUMENTS|OPTIONS|EXAMPLES', |
| 36 | -msg => $VERSION_MSG, |
| 37 | -output => '-' |
| 38 | ) |
| 39 | }, |
| 40 | 'version|v' => sub { |
| 41 | pod2usage( |
| 42 | -verbose => 0, |
| 43 | -msg => $VERSION_MSG, |
| 44 | -output => '-' |
| 45 | ); |
| 46 | } |
| 47 | ); |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 48 | |
| Akron | 8dabdc1 | 2026-06-02 16:36:07 +0200 | [diff] [blame] | 49 | # Validate text-sigle template format |
| 50 | if ($text_sigle_template) { |
| 51 | my $test_sigle = $text_sigle_template; |
| 52 | $test_sigle =~ s/\{ID\}/PLACEHOLDER/gi; |
| 53 | my @tpl_parts = split('/', $test_sigle); |
| 54 | if (scalar @tpl_parts != 3) { |
| 55 | die "ERROR: text-sigle template must produce exactly 3" |
| 56 | . " slash-separated parts (CORPUS/DOC/TEXT), got " |
| 57 | . scalar(@tpl_parts) . " from '$text_sigle_template'\n"; |
| 58 | } |
| 59 | if (grep { $_ eq '' } @tpl_parts) { |
| 60 | die "ERROR: text-sigle template '$text_sigle_template'" |
| 61 | . " must not contain empty parts\n"; |
| 62 | } |
| 63 | } |
| 64 | |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 65 | # Establish logger |
| 66 | binmode(STDERR, ':encoding(UTF-8)'); |
| 67 | Log::Any::Adapter->set('Stderr', log_level => $log_level); |
| 68 | $log->notice('Debugging is activated') if DEBUG; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 69 | |
| 70 | my $docid=""; |
| 71 | my $zip = undef; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 72 | my $parser_file; |
| 73 | my $parse; |
| 74 | my $morpho_file; |
| 75 | my $morpho; |
| 76 | my @spansFrom; |
| 77 | my @spansTo; |
| 78 | my $current; |
| 79 | my ($unknown, $known) = (0, 0); |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 80 | my $sentence_text = ''; |
| 81 | my $doc_offset = 0; |
| 82 | my $text_pos = 0; |
| 83 | my $compute_offsets_mode = 0; |
| 84 | # Buffer dependency arcs until all token offsets in a sentence are known |
| 85 | my @dep_buffer; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 86 | |
| 87 | my ($write_morpho, $write_syntax, $base) = (1, 0, 0); |
| Akron | 982dd1e | 2026-06-03 11:52:48 +0200 | [diff] [blame] | 88 | my @doc_texts; |
| Akron | cdabed8 | 2026-06-03 15:35:39 +0200 | [diff] [blame^] | 89 | my @token_spans; |
| 90 | my $token_counter = 0; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 91 | my $filename; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 92 | my $first=1; |
| 93 | my @conllu_files = @ARGV; |
| 94 | push @conllu_files, "-" if (@conllu_files == 0); |
| 95 | my $fh; |
| Marc Kupietz | dd546a8 | 2024-03-22 16:30:09 +0100 | [diff] [blame] | 96 | |
| 97 | my $dependency_foundry_name = $foundry_name; |
| 98 | if ($foundry_name =~ /(.*) dependency:(.*)/) { |
| 99 | $foundry_name = $1; |
| 100 | $dependency_foundry_name = $2; |
| 101 | } |
| 102 | |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 103 | foreach my $conllu_file (@conllu_files) { |
| 104 | if ($conllu_file eq '-') { |
| 105 | $fh = \*STDIN; |
| 106 | } else { |
| 107 | open($fh, "<", $conllu_file) or die "Cannot open $conllu_file"; |
| 108 | } |
| 109 | my $i=0; my $s=0; my $first_in_sentence=0; |
| 110 | my $lastDocSigle=""; |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 111 | MAIN: while (<$fh>) { |
| Marc Kupietz | bcb55b8 | 2022-09-15 11:42:26 +0200 | [diff] [blame] | 112 | if(/^\s*(?:#|0\.\d)/) { |
| 113 | if(/^(?:#|0\.1)\s+filename\s*[:=]\s*(.*)/) { |
| 114 | $filename=$1; |
| 115 | if(!$first) { |
| 116 | closeDoc(0); |
| 117 | } else { |
| 118 | $first=0; |
| 119 | } |
| 120 | if($processedFilenames{$filename}) { |
| 121 | $log->warn("WARNING: $filename is already processed"); |
| 122 | } |
| 123 | $processedFilenames{$filename}=1; |
| 124 | $i=0; |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 125 | $doc_offset = 0; |
| 126 | $sentence_text = ''; |
| 127 | $compute_offsets_mode = 0; |
| Akron | 982dd1e | 2026-06-03 11:52:48 +0200 | [diff] [blame] | 128 | @doc_texts = (); |
| Akron | cdabed8 | 2026-06-03 15:35:39 +0200 | [diff] [blame^] | 129 | @token_spans = (); |
| 130 | $token_counter = 0; |
| Akron | 8dabdc1 | 2026-06-02 16:36:07 +0200 | [diff] [blame] | 131 | } elsif (/^#\s*newdoc\s+id\s*=\s*(.*)/ && $text_sigle_template) { |
| 132 | my $newdoc_id = $1; |
| 133 | $newdoc_id =~ s/\s+$//; |
| 134 | |
| 135 | if (!$first) { |
| 136 | closeDoc(0); |
| 137 | } else { |
| 138 | $first = 0; |
| 139 | } |
| 140 | |
| 141 | my $text_sigle = $text_sigle_template; |
| 142 | $text_sigle =~ s/\{ID\}/$newdoc_id/gi; |
| 143 | |
| 144 | my @parts = split('/', $text_sigle); |
| 145 | if (scalar @parts != 3 || grep { $_ eq '' } @parts) { |
| 146 | die "ERROR: Expanded text sigle '$text_sigle' is not" |
| 147 | . " in valid CORPUS/DOC/TEXT format\n"; |
| 148 | } |
| 149 | |
| 150 | $filename = "$text_sigle/base/tokens.xml"; |
| 151 | if ($processedFilenames{$filename}) { |
| 152 | $log->warn("WARNING: $filename is already processed"); |
| 153 | } |
| 154 | $processedFilenames{$filename} = 1; |
| 155 | $i = 0; |
| 156 | |
| 157 | my $last = pop @parts; |
| 158 | $docid = join('_', @parts) . '.' . $last; |
| 159 | |
| 160 | my $docSigle = $docid; |
| 161 | $docSigle =~ s/\..*//; |
| 162 | if ($docSigle ne $lastDocSigle) { |
| 163 | $log->info("Analyzing $docSigle"); |
| 164 | $lastDocSigle = $docSigle; |
| 165 | } |
| 166 | $known = $unknown = 0; |
| 167 | $current = ""; |
| 168 | |
| 169 | $morpho_file = "$text_sigle/$foundry_name/morpho.xml"; |
| 170 | $parser_file = "$text_sigle/$dependency_foundry_name/dependency.xml"; |
| 171 | |
| 172 | $parse = $morpho = layer_header($docid); |
| Marc Kupietz | bcb55b8 | 2022-09-15 11:42:26 +0200 | [diff] [blame] | 173 | } elsif(/^#\s*foundry\s*[:=]\s*(.*)/) { |
| 174 | if(!$foundry_name) { |
| Marc Kupietz | dd546a8 | 2024-03-22 16:30:09 +0100 | [diff] [blame] | 175 | $dependency_foundry_name = $foundry_name = $1; |
| 176 | if ($foundry_name =~ /(.*) dependency:(.*)/) { |
| 177 | $foundry_name = $1; |
| 178 | $dependency_foundry_name = $2; |
| 179 | } |
| Marc Kupietz | bcb55b8 | 2022-09-15 11:42:26 +0200 | [diff] [blame] | 180 | $log->debug("Foundry: $foundry_name\n"); |
| 181 | } else { |
| 182 | $log->debug("Ignored foundry name: $1\n"); |
| 183 | } |
| 184 | } elsif(/^#\s*generator\s*[=]\s*udpipe/i) { |
| 185 | if(!$foundry_name) { |
| Marc Kupietz | dd546a8 | 2024-03-22 16:30:09 +0100 | [diff] [blame] | 186 | $dependency_foundry_name = $foundry_name = "ud"; |
| Marc Kupietz | bcb55b8 | 2022-09-15 11:42:26 +0200 | [diff] [blame] | 187 | $log->debug("Foundry: $foundry_name\n"); |
| 188 | } else { |
| 189 | $log->debug("Ignored foundry name: ud\n"); |
| 190 | } |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 191 | } elsif(/^(?:#|0\.2)\s+text_id\s*[:=]\s*(.*)/) { |
| Marc Kupietz | bcb55b8 | 2022-09-15 11:42:26 +0200 | [diff] [blame] | 192 | $docid=$1; |
| Marc Kupietz | cc39147 | 2024-06-24 10:48:34 +0200 | [diff] [blame] | 193 | $docid =~ s/\s+$//; |
| Marc Kupietz | bcb55b8 | 2022-09-15 11:42:26 +0200 | [diff] [blame] | 194 | my $docSigle = $docid; |
| 195 | $docSigle =~ s/\..*//; |
| 196 | if($docSigle ne $lastDocSigle) { |
| 197 | $log->info("Analyzing $docSigle"); |
| 198 | $lastDocSigle = $docSigle; |
| 199 | } |
| 200 | $known=$unknown=0; |
| 201 | $current=""; |
| 202 | $parser_file = dirname($filename); |
| 203 | $parser_file =~ s@(.*)/[^/]+$@$1@; |
| 204 | $morpho_file = $parser_file; |
| 205 | $morpho_file .= "/$foundry_name/morpho.xml"; |
| Marc Kupietz | dd546a8 | 2024-03-22 16:30:09 +0100 | [diff] [blame] | 206 | $parser_file .= "/$dependency_foundry_name/dependency.xml"; |
| Marc Kupietz | bcb55b8 | 2022-09-15 11:42:26 +0200 | [diff] [blame] | 207 | $parse = $morpho = layer_header($docid); |
| 208 | } elsif (/^(?:#|0\.3)\s+(?:start_offsets|from)\s*[:=]\s*(.*)/) { |
| 209 | @spansFrom = split(/\s+/, $1); |
| 210 | } elsif (/^(?:#|0\.4)\s+(?:end_offsets|to)\s+[:=]\s*(.*)/) { |
| 211 | @spansTo = split(/\s+/, $1); |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 212 | } elsif (/^#\s*text\s*=\s*(.*)/) { |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 213 | $sentence_text = decode('UTF-8', $1); |
| Akron | 982dd1e | 2026-06-03 11:52:48 +0200 | [diff] [blame] | 214 | if ($base_text) { |
| 215 | my $txt = $1; |
| 216 | $txt =~ s/\s+$//; |
| 217 | push @doc_texts, $txt; |
| 218 | } |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 219 | } |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 220 | } elsif ( !/^\s*$/ ) { |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 221 | # Pre-split columns before offset computation needs the raw form |
| 222 | my @raw_cols = split('\t'); |
| 223 | chomp $raw_cols[$#raw_cols] if @raw_cols; |
| 224 | |
| 225 | # Enter offset computation mode when no explicit offsets given |
| 226 | if (!$compute_offsets_mode && scalar @spansFrom == 0 |
| 227 | && $sentence_text && $docid) { |
| 228 | $compute_offsets_mode = 1; |
| 229 | @spansFrom = (); |
| 230 | @spansTo = (); |
| 231 | # Sentence-level span covers the full sentence text |
| 232 | $spansFrom[0] = $doc_offset; |
| 233 | $spansTo[0] = $doc_offset + length($sentence_text); |
| 234 | $text_pos = 0; |
| 235 | } |
| 236 | |
| 237 | # Locate each token form in sentence text via index() |
| 238 | if ($compute_offsets_mode && @raw_cols >= 2 && $raw_cols[0] =~ /^\d+$/) { |
| 239 | my $raw_form = decode('UTF-8', $raw_cols[1]); |
| 240 | my $t_num = $raw_cols[0]; |
| 241 | # Find token starting from current position (handles SpaceAfter) |
| 242 | my $pos_in_text = index($sentence_text, $raw_form, $text_pos); |
| 243 | if ($pos_in_text >= 0) { |
| 244 | $spansFrom[$t_num] = $doc_offset + $pos_in_text; |
| 245 | $spansTo[$t_num] = $spansFrom[$t_num] + length($raw_form); |
| 246 | # Advance past this token for the next search |
| 247 | $text_pos = $pos_in_text + length($raw_form); |
| 248 | } else { |
| 249 | $log->warn("WARNING: Token form not found in sentence text in $conllu_file line $."); |
| 250 | } |
| 251 | } |
| 252 | |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 253 | if ( !$docid || scalar @spansTo == 0 || scalar @spansFrom == 0 ) { |
| 254 | if ( !$docid ) { |
| Marc Kupietz | 67d8c43 | 2024-06-25 14:32:16 +0200 | [diff] [blame] | 255 | $log->warn("WARNING: Invalid input in $conllu_file: text_id (e.g. '# text_id = GOE_AGA.00000') missing in line $. when writing to $outh"); |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 256 | } |
| 257 | if ( scalar @spansTo == 0 || scalar @spansFrom == 0 ) { |
| Marc Kupietz | 67d8c43 | 2024-06-25 14:32:16 +0200 | [diff] [blame] | 258 | $log->warn("WARNING: Invalid input in $conllu_file: token offsets missing in line $. when writing to $outh"); |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 259 | } |
| 260 | |
| 261 | # Skip to next potentially valid document |
| 262 | while (<$fh>) { |
| 263 | next MAIN if m!^\s*$!s; |
| 264 | } |
| 265 | }; |
| Marc Kupietz | d50de7c | 2024-03-10 15:24:55 +0100 | [diff] [blame] | 266 | my @parsed = map { |
| 267 | my $s = $_; |
| 268 | $s =~ s/&/&/g; |
| 269 | $s =~ s/</</g; |
| 270 | $s =~ s/>/>/g; |
| 271 | $s; |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 272 | } @raw_cols; |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 273 | if (@parsed != 10) { |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 274 | $log->warn("WARNING: skipping strange parser output line in $docid"); |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 275 | $i++; |
| 276 | next; |
| 277 | } |
| 278 | my $t=$parsed[0]; |
| 279 | if($t == 1) { |
| 280 | $s++; |
| 281 | $first_in_sentence = $i; |
| 282 | } |
| 283 | if($parsed[6] =~ /\d+/ && $parsed[7] !~ /_/) { |
| 284 | $write_syntax=1; |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 285 | # Buffer dep arcs; flushed at end of sentence when offsets are ready |
| 286 | push @dep_buffer, [$s, $t, $parsed[6], $parsed[7]]; |
| Marc Kupietz | a591cdd | 2021-10-12 13:23:48 +0200 | [diff] [blame] | 287 | } |
| Marc Kupietz | 5cc4df2 | 2024-03-24 13:46:42 +0100 | [diff] [blame] | 288 | my $pos = $parsed[4]; |
| 289 | my $upos = $parsed[3]; |
| Marc Kupietz | a591cdd | 2021-10-12 13:23:48 +0200 | [diff] [blame] | 290 | $pos =~ s/\|.*//; |
| 291 | $morpho .= qq( <span id="s${s}_n$t" from="$spansFrom[$t]" to="$spansTo[$t]"> |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 292 | <fs type="lex" xmlns="http://www.tei-c.org/ns/1.0"> |
| 293 | <f name="lex"> |
| 294 | <fs> |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 295 | ); |
| Marc Kupietz | 5cc4df2 | 2024-03-24 13:46:42 +0100 | [diff] [blame] | 296 | if($pos ne "_") { |
| 297 | $morpho .= qq( <f name="pos">$pos</f>\n); |
| 298 | } |
| 299 | if($upos ne "_") { |
| 300 | $morpho .= qq( <f name="upos">$upos</f>\n); |
| 301 | } |
| Marc Kupietz | 97ba2ba | 2021-10-11 17:55:47 +0200 | [diff] [blame] | 302 | $morpho .= qq( <f name="lemma">$parsed[2]</f>\n) if($parsed[2] ne "_" || $parsed[1] eq '_'); |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 303 | $morpho .= qq( <f name="msd">$parsed[5]</f>\n) if($parsed[5] ne "_"); |
| 304 | if($parsed[9] ne "_") { |
| 305 | if ($parsed[9] =~ /[0-9.e]+/) { |
| 306 | $morpho .= qq( <f name="certainty">$parsed[9]</f>\n) |
| 307 | } |
| 308 | else { |
| 309 | $morpho .= qq( <f name="misc">$parsed[9]</f>\n) |
| 310 | } |
| 311 | } |
| 312 | $morpho .= qq( </fs> |
| 313 | </f> |
| 314 | </fs> |
| 315 | </span> |
| 316 | ); |
| Akron | cdabed8 | 2026-06-03 15:35:39 +0200 | [diff] [blame^] | 317 | # Collect token span for optional base/tokens.xml output |
| 318 | if ($base_tokens) { |
| 319 | push @token_spans, [$spansFrom[$t], $spansTo[$t]]; |
| 320 | } |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 321 | $i++; |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 322 | } else { |
| 323 | # Empty line = end of sentence |
| 324 | flush_dep_buffer(); |
| 325 | if ($compute_offsets_mode) { |
| 326 | # Advance doc offset past sentence + 1-char space separator |
| 327 | $doc_offset += length($sentence_text) + 1; |
| 328 | @spansFrom = (); |
| 329 | @spansTo = (); |
| 330 | $compute_offsets_mode = 0; |
| 331 | } |
| 332 | $sentence_text = ''; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 333 | } |
| 334 | } |
| 335 | $current .= "\n"; |
| 336 | closeDoc(1); |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 337 | $zip->close() if $zip; |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 338 | close($fh); |
| 339 | } |
| 340 | exit; |
| 341 | |
| 342 | sub newZipStream { |
| 343 | my ($fname) = @_; |
| 344 | if (defined $zip) { |
| 345 | $zip->newStream(Zip64 => 1, TextFlag => 1, Method => $_COMPRESSION_METHOD, |
| Marc Kupietz | 447f475 | 2024-03-22 17:35:57 +0100 | [diff] [blame] | 346 | Append => 1, Name => $fname, ExtAttr => 0100666 << 16) |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 347 | or die "ERROR ('$fname'): zip failed: $ZipError\n"; |
| 348 | } else { |
| 349 | $zip = new IO::Compress::Zip $outh, Zip64 => 1, TextFlag => 1, |
| Marc Kupietz | 447f475 | 2024-03-22 17:35:57 +0100 | [diff] [blame] | 350 | Method => $_COMPRESSION_METHOD, Append => 0, Name => "$fname", ExtAttr => 0100666 << 16 |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 351 | or die "ERROR ('$fname'): zip failed: $ZipError\n"; |
| 352 | } |
| 353 | } |
| 354 | |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 355 | # Write buffered dependency arcs now that all token offsets are resolved |
| 356 | sub flush_dep_buffer { |
| 357 | foreach my $dep (@dep_buffer) { |
| 358 | my ($ds, $dt, $dhead, $dlabel) = @$dep; |
| 359 | $parse .= qq@<span id="s${ds}_n$dt" from="$spansFrom[$dt]" to="$spansTo[$dt]"> |
| 360 | <rel label="$dlabel"> |
| 361 | <span from="$spansFrom[$dhead]" to="$spansTo[$dhead]"/> |
| 362 | </rel> |
| 363 | </span> |
| 364 | @; |
| 365 | } |
| 366 | @dep_buffer = (); |
| 367 | } |
| 368 | |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 369 | sub closeDoc { |
| Akron | f3efc9e | 2026-06-03 10:46:37 +0200 | [diff] [blame] | 370 | flush_dep_buffer(); |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 371 | if ($write_morpho && $morpho_file) { |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 372 | newZipStream($morpho_file); |
| 373 | $zip->print($morpho, qq( </spanList>\n</layer>\n)); |
| 374 | } |
| Akron | 49f333b | 2022-09-27 17:03:49 +0200 | [diff] [blame] | 375 | if ($write_syntax && $parser_file) { |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 376 | $write_syntax = 0; |
| 377 | newZipStream($parser_file); |
| 378 | $zip->print($parse, qq(</spanList>\n</layer>\n)); |
| 379 | } |
| Akron | 982dd1e | 2026-06-03 11:52:48 +0200 | [diff] [blame] | 380 | if ($base_text && $filename && @doc_texts) { |
| 381 | my $text_dir = dirname($filename); |
| 382 | $text_dir =~ s@(.*)/[^/]+$@$1@; |
| 383 | my $data_path = "$text_dir/data.xml"; |
| 384 | my $full_text = join(' ', @doc_texts); |
| 385 | $full_text =~ s/&/&/g; |
| 386 | $full_text =~ s/</</g; |
| 387 | $full_text =~ s/>/>/g; |
| 388 | newZipStream($data_path); |
| 389 | $zip->print( |
| 390 | qq(<?xml version="1.0" encoding="UTF-8"?>\n), |
| 391 | qq(<?xml-model href="text.rng" type="application/xml"), |
| 392 | qq( schematypens="http://relaxng.org/ns/structure/1.0"?>\n), |
| 393 | qq(<raw_text docid="$docid"), |
| 394 | qq( xmlns="http://ids-mannheim.de/ns/KorAP">\n), |
| 395 | qq(<text>$full_text</text>\n), |
| 396 | qq(</raw_text>\n) |
| 397 | ); |
| 398 | @doc_texts = (); |
| 399 | } |
| Akron | cdabed8 | 2026-06-03 15:35:39 +0200 | [diff] [blame^] | 400 | if ($base_tokens && $filename && @token_spans) { |
| 401 | my $text_dir = dirname($filename); |
| 402 | $text_dir =~ s@(.*)/[^/]+$@$1@; |
| 403 | my $tokens_path = "$text_dir/base/tokens.xml"; |
| 404 | my $tokens_out = layer_header($docid); |
| 405 | for my $idx (0 .. $#token_spans) { |
| 406 | my ($from, $to) = @{$token_spans[$idx]}; |
| 407 | $tokens_out .= qq( <span id="t_$idx" from="$from" to="$to"/>\n); |
| 408 | } |
| 409 | newZipStream($tokens_path); |
| 410 | $zip->print($tokens_out, qq(</spanList>\n</layer>\n)); |
| 411 | } |
| Marc Kupietz | 79ba1e5 | 2021-02-12 17:26:54 +0100 | [diff] [blame] | 412 | } |
| 413 | |
| 414 | sub layer_header { |
| 415 | my ($docid) = @_; |
| 416 | return(qq(<?xml version="1.0" encoding="UTF-8"?> |
| 417 | <?xml-model href="span.rng" type="application/xml" schematypens="http://relaxng.org/ns/structure/1.0"?> |
| 418 | <layer docid="$docid" xmlns="http://ids-mannheim.de/ns/KorAP" version="KorAP-0.4"> |
| 419 | <spanList> |
| 420 | )); |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 421 | } |
| 422 | |
| 423 | =pod |
| 424 | |
| 425 | =encoding utf8 |
| 426 | |
| 427 | =head1 NAME |
| 428 | |
| 429 | conllu2korapxml - Conversion of KorAP-XML CoNLL-U to KorAP-XML zips |
| 430 | |
| 431 | =head1 SYNOPSIS |
| 432 | |
| 433 | conllu2korapxml < zca15.tree_tagger.conllu > zca15.tree_tagger.zip |
| 434 | |
| 435 | =head1 DESCRIPTION |
| 436 | |
| 437 | C<conllu2korapxml> converts CoNLL-U files that follow KorAP-specific comment conventions |
| 438 | and contain morphosyntactic and/or dependency annotations to |
| 439 | corresponding KorAP-XML zip files. |
| 440 | |
| 441 | =head1 INSTALLATION |
| 442 | |
| 443 | $ cpanm https://github.com/KorAP/KorAP-XML-CoNLL-U.git |
| 444 | |
| 445 | =head1 OPTIONS |
| 446 | |
| 447 | =over 2 |
| 448 | |
| 449 | =item B<--force-foundry|-f> |
| 450 | |
| 451 | Set foundry name and ignore foundry names in the input. |
| 452 | |
| Akron | 8dabdc1 | 2026-06-02 16:36:07 +0200 | [diff] [blame] | 453 | =item B<--text-sigle|-s> |
| 454 | |
| 455 | Text sigle template with C<{ID}> placeholder for standard UD CoNLL-U |
| 456 | input. When C<# newdoc id = E<lt>IDE<gt>> is encountered, C<{ID}> is |
| 457 | replaced by the document id to derive the KorAP-XML text sigle, |
| 458 | filename, and docid. |
| Marc Kupietz | dd546a8 | 2024-03-22 16:30:09 +0100 | [diff] [blame] | 459 | |
| Akron | 982dd1e | 2026-06-03 11:52:48 +0200 | [diff] [blame] | 460 | =item B<--base-text> |
| 461 | |
| 462 | Generate a C<data.xml> file containing the reconstructed plain text |
| 463 | of each document. The text is built from C<# text> comment lines |
| 464 | in the CoNLL-U input, joined by single spaces. |
| 465 | |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 466 | =item B<--help|-h> |
| 467 | |
| 468 | Print help information. |
| 469 | |
| 470 | =item B<--version|-v> |
| 471 | |
| 472 | Print version information. |
| 473 | |
| 474 | |
| 475 | =item B<--log|-l> |
| 476 | |
| 477 | Loglevel for I<Log::Any>. Defaults to C<warn>. |
| 478 | |
| Marc Kupietz | 187abd7 | 2024-06-25 14:30:01 +0200 | [diff] [blame] | 479 | =item B<--output|-o> |
| 480 | |
| 481 | Output file. Defaults to C<-> (stdout). |
| 482 | |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 483 | =back |
| 484 | |
| 485 | =head1 EXAMPLES |
| 486 | |
| 487 | conllu2korapxml -f tree_tagger < t/data/wdf19.morpho.conllu > wdf19.tree_tagger.zip |
| 488 | |
| Marc Kupietz | dd546a8 | 2024-03-22 16:30:09 +0100 | [diff] [blame] | 489 | conllu2korapxml -f "tree_tagger dependency:malt" < t/data/wdf19.tt-malt.conllu > wdf19.tree_tagger.zip |
| 490 | |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 491 | =head1 COPYRIGHT AND LICENSE |
| 492 | |
| Akron | 249fc83 | 2024-06-04 16:36:44 +0200 | [diff] [blame] | 493 | Copyright (C) 2021-2024, L<IDS Mannheim|https://www.ids-mannheim.de/> |
| Marc Kupietz | aeb84a0 | 2021-10-11 17:57:29 +0200 | [diff] [blame] | 494 | |
| 495 | Author: Marc Kupietz |
| 496 | |
| 497 | Contributors: Nils Diewald |
| 498 | |
| 499 | L<KorAP::XML::CoNNL-U> is developed as part of the L<KorAP|https://korap.ids-mannheim.de/> |
| 500 | Corpus Analysis Platform at the |
| 501 | L<Leibniz Institute for the German Language (IDS)|http://ids-mannheim.de/>, |
| 502 | member of the |
| 503 | L<Leibniz-Gemeinschaft|http://www.leibniz-gemeinschaft.de/>. |
| 504 | |
| 505 | This program is free software published under the |
| 506 | L<BSD-2 License|https://opensource.org/licenses/BSD-2-Clause>. |