blob: 75b63d28c77579d2b1e7fbf8fe91d44546173e33 [file] [log] [blame]
Marc Kupietz79ba1e52021-02-12 17:26:54 +01001#!/usr/bin/env perl
2use strict;
3use warnings;
4use POSIX;
Marc Kupietzaeb84a02021-10-11 17:57:29 +02005use Getopt::Long qw(GetOptions :config no_auto_abbrev);
6use Log::Any '$log';
7use Log::Any::Adapter;
Marc Kupietz79ba1e52021-02-12 17:26:54 +01008use Encode;
9use IO::Compress::Zip qw(zip $ZipError :constants);
10use File::Basename;
Marc Kupietzaeb84a02021-10-11 17:57:29 +020011use Pod::Usage;
Marc Kupietz79ba1e52021-02-12 17:26:54 +010012
13my $_COMPRESSION_METHOD = ZIP_CM_DEFLATE;
14my %opts;
15my %processedFilenames;
16
Akronf3efc9e2026-06-03 10:46:37 +020017our $VERSION = '0.7.0';
Marc Kupietzaeb84a02021-10-11 17:57:29 +020018our $VERSION_MSG = "\nconllu2korapxml - v$VERSION\n";
Marc Kupietz4cc243a2021-10-11 17:15:16 +020019
Marc Kupietzaeb84a02021-10-11 17:57:29 +020020use constant {
21 # Set to 1 for minimal more debug output (no need to be parametrized)
22 DEBUG => $ENV{KORAPXMLCONLLU_DEBUG} // 0
23};
Marc Kupietz79ba1e52021-02-12 17:26:54 +010024
Marc Kupietzaeb84a02021-10-11 17:57:29 +020025GetOptions(
26 'force-foundry|f=s' => \(my $foundry_name = ''),
Akron8dabdc12026-06-02 16:36:07 +020027 'text-sigle|s=s' => \(my $text_sigle_template = ''),
Akron982dd1e2026-06-03 11:52:48 +020028 'base-text' => \(my $base_text = 0),
Marc Kupietzaeb84a02021-10-11 17:57:29 +020029 'log|l=s' => \(my $log_level = 'warn'),
Marc Kupietz187abd72024-06-25 14:30:01 +020030 'output|o=s' => \(my $outh = '-'),
Akroncdabed82026-06-03 15:35:39 +020031 'base-tokens' => \(my $base_tokens = 0),
Marc Kupietzaeb84a02021-10-11 17:57:29 +020032 'help|h' => sub {
33 pod2usage(
34 -verbose => 99,
35 -sections => 'NAME|DESCRIPTION|SYNOPSIS|ARGUMENTS|OPTIONS|EXAMPLES',
36 -msg => $VERSION_MSG,
37 -output => '-'
38 )
39 },
40 'version|v' => sub {
41 pod2usage(
42 -verbose => 0,
43 -msg => $VERSION_MSG,
44 -output => '-'
45 );
46 }
47);
Marc Kupietz79ba1e52021-02-12 17:26:54 +010048
Akron8dabdc12026-06-02 16:36:07 +020049# Validate text-sigle template format
50if ($text_sigle_template) {
51 my $test_sigle = $text_sigle_template;
52 $test_sigle =~ s/\{ID\}/PLACEHOLDER/gi;
53 my @tpl_parts = split('/', $test_sigle);
54 if (scalar @tpl_parts != 3) {
55 die "ERROR: text-sigle template must produce exactly 3"
56 . " slash-separated parts (CORPUS/DOC/TEXT), got "
57 . scalar(@tpl_parts) . " from '$text_sigle_template'\n";
58 }
59 if (grep { $_ eq '' } @tpl_parts) {
60 die "ERROR: text-sigle template '$text_sigle_template'"
61 . " must not contain empty parts\n";
62 }
63}
64
Marc Kupietzaeb84a02021-10-11 17:57:29 +020065# Establish logger
66binmode(STDERR, ':encoding(UTF-8)');
67Log::Any::Adapter->set('Stderr', log_level => $log_level);
68$log->notice('Debugging is activated') if DEBUG;
Marc Kupietz79ba1e52021-02-12 17:26:54 +010069
70my $docid="";
71my $zip = undef;
Marc Kupietz79ba1e52021-02-12 17:26:54 +010072my $parser_file;
73my $parse;
74my $morpho_file;
75my $morpho;
76my @spansFrom;
77my @spansTo;
78my $current;
79my ($unknown, $known) = (0, 0);
Akronf3efc9e2026-06-03 10:46:37 +020080my $sentence_text = '';
81my $doc_offset = 0;
82my $text_pos = 0;
83my $compute_offsets_mode = 0;
84# Buffer dependency arcs until all token offsets in a sentence are known
85my @dep_buffer;
Marc Kupietz79ba1e52021-02-12 17:26:54 +010086
Akron4f542622026-06-03 14:20:20 +020087# Struct layer tracking for sentence and paragraph spans
88my @sentence_spans;
89my @paragraph_spans;
90my $current_sent_id = '';
91my $pending_newpar_id = '';
92my $current_par_from = -1;
93my $last_sent_to = -1;
94my $has_sent_ids = 0;
95my $sent_counter = 0;
96my $par_counter = 0;
97
Marc Kupietz79ba1e52021-02-12 17:26:54 +010098my ($write_morpho, $write_syntax, $base) = (1, 0, 0);
Akron982dd1e2026-06-03 11:52:48 +020099my @doc_texts;
Akroncdabed82026-06-03 15:35:39 +0200100my @token_spans;
101my $token_counter = 0;
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100102my $filename;
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100103my $first=1;
104my @conllu_files = @ARGV;
105push @conllu_files, "-" if (@conllu_files == 0);
106my $fh;
Marc Kupietzdd546a82024-03-22 16:30:09 +0100107
108my $dependency_foundry_name = $foundry_name;
109if ($foundry_name =~ /(.*) dependency:(.*)/) {
110 $foundry_name = $1;
111 $dependency_foundry_name = $2;
112}
113
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100114foreach my $conllu_file (@conllu_files) {
115 if ($conllu_file eq '-') {
116 $fh = \*STDIN;
117 } else {
118 open($fh, "<", $conllu_file) or die "Cannot open $conllu_file";
119 }
120 my $i=0; my $s=0; my $first_in_sentence=0;
121 my $lastDocSigle="";
Akron49f333b2022-09-27 17:03:49 +0200122 MAIN: while (<$fh>) {
Marc Kupietzbcb55b82022-09-15 11:42:26 +0200123 if(/^\s*(?:#|0\.\d)/) {
124 if(/^(?:#|0\.1)\s+filename\s*[:=]\s*(.*)/) {
125 $filename=$1;
126 if(!$first) {
127 closeDoc(0);
128 } else {
129 $first=0;
130 }
131 if($processedFilenames{$filename}) {
132 $log->warn("WARNING: $filename is already processed");
133 }
134 $processedFilenames{$filename}=1;
135 $i=0;
Akronf3efc9e2026-06-03 10:46:37 +0200136 $doc_offset = 0;
137 $sentence_text = '';
138 $compute_offsets_mode = 0;
Akron982dd1e2026-06-03 11:52:48 +0200139 @doc_texts = ();
Akroncdabed82026-06-03 15:35:39 +0200140 @token_spans = ();
141 $token_counter = 0;
Akron4f542622026-06-03 14:20:20 +0200142 @sentence_spans = ();
143 @paragraph_spans = ();
144 $current_sent_id = '';
145 $pending_newpar_id = '';
146 $current_par_from = -1;
147 $last_sent_to = -1;
148 $has_sent_ids = 0;
149 $sent_counter = 0;
150 $par_counter = 0;
Akron8dabdc12026-06-02 16:36:07 +0200151 } elsif (/^#\s*newdoc\s+id\s*=\s*(.*)/ && $text_sigle_template) {
152 my $newdoc_id = $1;
153 $newdoc_id =~ s/\s+$//;
154
155 if (!$first) {
156 closeDoc(0);
157 } else {
158 $first = 0;
159 }
160
161 my $text_sigle = $text_sigle_template;
162 $text_sigle =~ s/\{ID\}/$newdoc_id/gi;
163
164 my @parts = split('/', $text_sigle);
165 if (scalar @parts != 3 || grep { $_ eq '' } @parts) {
166 die "ERROR: Expanded text sigle '$text_sigle' is not"
167 . " in valid CORPUS/DOC/TEXT format\n";
168 }
169
170 $filename = "$text_sigle/base/tokens.xml";
171 if ($processedFilenames{$filename}) {
172 $log->warn("WARNING: $filename is already processed");
173 }
174 $processedFilenames{$filename} = 1;
175 $i = 0;
176
177 my $last = pop @parts;
178 $docid = join('_', @parts) . '.' . $last;
179
180 my $docSigle = $docid;
181 $docSigle =~ s/\..*//;
182 if ($docSigle ne $lastDocSigle) {
183 $log->info("Analyzing $docSigle");
184 $lastDocSigle = $docSigle;
185 }
186 $known = $unknown = 0;
187 $current = "";
Akron4f542622026-06-03 14:20:20 +0200188 @sentence_spans = ();
189 @paragraph_spans = ();
190 $current_sent_id = '';
191 $pending_newpar_id = '';
192 $current_par_from = -1;
193 $last_sent_to = -1;
194 $has_sent_ids = 0;
195 $sent_counter = 0;
196 $par_counter = 0;
Akron8dabdc12026-06-02 16:36:07 +0200197
198 $morpho_file = "$text_sigle/$foundry_name/morpho.xml";
199 $parser_file = "$text_sigle/$dependency_foundry_name/dependency.xml";
200
201 $parse = $morpho = layer_header($docid);
Marc Kupietzbcb55b82022-09-15 11:42:26 +0200202 } elsif(/^#\s*foundry\s*[:=]\s*(.*)/) {
203 if(!$foundry_name) {
Marc Kupietzdd546a82024-03-22 16:30:09 +0100204 $dependency_foundry_name = $foundry_name = $1;
205 if ($foundry_name =~ /(.*) dependency:(.*)/) {
206 $foundry_name = $1;
207 $dependency_foundry_name = $2;
208 }
Marc Kupietzbcb55b82022-09-15 11:42:26 +0200209 $log->debug("Foundry: $foundry_name\n");
210 } else {
211 $log->debug("Ignored foundry name: $1\n");
212 }
213 } elsif(/^#\s*generator\s*[=]\s*udpipe/i) {
214 if(!$foundry_name) {
Marc Kupietzdd546a82024-03-22 16:30:09 +0100215 $dependency_foundry_name = $foundry_name = "ud";
Marc Kupietzbcb55b82022-09-15 11:42:26 +0200216 $log->debug("Foundry: $foundry_name\n");
217 } else {
218 $log->debug("Ignored foundry name: ud\n");
219 }
Akron49f333b2022-09-27 17:03:49 +0200220 } elsif(/^(?:#|0\.2)\s+text_id\s*[:=]\s*(.*)/) {
Marc Kupietzbcb55b82022-09-15 11:42:26 +0200221 $docid=$1;
Marc Kupietzcc391472024-06-24 10:48:34 +0200222 $docid =~ s/\s+$//;
Marc Kupietzbcb55b82022-09-15 11:42:26 +0200223 my $docSigle = $docid;
224 $docSigle =~ s/\..*//;
225 if($docSigle ne $lastDocSigle) {
226 $log->info("Analyzing $docSigle");
227 $lastDocSigle = $docSigle;
228 }
229 $known=$unknown=0;
230 $current="";
231 $parser_file = dirname($filename);
232 $parser_file =~ s@(.*)/[^/]+$@$1@;
233 $morpho_file = $parser_file;
234 $morpho_file .= "/$foundry_name/morpho.xml";
Marc Kupietzdd546a82024-03-22 16:30:09 +0100235 $parser_file .= "/$dependency_foundry_name/dependency.xml";
Marc Kupietzbcb55b82022-09-15 11:42:26 +0200236 $parse = $morpho = layer_header($docid);
237 } elsif (/^(?:#|0\.3)\s+(?:start_offsets|from)\s*[:=]\s*(.*)/) {
238 @spansFrom = split(/\s+/, $1);
239 } elsif (/^(?:#|0\.4)\s+(?:end_offsets|to)\s+[:=]\s*(.*)/) {
240 @spansTo = split(/\s+/, $1);
Akronf3efc9e2026-06-03 10:46:37 +0200241 } elsif (/^#\s*text\s*=\s*(.*)/) {
Akronf3efc9e2026-06-03 10:46:37 +0200242 $sentence_text = decode('UTF-8', $1);
Akron982dd1e2026-06-03 11:52:48 +0200243 if ($base_text) {
244 my $txt = $1;
245 $txt =~ s/\s+$//;
246 push @doc_texts, $txt;
247 }
Akron4f542622026-06-03 14:20:20 +0200248 } elsif (/^#\s*sent_id\s*=\s*(.*)/) {
249 $current_sent_id = $1;
250 $current_sent_id =~ s/\s+$//;
251 $has_sent_ids = 1;
252 } elsif (/^#\s*newpar(?:\s+id\s*=\s*(.*))?/) {
253 my $pid = defined($1) ? $1 : '';
254 $pid =~ s/\s+$//;
255 $pending_newpar_id = $pid || '__NEWPAR__';
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100256 }
Akron49f333b2022-09-27 17:03:49 +0200257 } elsif ( !/^\s*$/ ) {
Akronf3efc9e2026-06-03 10:46:37 +0200258 # Pre-split columns before offset computation needs the raw form
259 my @raw_cols = split('\t');
260 chomp $raw_cols[$#raw_cols] if @raw_cols;
261
262 # Enter offset computation mode when no explicit offsets given
263 if (!$compute_offsets_mode && scalar @spansFrom == 0
264 && $sentence_text && $docid) {
265 $compute_offsets_mode = 1;
266 @spansFrom = ();
267 @spansTo = ();
268 # Sentence-level span covers the full sentence text
269 $spansFrom[0] = $doc_offset;
270 $spansTo[0] = $doc_offset + length($sentence_text);
271 $text_pos = 0;
272 }
273
274 # Locate each token form in sentence text via index()
275 if ($compute_offsets_mode && @raw_cols >= 2 && $raw_cols[0] =~ /^\d+$/) {
276 my $raw_form = decode('UTF-8', $raw_cols[1]);
277 my $t_num = $raw_cols[0];
278 # Find token starting from current position (handles SpaceAfter)
279 my $pos_in_text = index($sentence_text, $raw_form, $text_pos);
280 if ($pos_in_text >= 0) {
281 $spansFrom[$t_num] = $doc_offset + $pos_in_text;
282 $spansTo[$t_num] = $spansFrom[$t_num] + length($raw_form);
283 # Advance past this token for the next search
284 $text_pos = $pos_in_text + length($raw_form);
285 } else {
286 $log->warn("WARNING: Token form not found in sentence text in $conllu_file line $.");
287 }
288 }
289
Akron49f333b2022-09-27 17:03:49 +0200290 if ( !$docid || scalar @spansTo == 0 || scalar @spansFrom == 0 ) {
291 if ( !$docid ) {
Marc Kupietz67d8c432024-06-25 14:32:16 +0200292 $log->warn("WARNING: Invalid input in $conllu_file: text_id (e.g. '# text_id = GOE_AGA.00000') missing in line $. when writing to $outh");
Akron49f333b2022-09-27 17:03:49 +0200293 }
294 if ( scalar @spansTo == 0 || scalar @spansFrom == 0 ) {
Marc Kupietz67d8c432024-06-25 14:32:16 +0200295 $log->warn("WARNING: Invalid input in $conllu_file: token offsets missing in line $. when writing to $outh");
Akron49f333b2022-09-27 17:03:49 +0200296 }
297
298 # Skip to next potentially valid document
299 while (<$fh>) {
300 next MAIN if m!^\s*$!s;
301 }
302 };
Marc Kupietzd50de7c2024-03-10 15:24:55 +0100303 my @parsed = map {
304 my $s = $_;
305 $s =~ s/&/&amp;/g;
306 $s =~ s/</&lt;/g;
307 $s =~ s/>/&gt;/g;
308 $s;
Akronf3efc9e2026-06-03 10:46:37 +0200309 } @raw_cols;
Akron49f333b2022-09-27 17:03:49 +0200310 if (@parsed != 10) {
Marc Kupietzaeb84a02021-10-11 17:57:29 +0200311 $log->warn("WARNING: skipping strange parser output line in $docid");
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100312 $i++;
313 next;
314 }
315 my $t=$parsed[0];
316 if($t == 1) {
317 $s++;
318 $first_in_sentence = $i;
319 }
320 if($parsed[6] =~ /\d+/ && $parsed[7] !~ /_/) {
321 $write_syntax=1;
Akronf3efc9e2026-06-03 10:46:37 +0200322 # Buffer dep arcs; flushed at end of sentence when offsets are ready
323 push @dep_buffer, [$s, $t, $parsed[6], $parsed[7]];
Marc Kupietza591cdd2021-10-12 13:23:48 +0200324 }
Marc Kupietz5cc4df22024-03-24 13:46:42 +0100325 my $pos = $parsed[4];
326 my $upos = $parsed[3];
Marc Kupietza591cdd2021-10-12 13:23:48 +0200327 $pos =~ s/\|.*//;
328 $morpho .= qq( <span id="s${s}_n$t" from="$spansFrom[$t]" to="$spansTo[$t]">
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100329 <fs type="lex" xmlns="http://www.tei-c.org/ns/1.0">
330 <f name="lex">
331 <fs>
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100332);
Marc Kupietz5cc4df22024-03-24 13:46:42 +0100333 if($pos ne "_") {
334 $morpho .= qq( <f name="pos">$pos</f>\n);
335 }
336 if($upos ne "_") {
337 $morpho .= qq( <f name="upos">$upos</f>\n);
338 }
Marc Kupietz97ba2ba2021-10-11 17:55:47 +0200339 $morpho .= qq( <f name="lemma">$parsed[2]</f>\n) if($parsed[2] ne "_" || $parsed[1] eq '_');
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100340 $morpho .= qq( <f name="msd">$parsed[5]</f>\n) if($parsed[5] ne "_");
Akrondb3d0cb2026-06-03 15:53:57 +0200341 # Filter SpaceAfter from MISC column
342 if ($parsed[9] ne "_") {
343 my @misc_parts = grep { !/^Spaces?After/ } split(/\|/, $parsed[9]);
344 $parsed[9] = @misc_parts ? join('|', @misc_parts) : '_';
345 }
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100346 if($parsed[9] ne "_") {
347 if ($parsed[9] =~ /[0-9.e]+/) {
348 $morpho .= qq( <f name="certainty">$parsed[9]</f>\n)
349 }
350 else {
351 $morpho .= qq( <f name="misc">$parsed[9]</f>\n)
352 }
353 }
354 $morpho .= qq( </fs>
355 </f>
356 </fs>
357 </span>
358);
Akroncdabed82026-06-03 15:35:39 +0200359 # Collect token span for optional base/tokens.xml output
360 if ($base_tokens) {
361 push @token_spans, [$spansFrom[$t], $spansTo[$t]];
362 }
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100363 $i++;
Akronf3efc9e2026-06-03 10:46:37 +0200364 } else {
365 # Empty line = end of sentence
366 flush_dep_buffer();
367 if ($compute_offsets_mode) {
Akronf3efc9e2026-06-03 10:46:37 +0200368 $doc_offset += length($sentence_text) + 1;
369 @spansFrom = ();
370 @spansTo = ();
371 $compute_offsets_mode = 0;
372 }
373 $sentence_text = '';
Akron4f542622026-06-03 14:20:20 +0200374 record_sentence_struct();
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100375 }
376 }
Akron4f542622026-06-03 14:20:20 +0200377 # Flush last sentence if input lacks trailing empty line
378 record_sentence_struct();
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100379 $current .= "\n";
380 closeDoc(1);
Akron49f333b2022-09-27 17:03:49 +0200381 $zip->close() if $zip;
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100382 close($fh);
383}
384exit;
385
386sub newZipStream {
387 my ($fname) = @_;
388 if (defined $zip) {
389 $zip->newStream(Zip64 => 1, TextFlag => 1, Method => $_COMPRESSION_METHOD,
Marc Kupietz447f4752024-03-22 17:35:57 +0100390 Append => 1, Name => $fname, ExtAttr => 0100666 << 16)
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100391 or die "ERROR ('$fname'): zip failed: $ZipError\n";
392 } else {
393 $zip = new IO::Compress::Zip $outh, Zip64 => 1, TextFlag => 1,
Marc Kupietz447f4752024-03-22 17:35:57 +0100394 Method => $_COMPRESSION_METHOD, Append => 0, Name => "$fname", ExtAttr => 0100666 << 16
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100395 or die "ERROR ('$fname'): zip failed: $ZipError\n";
396 }
397}
398
Akronf3efc9e2026-06-03 10:46:37 +0200399# Write buffered dependency arcs now that all token offsets are resolved
400sub flush_dep_buffer {
401 foreach my $dep (@dep_buffer) {
402 my ($ds, $dt, $dhead, $dlabel) = @$dep;
403 $parse .= qq@<span id="s${ds}_n$dt" from="$spansFrom[$dt]" to="$spansTo[$dt]">
404<rel label="$dlabel">
405<span from="$spansFrom[$dhead]" to="$spansTo[$dhead]"/>
406</rel>
407</span>
408@;
409 }
410 @dep_buffer = ();
411}
412
Akron4f542622026-06-03 14:20:20 +0200413sub record_sentence_struct {
414 return unless $has_sent_ids && $current_sent_id && scalar @spansFrom > 0;
415 $sent_counter++;
416 push @sentence_spans, ["s$sent_counter", $spansFrom[0], $spansTo[0]];
417 if ($pending_newpar_id) {
418 if ($current_par_from >= 0 && $last_sent_to >= 0) {
419 $par_counter++;
420 push @paragraph_spans, ["p$par_counter", $current_par_from, $last_sent_to];
421 }
422 $current_par_from = $spansFrom[0];
423 $pending_newpar_id = '';
424 }
425 $last_sent_to = $spansTo[0];
426 $current_sent_id = '';
427}
428
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100429sub closeDoc {
Akronf3efc9e2026-06-03 10:46:37 +0200430 flush_dep_buffer();
Akron49f333b2022-09-27 17:03:49 +0200431 if ($write_morpho && $morpho_file) {
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100432 newZipStream($morpho_file);
433 $zip->print($morpho, qq( </spanList>\n</layer>\n));
434 }
Akron49f333b2022-09-27 17:03:49 +0200435 if ($write_syntax && $parser_file) {
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100436 $write_syntax = 0;
437 newZipStream($parser_file);
438 $zip->print($parse, qq(</spanList>\n</layer>\n));
439 }
Akron982dd1e2026-06-03 11:52:48 +0200440 if ($base_text && $filename && @doc_texts) {
441 my $text_dir = dirname($filename);
442 $text_dir =~ s@(.*)/[^/]+$@$1@;
443 my $data_path = "$text_dir/data.xml";
444 my $full_text = join(' ', @doc_texts);
445 $full_text =~ s/&/&amp;/g;
446 $full_text =~ s/</&lt;/g;
447 $full_text =~ s/>/&gt;/g;
448 newZipStream($data_path);
449 $zip->print(
450 qq(<?xml version="1.0" encoding="UTF-8"?>\n),
451 qq(<?xml-model href="text.rng" type="application/xml"),
452 qq( schematypens="http://relaxng.org/ns/structure/1.0"?>\n),
453 qq(<raw_text docid="$docid"),
454 qq( xmlns="http://ids-mannheim.de/ns/KorAP">\n),
455 qq(<text>$full_text</text>\n),
456 qq(</raw_text>\n)
457 );
458 @doc_texts = ();
459 }
Akroncdabed82026-06-03 15:35:39 +0200460 if ($base_tokens && $filename && @token_spans) {
461 my $text_dir = dirname($filename);
462 $text_dir =~ s@(.*)/[^/]+$@$1@;
463 my $tokens_path = "$text_dir/base/tokens.xml";
464 my $tokens_out = layer_header($docid);
465 for my $idx (0 .. $#token_spans) {
466 my ($from, $to) = @{$token_spans[$idx]};
467 $tokens_out .= qq( <span id="t_$idx" from="$from" to="$to"/>\n);
468 }
469 newZipStream($tokens_path);
470 $zip->print($tokens_out, qq(</spanList>\n</layer>\n));
471 }
Akron4f542622026-06-03 14:20:20 +0200472 if ($has_sent_ids && $filename) {
473 if ($current_par_from >= 0 && $last_sent_to >= 0) {
474 $par_counter++;
475 push @paragraph_spans, ["p$par_counter", $current_par_from, $last_sent_to];
476 }
477 my $text_dir = dirname($filename);
478 $text_dir =~ s@(.*)/[^/]+$@$1@;
479 my $struct_path = "$text_dir/base/struct.xml";
480 my $struct = layer_header($docid);
481 my @all_spans;
482 for my $span (@sentence_spans) {
483 push @all_spans, [$span->[0], $span->[1], $span->[2], 's'];
484 }
485 for my $span (@paragraph_spans) {
486 push @all_spans, [$span->[0], $span->[1], $span->[2], 'p'];
487 }
488 @all_spans = sort { $a->[1] <=> $b->[1] || $a->[2] <=> $b->[2] } @all_spans;
489 for my $span (@all_spans) {
490 my ($id, $from, $to, $name) = @$span;
491 $struct .= qq( <span id="$id" from="$from" to="$to">\n)
492 . qq( <fs type="struct" xmlns="http://www.tei-c.org/ns/1.0">\n)
493 . qq( <f name="name">$name</f>\n)
494 . qq( </fs>\n)
495 . qq( </span>\n);
496 }
497 newZipStream($struct_path);
498 $zip->print($struct, qq(</spanList>\n</layer>\n));
499 }
Marc Kupietz79ba1e52021-02-12 17:26:54 +0100500}
501
502sub layer_header {
503 my ($docid) = @_;
504 return(qq(<?xml version="1.0" encoding="UTF-8"?>
505<?xml-model href="span.rng" type="application/xml" schematypens="http://relaxng.org/ns/structure/1.0"?>
506<layer docid="$docid" xmlns="http://ids-mannheim.de/ns/KorAP" version="KorAP-0.4">
507<spanList>
508));
Marc Kupietzaeb84a02021-10-11 17:57:29 +0200509}
510
511=pod
512
513=encoding utf8
514
515=head1 NAME
516
517conllu2korapxml - Conversion of KorAP-XML CoNLL-U to KorAP-XML zips
518
519=head1 SYNOPSIS
520
521 conllu2korapxml < zca15.tree_tagger.conllu > zca15.tree_tagger.zip
522
523=head1 DESCRIPTION
524
525C<conllu2korapxml> converts CoNLL-U files that follow KorAP-specific comment conventions
526 and contain morphosyntactic and/or dependency annotations to
527 corresponding KorAP-XML zip files.
528
529=head1 INSTALLATION
530
531 $ cpanm https://github.com/KorAP/KorAP-XML-CoNLL-U.git
532
533=head1 OPTIONS
534
535=over 2
536
537=item B<--force-foundry|-f>
538
539Set foundry name and ignore foundry names in the input.
540
Akron8dabdc12026-06-02 16:36:07 +0200541=item B<--text-sigle|-s>
542
543Text sigle template with C<{ID}> placeholder for standard UD CoNLL-U
544input. When C<# newdoc id = E<lt>IDE<gt>> is encountered, C<{ID}> is
545replaced by the document id to derive the KorAP-XML text sigle,
546filename, and docid.
Marc Kupietzdd546a82024-03-22 16:30:09 +0100547
Akron982dd1e2026-06-03 11:52:48 +0200548=item B<--base-text>
549
550Generate a C<data.xml> file containing the reconstructed plain text
551of each document. The text is built from C<# text> comment lines
552in the CoNLL-U input, joined by single spaces.
553
Marc Kupietzaeb84a02021-10-11 17:57:29 +0200554=item B<--help|-h>
555
556Print help information.
557
558=item B<--version|-v>
559
560Print version information.
561
562
563=item B<--log|-l>
564
565Loglevel for I<Log::Any>. Defaults to C<warn>.
566
Marc Kupietz187abd72024-06-25 14:30:01 +0200567=item B<--output|-o>
568
569Output file. Defaults to C<-> (stdout).
570
Marc Kupietzaeb84a02021-10-11 17:57:29 +0200571=back
572
573=head1 EXAMPLES
574
575 conllu2korapxml -f tree_tagger < t/data/wdf19.morpho.conllu > wdf19.tree_tagger.zip
576
Marc Kupietzdd546a82024-03-22 16:30:09 +0100577 conllu2korapxml -f "tree_tagger dependency:malt" < t/data/wdf19.tt-malt.conllu > wdf19.tree_tagger.zip
578
Marc Kupietzaeb84a02021-10-11 17:57:29 +0200579=head1 COPYRIGHT AND LICENSE
580
Akron249fc832024-06-04 16:36:44 +0200581Copyright (C) 2021-2024, L<IDS Mannheim|https://www.ids-mannheim.de/>
Marc Kupietzaeb84a02021-10-11 17:57:29 +0200582
583Author: Marc Kupietz
584
585Contributors: Nils Diewald
586
587L<KorAP::XML::CoNNL-U> is developed as part of the L<KorAP|https://korap.ids-mannheim.de/>
588Corpus Analysis Platform at the
589L<Leibniz Institute for the German Language (IDS)|http://ids-mannheim.de/>,
590member of the
591L<Leibniz-Gemeinschaft|http://www.leibniz-gemeinschaft.de/>.
592
593This program is free software published under the
594L<BSD-2 License|https://opensource.org/licenses/BSD-2-Clause>.