Corpus MED.ITA lemmatizzato
CNR-Opera del Vocabolario Italiano
Guida ai contenuti


Il corpus MED.ITA-LEMM nasce con l’idea di sperimentare una lemmatizzazione integrale per tutte le forme di una selezione testuale del corpus MED.ITA, che si associa a una lemmatizzazione selettiva realizzata su un ulteriore campione dello stesso corpus. Quest’ultima è volta ad annotare prevalentemente tecnicismi, neologismi e prestiti, lessemi significativi per l’analisi lessicografica e per le indagini d’interesse storico: la selezione lessicale è valorizzata anche dall’iperlemmatizzazione, che associa i lemmi a categorie concettuali rappresentative degli ambiti socioculturali richiamati in maniera prevalente dai testi del corpus.

In totale gli iperlemmi sono 29 e convergono verso 13 macro-ambiti (agricoltura, animali, attività produttive, costruzioni e servizi, cultura materiale, diritto, economia, marineria, natura e paesaggio, politica, religione, territorio antropizzato, usi e costumi), articolati in iperlemmi più specifici quando necessario (es. economia, imposte; cultura materiale, misure).

Alla data della prima pubblicazione del corpus la lemmatizzazione integrale coinvolge 20 testi documentari dei secc. IX-XII prodotti in centri di scrittura diversi (di aree prevalentemente urbane) e coinvolge le parole lessicali, i nomi propri (antroponimi e toponimi) e le parole grammaticali. La lemmatizzazione selettiva è stata condotta, invece, su una selezione di documenti prodotti nell’area del Veneto lagunare e su un testo statutario toscano e le relative aggiunte seriori (Stat. San Gimignano, 1255 (tosc.) e Agg. stat. San Gimignano, 1292 (tosc.)).

Un intento importante della lemmatizzazione è tracciare lo spazio di tensione tra tradizione e innovazione in cui si colloca il vocabolario testuale. A questo scopo il campo “disambiguatore”, disponibile nella scheda di lemmatizzazione, è stato ampiamente utilizzato per distinguere i lemmi solo mediolatini (“mlat.”), annotando come innovazioni (etichetta: “innov. lessicale”) le voci non censite dalla tradizione lessicografica o presenti solo in singole raccolte, soprattutto di volgarismi. Oltre alle “innovazioni lessicali” sono state schedate anche le “innovazioni categoriali”, che coinvolgono ad esempio la lessicalizzazione di sostantivi da precedenti forme aggettivali (focacia ‑ae s.f. < focacius, ‑a, ‑um e salina ‑ae s.f. < salinus, ‑a, ‑um) e altri sviluppi che comportano cambi di categoria grammaticale. Le evoluzioni che investono il rapporto tra forma e funzione entro uno specifico paradigma sono schedate, invece, come “innovazioni morfologiche”: l’etichetta distingue, ad esempio, le forme di un sostantivo irrigidite per tutte le funzioni grammaticali (v. in particolare rebus, dativo-ablativo plurale di res rei, usato talora come femminile invariabile) e le forme piene della terza declinazione estese anche alla funzione Soggetto (è il caso di parte usato in sostituzione di pars).

 

Avvertenze per la consultazione

 

I principi seguiti nella lemmatizzazione del repertorio delle forme, le strategie che orientano la normalizzazione e i riferimenti lessicografici che hanno supportato la classificazione sono chiariti in maniera analitica in un saggio di Mariafrancesca Giuliani consultabile a questo link.

Si sintetizzano qui i criteri adoperati nella lemmatizzazione delle classi variabili del discorso per agevolarne la ricerca.

Nella stringa del lemma utilizzata per i sostantivi si associa alla forma del nominativo il genitivo corrispondente (indicato di seguito, in forma abbreviata, senza la virgola), secondo l’uso proprio dei lessici latini, confermato anche dal Mittellateinisches Wörterbuch: abbas ‑atis, aestimatio ‑onis, blava ‑ae, ballatorium ‑ii, carcamen ‑inis, crux crucis ecc. I prestiti e i neologismi mediolatini sono stati lemmatizzati senza indicarne il genitivo se compaiono nei testi e nei lessici in forma invariabile per qualsiasi funzione: v. ad es. habere s.n. e interesse s.n., forme sostantivate dei verbi corrispondenti, sculdais s.m., longobardismo, e inoltre la forma irrigidita rebus s.f. (v. supra) Nelle ricerche si consiglia, pertanto, di integrare con l’asterisco la stringa corrispondente al nominativo del sostantivo di cui si cercano le possibili occorrenze (ad es. abbas*).

I verbi, invece, sono stati lemmatizzati all’infinito secondo il modello consueto nella lessicografia delle lingue romanze, già proposto stabilmente, nell’ambito della lessicografia mediolatina, dal Niermeyer.

Gli aggettivi sono lemmatizzati secondo la forma di citazione del maschile e lo stesso vale per i numerali ordinali (primus, secundus, ecc.) e per i determinanti e pronomi possessivi, indefiniti, interrogativi, così come per il dimostrativo hic, haec, hoc.

Sono lemmatizzati secondo il genere gli elementi grammaticali utilizzati solo come pronomi: l’interrogativo quis, quid (anche nei composti come quisnam ed ecquis), e il relativo qui, quae, quod, talora utilizzato, tuttavia, come “forma invariabile” (etichetta introdotta nel disambiguatore che distingue, ad es., il relativo qui accordato con un sostantivo maschile, dal relativo qui indifferente all’accordo di genere). La distinzione secondo il genere è utilizzata anche per is, ea, id; ille, illa, illud; ipse, ipsa, ipsum; iste, ista, istud che sono classificati come dimostrativi (dim.) quando occorrono come aggettivi, ma sono marcati convenzionalmente come personali (pers.) quando hanno funzione pronominale, prefigurando un regime d’uso correlato alla rappresentazione della terza persona plurale e singolare, valorizzato da alcuni sviluppi romanzi. Le forme del pronome personale di prima e seconda persona plurale sono state riportate a lemma in forma normalizzata (per cui, ad es., la grafa michi è associata al lemma mihi).

Gli antroponimi e i toponimi sono lemmatizzati secondo la forma del nominativo nota o ipotizzabile con un alto margine di certezza, oppure secondo quella ricostruita nei principali studi di riferimento. Nei casi dubbi si adotta come lemma la forma documentata nei testi. Il repertorio delle forme toponomastiche include in realtà anche alcune denominazioni (tipiche della microtoponomastica) articolate in forma polirematica (v. ad es. in loco qui dicitur Montis Rothari e in locum qui appellatur Pantano Maio(re)) i cui componenti sono stati lemmatizzati singolarmente, con l’intento di registrare come rappresentazioni lessicali anche le occorrenze di parole utilizzate con funzione onomastica. Indicazioni di dettaglio relative agli usi onomastici (e alla forma del lemma scelto) sono state inserite nel campo “disambiguatore”, mentre il campo “commento” è stato utilizzato per i rinvii bibliografici che sono stati ritenuti utili come riferimento per la normalizzazione degli antroponimi d’origine germanica.

Sono state segnalate in lemmatizzazione le ambiguità grammaticali e testuali (a.g. e a.t.) e le grafie alternative (g.a.), indicando con questa categoria soprattutto le scrizioni continue di alcuni sintagmi (ad es. imperpetuum) e le varianti graficamente scisse di forme lessicali erroneamente interpretate dagli scriventi come somma di due componenti (ad es. at que = atque). Per le grafie scisse di lemmi (schedati come tali dai lessici latini e mediolatini) le cui parti siano parole funzionali (v., ad es., in antea per inantea e de super per desuper) si è fatto ricorso, nel disambiguatore, all’etichetta “polir.”, utile a chiarire che i singoli morfemi schedati compongono unità lessicali realizzate secondo una scrizione “polirematica”. Queste etichette, così come alcune delle marche prima menzionate (v. a.g. e a.t.) richiamano prassi già ben sperimentate nella lemmatizzazione del Corpus TLIO.

La lista delle categorie ammesse, coincidenti in grossa misura con quelle utilizzate per la lemmatizzazione del Corpus TLIO, è riportata nella tabella seguente. Si indicano anche le corrispondenze con i tag del sistema Universal Dependencies – a cui si rapporta anche la base di conoscenza testuale Linking Latin (https://lila-erc.eu/#page-top) – fondato sulla distinzione delle parti del discorso (P(arts) O(f) S(peech)) rinconosciute in tutte le lingue naturali:

 

Categoria grammaticale TLIO

UD / LiLa POStags

 

 

a.g. = ambiguità grammaticale

 

a.t. = ambiguità testuale

 

g.a. = grafia alternativa

 

volg. = volgare, volgarismo

 

agg. = aggettivo     

adjective

avv. = avverbio

adverb

cong. = congiunzione

coordinating conjunction / subordinating conjunction

dim. = aggettivo / pronome dimostrativo

determiner / pronoun

escl. = esclamazione

Interjection

indef. = aggettivo / pronome indefinito

determiner / pronoun

interr. = aggettivo / pronome interrogativo

determiner / pronoun

n.p. = nome proprio

proper name

num. = numerale

numeral

pers. = pronome personale

pronoun

poss. = aggettivo / pronome possessivo

determiner / pronoun

prep. = preposizione

adposition

rel. = pronome relativo

pronoun

s.f. = sostantivo femminile

common noun

s.i. = sostantivo di genere incerto

common noun

s.m. = sostantivo maschile

common noun

s.n. = sostantivo neutro

common noun

v. = verbo

verb

 

 

Crediti

Il corpus MED.ITA-LEMM è il secondo modulo testuale creato nel quadro del PRIN 2022 MEDITA – Medieval Latin Documentation and Digital Italo-Romance Lexicography. Integrated Resources for the New Historical and Etymological Lexicography (codice progetto: 20227CHRR) promosso congiuntamente dall’Università di Napoli Federico II (P.I.: Paolo Greco), dall’Università Ca’ Foscari Venezia (responsabile: Alessio Cotugno) e dall’OVI-CNR (responsabile: Mariafrancesca Giuliani).

La lemmatizzazione è il frutto di un lavoro collettivo a cui hanno contribuito su singoli testi Fabio Aprea, Elisa D’Argenio (Università Ca’ Foscari Venezia), Bianca De Vivo, Anna Fava, Jacopo Gesiot e Mariafrancesca Giuliani; quest’ultima ha coordinato l’intero processo e omogeneizzato l’insieme dei risultati.

La lemmatizzazione selettiva e l’iperlemmatizzazione è stata curata da Fabio Aprea e Jacopo Gesiot (con la supervisione di Mariafrancesca Giuliani), autori di un contributo digitale che descrive il workflow, i criteri seguiti e le categorie distinte (https://serena.sharepress.it/RiDESN/article/view/13822/13826).

Il responsabile informatico del corpus è Andrea Boccellari (boccellari@ovi.cnr.it).

Per informazioni o segnalazioni scrivere a Mariafrancesca Giuliani (giuliani@ovi.cnr.it)