Theses

Research and project theses since 2021 for bachelor and master degrees focused on cutting-edge NLP solutions.

Bachelor Theses 84

2026

Interpretare i Soft Prompts: Analisi delle Tecniche di Parameter-Efficient Fine-Tuning per il Biomedical NER

Botti Bao

Supervisor
Gianluca Moro
Co-supervisors
Stefano Fantazzini
Abstract

L’attuale panorama del Natural Language Processing è caratterizzato dalla predominanza dei Large Language Models, il cui utilizzo in domini specifici è spesso limitato dagli ingenti costi computazionali del fine-tuning. Nel settore biomedico, l'uso di Pre-Trained Launguage Models (PLMs) di tipo encoder-only, come BioBERT, rappresentano lo standard di riferimento grazie alle loro performance nei task specialistici, come il Biomedical Named Entity Recognition (BioNER). Questa tesi valuta l'efficacia di tecniche Parameter-Efficient Fine-Tuning, in particolare Prompt Tuning e Prefix Tuning, per l'addestramendo di PLMs congelati. Tale approccio riduce i parametri addestrabili a meno dello 0.1%, offrendo una significativa efficienza in termini di GPU e tempo di esecuzione, senza compromettere i risultati finali rispetto al full fine-tuning.
Sperimentazioni sui dataset AnatEM, JNLPBA e BC5CDR, valutate con metriche span-based, mostrano prestazioni superiori del Prefix Tuning, che raggiunge un Micro Avg F1-Score di 0.8695 (+ 0.02 punti di differenza rispetto al full fine-tuning) con backbone BioBERT v1.1. Infine, si analizza l'interpretabilità dei token virtuali appresi: tramite proiezioni geometriche, Principal Component Analysis e t-distributed Stochastic Neighbor Embedding, e tecniche di reverse embedding nel vocabolario, si può osservare come i soft prompt acquisiscano una specializzazione funzionale nel dominio biomedico. Lo studio conferma che, anche in ambiti molto specifici, come BioNER, le tecniche di Automatic Prompt Learning rimangono una soluzione efficiente, sostenibile e scalabile.

OrienterAI: An Efficient Hybrid RAG Chatbot for Orienting Citizens Toward the Emilia-Romagna Educational Offer

Elena Fucci

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta
Abstract

This thesis presents OrienterAI, a hybrid Retrieval-Augmented Generation (RAG) chatbot designed to help citizens navigate the vocational training catalogue of the Emilia-Romagna region. Large Language Models (LLMs) have made it possible to query specialized knowledge bases in natural language, with RAG techniques grounding answers in real documents to mitigate hallucination; yet public-sector catalogues list thousands of active courses across cities, sectors, and qualification levels, making it difficult to identify offerings that match a user's profile and eligibility constraints such as EQF level, minimum age, and target audience without expert guidance. OrienterAI addresses this problem through two main components. First, an LLM-based extraction module normalizes free-text course descriptions into structured fields such as EQF level, minimum age, required skills, and macro-sector. Second, a four-stage cascaded retrieval pipeline progressively relaxes geographic and topical filters before falling back to semantic search over a Milvus vector database indexed with BGE-M3 embeddings, followed by a generation stage that renders the most relevant courses while minimizing fabricated content. The system was evaluated on a catalogue of more than 15,000 active courses and a benchmark of 250 synthetic queries spanning five complexity levels, using Accuracy@k, NDCG@k, and Precision@k as ranking metrics. End-to-end evaluation yields a Precision@1 of 0.768, an Accuracy@10 of 0.876, and an NDCG@10 of 0.798, while sustaining acceptable latency on a single NVIDIA RTX 3090 GPU. These results confirm the viability of an efficient, domain-specific RAG approach for public-sector information access and point to a scalable model for similar multilingual catalogues.

Latent-GEPA: Accelerating Prompt Optimization via Embedding Inversion and Latent Semantic Guidance in Large Language Models

Simone Mazzacano

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta, Stefano Fantazzini
Abstract

Modern language models expose many representations besides their final text:
embeddings, hidden states, logits, residual streams, and other latent signals
are now used for retrieval, interpretability, inversion, and automatic evalua-
tion. A central question is whether methods that map these representations
back to natural language preserve the semantic content of the original input,
or whether they merely produce fluent and plausible text. This distinction
matters especially for inputs involving negation, logical polarity, counterfactual
statements, or violations of commonsense, where a reconstruction can remain
lexically similar while changing the meaning.
The analysis focuses on semantic fidelity in latent-to-text methods and on
whether activation-derived evidence can improve prompt optimization for LLM-
as-a-judge evaluation. It combines the construction of a new Semantic-Fidelity
Corpus, diagnostic experiments on inversion and verbalization methods, and an
LLM-as-a-judge evaluation pipeline optimized with GEPA. The method can be
summarized as a two-track analysis: first, latent representations are inverted
or verbalized and checked for semantic preservation; second, perplexity and
activation verbalizations are tested as signals for improving judge prompts.
The experimental setup uses semantic-stress examples, hidden-state inver-
sion diagnostics, activation verbalizations from a base language model, and
LLM-as-a-judge datasets evaluated with correlation metrics against human
judgments. Early results show that perplexity feedback can improve GEPA
prompt optimization in this setting. Together, the findings characterize seman-
tic fidelity empirically and test how activation information can be made useful
for downstream evaluation.

Evaluating Visual Grounding in Multimodal Large Language Models for Medical Question Answering

Riccardo Balzani

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Stefano Fantazzini
Abstract

Vision-Language Models (VLMs) for medical VQA are often limited by "black-box" reasoning and hallucinations. Furthermore, standard metrics like Exact Match fail to capture medical semantic nuances. This thesis introduces a modular Visual Grounding pipeline that localizes Regions of Interest (RoIs) before answer generation. The pipeline integrates biomedical NER, cross-modal attention (BiomedCLIP + gScoreCAM), and Intelligent Prompt Injection to provide spatial context to the VLM. Evaluated on MIMIC-CXR-Ext and GEMeX using MedGemma and OctoMed models, the framework improved diagnostic accuracy by 21 percentage points and ROUGE-1 by 5.2×. An LLM-as-a-Judge evaluation further revealed that 66.81% of responses were clinically correct, far exceeding what string-based metrics suggest. These results demonstrate a path toward more transparent and trustworthy AI-assisted diagnostics.

2025

Modelli predittivi per il rischio di default e l'analisi settoriale su dati finanziari dell'euro zona

Cristian Morbidelli

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Giovanni Pio Delvecchio
Abstract

Questa tesi esplora l’impiego di tecniche di apprendimento automatico per l’analisi delle imprese, con particolare attenzione alla valutazione della loro solidità finanziaria e alla comprensione delle dinamiche settoriali.
Attraverso l’utilizzo di dati provenienti dal database Orbis, comprendenti informazioni anagrafiche e bilanci economico-finanziari, il lavoro propone un approccio quantitativo volto a individuare pattern ricorrenti e segnali predittivi legati allo stato di salute delle aziende.
L’analisi si inserisce nel più ampio contesto della modellazione del rischio e della classificazione economica, con l’obiettivo di integrare metodologie statistiche tradizionali e strumenti di machine learning in un quadro interpretativo coerente.
L’attenzione non è posta unicamente sull’accuratezza predittiva, ma anche sulla trasparenza dei modelli e sulla possibilità di comprendere i fattori che determinano il successo o il fallimento di un’impresa, requisito fondamentale in ambito economico-finanziario.
Oltre alla componente predittiva, viene affrontata un’analisi non supervisionata che mira a rilevare somiglianze strutturali tra le aziende e a delineare gruppi omogenei in termini di caratteristiche contabili.
Questa prospettiva complementare permette di osservare il tessuto imprenditoriale in modo più organico, evidenziando la presenza di cluster economici coerenti con le categorie ufficiali.

Ragionamento visivo nei large language model multimodali per la risoluzione di puzzle scacchistici

Andrea Samorì

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Nel mondo dell’intelligenza artificiale applicata agli scacchi, i Large Language
Model (LLM) rappresentano una nuova strada da esplorare grazie alle loro
capacità di analizzare e comprendere il testo. Il legame tra LLM e gli scacchi è
reso possibile dalle varie notazioni testuali, come la Portable Game Notation e
la Forsyth–Edwards Notation, con cui possono essere rappresentate le partite.
Un’evoluzione dei LLM sono i Multimodal Large Language Model (MLLM), i
quali possono analizzare non solo input testuali, ma anche informazioni in altre
modalità, come immagini o audio. Ad oggi, la ricerca si è concentrata sullo
sviluppo di Chess Language Models (CLM), cioè LLM in grado di comprendere
il dominio degli scacchi. Mentre i CLM sono unicamente allenati tramite
testo, in questo lavoro esploriamo l’applicazione dei MLLM per la risoluzione
di puzzle scacchistici, utilizzando anche le immagini della scacchiera come
dati per l’allenamento. Il metodo proposto consiste nel allenare, tramite
Reinforcement Learning (RL), un MLLM in grado di generare, dato lo stato
della scacchiera (sia in formato testuale che tramite l’immagine), la prossima
mossa che porterebbe più vicino alla soluzione del puzzle. Vengono proposte due
tipologie diverse di allenamento: il Supervised Fine-Tuning e il Group Relative
Policy Optimization. Il modello utilizzato come base per gli allenamenti è
Gemma 3, ad oggi l’ultimo modello multimodale proposto da Google. Il dataset
esplorato in questo lavoro comprende puzzle reali estratti dalla piattaforma
open-source Lichess, valorizzati con immagini della scacchiera per valutare
l’importanza della multimodalità. Gli esperimenti effettuati dimostrano che,
dopo una fase di allenamento mirato alla generazione della prossima mossa
migliore per la risoluzione del puzzle, un MLLM a cui sono fornite anche le
immagini della scacchiera, mostra performance migliori rispetto ad un modello
allenato unicamente sul testo.

Guidare i Large Language Models nell'Estrazione di Informazioni da Database mediante Query SQL Automatizzate e Model Context Protocol

Daniele Merighi

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta
Abstract

L'interazione tra modelli linguistici di grandi dimensioni e database relazionali mediante linguaggio naturale costituisce una sfida critica per sistemi intelligenti. Le prestazioni degradano drammaticamente quando le tabelle superano determinate soglie: l'inclusione diretta satura la finestra di contesto, mentre approcci basati su recupero selettivo introducono dipendenza dalla qualità dell'estrazione. Questa tesi affronta una questione fondamentale: quando le tabelle diventano troppo grandi per essere incluse nel prompt, quali strategie alternative sono più efficaci? La ricerca caratterizza empiricamente le soglie dimensionali che determinano il passaggio tra approcci. Viene implementata un'architettura basata su Model Context Protocol che permette al modello di interrogare tabelle tramite strumenti specializzati: ispezione della struttura, esecuzione controllata di query, campionamento esplorativo e sintesi statistica. Il sistema garantisce sicurezza mediante isolamento delle operazioni e compatibilità attraverso rilevamento automatico delle capacità native del modello. I risultati sperimentali su dataset stratificato di 450 esempi, distribuiti tra sei tipologie di compito e tre fasce dimensionali, rivelano pattern differenziati. Gli approcci basati su strumenti esterni ottengono miglioramenti significativi su tabelle grandi oltre duemila celle e su compiti orientati a interrogazioni strutturate come Table Question Answering. Questo elaborato contribuisce alla dimostrazione che l'efficacia delle strategie dipende congiuntamente dalla scala dimensionale e dalla natura del compito. Il contributo metodologico consiste nell'identificazione empirica di soglie oltre le quali l'inclusione diretta degrada sistematicamente, fornendo linee guida per rilascio in produzione. La ricerca dimostra che la scelta ottimale richiede instradamento adattivo basato su caratteristiche osservabili della query e della tabella.

Studio Comparativo di Modelli Avanzati per la Predizione del Rendimento di Titoli Azionari

Manuele D'Ambrosio

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Giovanni Pio Delvecchio
Abstract

Negli ultimi anni, l’evoluzione dei modelli di intelligenza artificiale ha profondamente influenzato il campo dell’analisi quantitativa e della previsione dei mercati finanziari. Questa tesi analizza e confronta diversi approcci di machine learning applicati alla previsione dei rendimenti azionari, con particolare attenzione ai modelli di nuova generazione basati su architetture Transformer e Large Language Models (LLM).

Lo studio prende in esame quattro modelli principali: XGBoost, LSTM, MASTER e ChronosX. I primi due rappresentano metodologie consolidate nella letteratura, mentre i secondi due incarnano approcci innovativi che mirano a sfruttare le più recenti evoluzioni dell’intelligenza artificiale. Tutti i modelli sono stati addestrati e valutati su quattro dataset costruiti a partire da indici di riferimento internazionali, al fine di analizzare la loro capacità di generalizzazione su mercati con caratteristiche strutturali e comportamentali differenti.

I risultati sperimentali evidenziano come, in generale, i modelli di intelligenza artificiale incontrino difficoltà nel catturare la complessità e la dinamicità del mercato azionario. Tuttavia, il modello MASTER ha mostrato le migliori prestazioni complessive, distinguendosi per costanza e affidabilità su tutti i dataset analizzati. I modelli XGBoost e LSTM si sono dimostrati efficaci solo parzialmente, con risultati fortemente dipendenti dai dati di input. Al contrario, i modelli della famiglia ChronosX, basati su LLM, non hanno raggiunto risultati soddisfacenti, evidenziando la necessità di ulteriori sviluppi teorici e sperimentali.

Creazione di una pipeline di acquisizione continua di report sec Edgar per analisi finanziarie basate su machine learning

Federico Morsucci

Supervisor
Gianluca Moro
Co-supervisors
Giovanni Pio Delvecchio, Giacomo Frisoni
Abstract

Questo lavoro propone un approccio per affrontare la raccolta, strutturazione e aggiornamento automatico dei dati finanziari provenienti dai filing pubblicati dalla Securities and Exchange Commission (SEC) attraverso la piattaforma EDGAR, una delle principali fonti informative per l’analisi economico-finanziaria delle imprese quotate.
La crescente disponibilità di dati digitali rende infatti possibile lo sviluppo di modelli predittivi sempre più sofisticati, ma richiede al contempo infrastrutture di acquisizione affidabili, scalabili e capaci di garantire la qualità e la coerenza delle informazioni nel tempo.

L’obiettivo di questo lavoro è la progettazione e implementazione di una pipeline di acquisizione continua capace di estrarre automaticamente i documenti SEC, analizzarne la struttura, normalizzare i contenuti contabili e archiviarli in un formato coerente e prontamente utilizzabile per applicazioni di machine learning.
La pipeline è stata realizzata con un’architettura modulare e automatizzata che consente la gestione incrementale dei dati e integra procedure di controllo di qualità, sebbene con alcune limitazioni in termini di efficienza operativa e copertura dei filing più complessi.

Il dataset generato rappresenta una base informativa solida e aggiornabile, sulla quale sono stati condotti esperimenti esplorativi di previsione del default aziendale e classificazione settoriale.
Tali esperimenti hanno avuto lo scopo di validare la consistenza e l’utilizzabilità dei dati, dimostrando che anche una pipeline sperimentale può produrre un archivio informativo sufficientemente ricco da supportare modelli predittivi affidabili e analisi quantitative di rischio.

In conclusione, il lavoro propone un contributo metodologico e tecnico per la costruzione di dataset finanziari standardizzati e replicabili, offrendo una base concreta per futuri sviluppi.

Development of a Retrieval-Enhanced Chatbot for the Italian Workplace Safety Regulation in Low-Resource Settings

Weijie Fu

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Davide Freddi
Abstract

Hallucination remains a major challenge when applying large pretrained language models to specialized domains such as legal or regulatory text. In contexts like Italian workplace safety regulations, unreliable or unsupported responses can lead to serious consequences. To address this issue while maintaining efficiency in low-resource environments, this thesis presents the design, implementation, and evaluation of a retrieval-enhanced chatbot tailored to Italian workplace safety regulations, optimized for low-resource deployment scenarios. The proposed system couples a compact pretrained language model with a document retriever so that generated responses are grounded in official regulatory texts and can include explicit citations.
To validate the idea, we compare the chatbot's performance with and without the retriever using multiple-choice question benchmarks derived from workplace safety regulation materials. The results indicate that, while language models contain some latent knowledge of the domain, the retrieval-augmented configuration consistently yields higher accuracy and more reliability. We also attempt to fine-tune the retriever to improve recall; however, the off-the-shelf retriever is already strong, and fine-tuning produces negligible gains.
These findings confirm that retrieval augmentation can substantially improve the reliability and accuracy of language models in specialized, low-resource regulatory domains.

Obduracy: Fine-Tuning at What Cost? Evaluating Specialization Rigidity, Catastrophic Forgetting and Decoding Variability in Large Language Models

Nicolò Morini

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta
Abstract

Fine-tuning Large Language Models to specialize them for downstream tasks is a standard practice, but it often leads to catastrophic forgetting, a significant degradation of their general knowledge. Existing evaluation methods typically quantify this phenomenon by measuring performance drops on academic benchmarks, an approach that captures the symptoms but not the underlying cause. These metrics often fail to characterize a more fundamental behavioral shift: an increase in specialization rigidity, where the model loses its generative flexibility and becomes overly deterministic.

To address this evaluation gap, we introduce Obduracy, a novel composite metric designed to provide a holistic measure of this brittleness. Our approach integrates multiple dimensions of model behavior into a single score. It combines established continual learning metrics that quantify catastrophic forgetting (Backward Transfer) and performance degradation (Forgetting Measure) with a direct measure of behavioral rigidity. This behavioral component, which we term Format Spread, assesses the model's sensitivity to variations in prompt formatting.

We apply this composite metric to analyze models fine-tuned with various state-of-the-art strategies, including Supervised Fine-Tuning and preference-based trainers like Generalized Ratio Policy Optimization and Generalized Sigmoid Policy Optimization. We show that a high Obduracy score, indicating high overall brittleness, correlates with more severe performance drops on general knowledge benchmarks. These results confirm that Obduracy offers a more nuanced understanding of the true costs of fine-tuning, providing a valuable tool for researchers to evaluate the multi-faceted impact of different specialization techniques.

Migliorare le Prestazioni dei Large Language Models nella Traduzione delle Lingue Sottorappresentate mediante Knowledge Graph e Wordnet

Giacomo Casadei

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta

Controllable Question Answering through Learned Representations: A Sparse Autoencoder Approach to LLM Steering

Giacomo Arienti

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Large Language Models (LLMs) are central to open-domain Question Answering (QA), but their lack of interpretability and controllability poses critical challenges. Steering methods such as prompting, fine-tuning, and representation engineering have been explored, while Sparse Autoencoders (SAEs) offer a way to uncover latent features that can be directly manipulated. However, SAE-based approaches still require manual work in feature selection and factor tuning, and often yield unreliable interventions. Our KL-divergence analysis shows that steering multiple features without coordination causes activations to diverge from the base model distribution, explaining the focus on single-feature interventions in prior work.

We propose a training pipeline that automates feature selection and enables coordinated multi-feature steering. SAE features are annotated with concise descriptions via logit-lens analysis, and a similarity model aligns QA prompts with these descriptions for automatic retrieval. Calibrated intervention factors then balance contributions across features, avoiding instability and mitigating divergence. Reinforcement-guided optimization further balances fluency, factuality, and concept coverage while avoiding costly fine-tuning, enabling scalable and interpretable control over LLM behavior.

Experiments show that the steered model achieves higher truthfulness, stronger concept alignment, and better containment of reference information compared to the baseline, while maintaining fluency with only minor reductions in lexical diversity. Qualitative analysis demonstrates that multi-feature steering corrects baseline failures by aligning generations with intended semantics, an effect rarely achieved by single-feature interventions. These results confirm that SAE-based representation steering, combined with automated selection and calibrated reinforcement, provides a principled path toward controllable QA.

GRPO4Chess: Improving Next Move Generation in Chess Language Models via Reinforcement Learning

Francesco Teo Calzolari

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta, Davide Freddi
Abstract

In recent decades, chess has served as a cornerstone for artificial intelligence research, from DeepBlue’s 1997 victory over Garry Kasparov to the dominance of engines such as Stockfish and Leela Chess Zero. While these systems rely on brute-force search and carefully engineered evaluations, a new line of research treats chess as a symbolic language to be modeled and generated.
However, current chess language models frequently produce illegal Standard Algebraic Notation (SAN), such as invalid moves or false checkmates, which undermines their reliability.
This thesis addresses this challenge by training a chess language model with reinforcement learning (RL) using Group Relative Policy Optimization (GRPO). The training corpus consists of elite over-the-board and online games by grandmasters including Magnus Carlsen and Hikaru Nakamura. We design and evaluate reward functions at two levels: syntax-focused rewards, which only assess the formal correctness of SAN, and board-based rewards, which verify whether moves are executable within the actual game state.
Our experiments show that GRPO substantially reduces the frequency of illegal moves, with the best-performing models trained under board-based rewards. These models exhibit improved board consistency but also a higher draw rate and reduced win rate. Compared to a supervised fine-tuned (SFT) trained model, GRPO training achieves superior legality but lower playing strength. Applying GRPO on top of SFT further increases legality, though the win rate remains below the base model.
Overall, this work demonstrates that RL can significantly improve the syntactic and semantic validity of chess language models, though a trade-off emerges between move legality and competitive performance.

OpenBioNER-MoE: Mixture of Domain-Specific Encoders for Zero-Shot Biomedical Named Entity Recognition

Gabriel Stira

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Giacomo Frisoni

Integrazione di Agenti Conversazionali e Large Language Models per la Gestione Automatizzata dei Ticket di Help Desk Aziendali

Gianluca Consoli

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta

Benchmarking e Adapter Fine-tuning di Large Language Model nella Risoluzione di Quesiti sul Programma di Sviluppo Rurale Italiano

Giovanni Muccioli

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

L'intelligenza artificiale (IA) è oggi riconosciuta come una tecnologia capace di trasformare profondamente numerosi settori. Tuttavia, la sua applicazione in ambiti tradizionalmente percepiti distanti dall'innovazione tecnologica, come quello normativo e agricolo, può risultare controintuitiva. Eppure, l'IA, grazie ai Large Language Models (LLM), si dimostra in grado di affrontare tematiche altamente specialistiche, supportando l'analisi, la comprensione e la gestione di normative e bandi nel dominio agricolo.

Il lavoro di tesi si inserisce in tale contesto, concentrandosi sull'utilizzo dei LLM per il Programma di Sviluppo Rurale (PSR) italiano della regione Emilia-Romagna. Il PSR rappresenta un insieme articolato di normative, bandi e requisiti tecnico-amministrativi rivolti a soggetti del settore primario, offrendo loro finanziamenti e supporto. La sua complessità e il livello di dettaglio rendono però spesso difficile accedere facilmente alle informazioni di interesse.
In questo scenario, il lavoro propone l'uso di LLM assieme a specifiche tecniche come il Parameter-Efficient Fine-Tuning (PEFT) e il Prompt Engineering per sviluppare un approccio innovativo alla creazione di componenti intelligenti, capaci di comprendere e rispondere a quesiti in linguaggio naturale. Questi strumenti costituiscono la base per assistenti conversazionali specializzati e adattati al dominio normativo-agricolo in questione, con l'obiettivo di facilitare l'accesso alle informazioni e rendere più immediata e inclusiva la fruizione delle opportunità offerte dal PSR.

A testimonianza di quanto svolto, è stata condotta un'attività di benchmarking per valutare le prestazioni del modello addestrato che ha raggiunto un'accuratezza massima del 96,13% e miglioramenti superiori al 15-20% su diversi indicatori di performance, confermando l'efficacia dell'approccio proposto.

Multimodal Generative Information Retrieval of Chest X-Rays Grounded on ICD-9 Taxonomy

Margherita Raponi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

The International Classification of Diseases (ICD) is a World Health Organisation standardised system for coding diagnoses and medical procedures. Automatic ICD coding assigns codes to clinical documentation but is a complex task due to hierarchical taxonomies, multiple comorbidities, and semantic gaps between clinical language and standardised codes.

Existing solutions employ either retrieval-based approaches, which match clinical text to code databases using attention mechanisms and external knowledge, or generative methods that directly produce ICD codes as textual outputs through large language models. Current approaches face critical limitations: error traceability and domain guardrailing. Existing systems provide direct code assignments without exposing hierarchical reasoning paths, while generative models frequently produce codes from unintended taxonomic versions despite explicit constraints.

We address these limitations by introducing the first hybrid retrieval-generative model for ICD coding that approaches the task as a hierarchical generative process. Our method utilises the ICD taxonomic tree structure to guide predictions, ensuring domain adherence while providing explicit hierarchical reasoning paths.

We train our hybrid model using a custom dataset built from MIMIC-CXR JPG and MIMIC-IV, where inputs are radiology reports and chest X-ray images, and outputs are hierarchical ICD code sequences. Performance is evaluated using Recall@K and Mean Reciprocal Rank metrics.

Our hybrid approach demonstrates strong performance enhancing explainability through hierarchical retrieval, with cluster matching analysis confirming the model's ability to maintain coherent relationships within the ICD taxonomy. These results challenge conventional retrieval and generative models in specialised medical domains and establish our approach's effectiveness for automatic ICD coding applications.

A Systematic Review on Automatic Prompt Learning

Mario Ciccioni

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Luca Ragazzi
Abstract

Prompts direct the behavior of a model by conditioning its outputs on carefully designed instructions and examples, similar to setting the trajectory of an arrow before release.
In a broader sense, prompt learning is the research area that aims to solve downstream tasks by directly leveraging the knowledge acquired by language models at pre-training time, removing the necessity for costly fine-tuning stages with potentially different objective functions.
While manual prompt engineering has enabled both small and large language models to achieve superhuman performance on various benchmarks, it remains a demanding and less-than-ideal method. Recently, the field has shifted towards automating the search for prompts that effectively elicit the desired model responses.
In this thesis we presents a systematic review of prompt learning for pre-trained language models operating on textual inputs, with a particular focus on automatic methods.
We critically analyze existing publications and organize them into a novel taxonomy, highlighting essential elements for practical application.
We also performed practical experiments and performed performance tests applying the best automatic prompt learning techniques.
Finally, we discussed promising directions for future research.
Our curated repository of annotated papers, continuously updated, is available at https://github.com/disi-unibo-nlp/awesome-prompt-learning.

Legal Lay Summarization: Exploring Techniques and Introducing the LegalEase Dataset

Leonardo David Matteo Magnani

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi
Abstract

This thesis investigates advancements in Natural Language Processing (NLP) for legal lay summarization by systematically analyzing the methodologies, datasets, and research findings presented in existing publications. The study reviews the current literature in the field, highlighting challenges in legal summarization, such as data scarcity and the complexity of legal language. A key contribution of this work is the creation of a specialized dataset, \textbf{LegalEase}, which is specifically designed to enhance model training for summarizing legal documents in layman’s terms.
Key findings demonstrate that subdomain-specific datasets within the legal domain outperform more general legal domain datasets in enhancing the performance of NLP models in generating accurate and comprehensible legal summaries. The results presented in this thesis offer valuable insights and methodologies for future advancements in legal lay summarization.

Tecniche di Machine Learning per la gestione e il monitoraggio delle emissioni odorigene negli allevamenti avicoli

Francesco Filippini

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi
Abstract

Nel settore avicolo, la gestione delle emissioni odorigene rappresenta una sfida cruciale per ridurre l’impatto ambientale e garantire il rispetto delle normative vigenti. Non sono infatti rari i casi di azioni legali contro i titolari di allevamenti avicoli ritenuti responsabili di emissioni odorigene eccessive, con conseguenti sanzioni e restrizioni operative. Questo lavoro di tesi, svolto presso VEM Sistemi S.p.A., ha l’obiettivo di esplorare il potenziale del Machine Learning nell’utilizzo quotidiano per ottimizzare alcune strategie aziendali, con particolare attenzione alla gestione sostenibile degli allevamenti. L’attività ha previsto la raccolta, il preprocessing e l’analisi di dati ambientali acquisiti da sensori installati presso un allevamento avicolo. Successivamente, sono stati addestrati modelli di regressione e classificazione per prevedere le concentrazioni di odori derivanti dall’allevamento, in funzione di variabili meteorologiche e di qualità dell’aria. Il lavoro descritto in seguito si concentra principalmente sulla realizzazione di un progetto aziendale, rappresentando però un primo passo per dimostrare il potenziale rivoluzionario del Machine Learning nell’ottimizzazione dei processi di management strategico. Sono stati testati diversi algoritmi, soprattutto modelli di apprendimento supervisionato, tra cui alberi decisionali, foreste di alberi e reti neurali di piccole dimensioni, valutandone l’accuratezza e l’affidabilità attraverso metriche standard. I risultati ottenuti evidenziano il valore del Machine Learning nei progetti aziendali innovativi come questo, che rappresentano sfide sempre più frequenti nel contesto attuale. Il modello più performante è in grado di predire l’intensità delle emissioni odorigene dai dati dei sensori ed ha raggiunto un’accuratezza del 90%.

Mitigare l'Impatto dei Conflitti Normativi nei Sistemi di Question-Answering Legale con l'Utilizzo di Knowledge-Graph e Large Language Models

Mattia Burreli

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta
Abstract

Una delle principali sfide nella ricerca sull'Intelligenza Artificiale, in particolare nel campo del Natural Language Processing (NLP), consiste nel garantire l'accuratezza delle risposte generate, soprattutto in ambiti ad alto impatto come il diritto e la medicina, dove un errore potrebbe avere conseguenze rilevanti. Tale problematica ha indotto la comunità scientifica a elaborare approcci alternativi volti ad ampliare il patrimonio conoscitivo dei modelli, mediante l'implementazione di metodologie innovative basate sulla costruzione di contesti specifici e sull'acquisizione di dati rilevanti da impiegare nella generazione di risposte accurate. Nell'ambito giuridico, la finalità è quella di dirimere le incongruenze derivanti dall'introduzione di modifiche ai codici legislativi. Lo scopo di questo progetto di tesi è di valutare l'implementazione e l'efficacia delle metodologie di acquisizione e derivazione delle informazioni al fine di incrementare l'accuratezza dei sistemi conversazionali di assistenza giuridica. Mediante la costruzione di Knowledge Graphs e l'applicazione dei più recenti Large Language Models, la ricerca si concentra sull'analisi dei correttivi di decreti e leggi del panorama legislativo Italiano, con l'obiettivo di risolvere le incongruenze derivanti dagli aggiornamenti e abrogazioni.I risultati mostrano che l'uso di contesti recuperati da un database esterno migliora le performance del 40\% nel caso di e del 50\% nel Codice Correttivo. Questi miglioramenti sono particolarmente evidenti nei modelli con capacità computazionale ridotta, dimostrando che il metodo adottato ottimizza le performance e mitiga le difficoltà legate ai codici correttivi.

Valutazione dei Large Language Models nella Risoluzione dei Campionati Internazionali di Giochi Matematici

Lorenzo Tordi

Supervisor
Gianluca Moro
Co-supervisors
Alessio Cocchieri, Luca Ragazzi
Abstract

I Large Language Models (LLM) rappresentano uno dei temi più innovativi
e studiati nell’intelligenza artificiale. In ambito matematico, numerosi lavori
hanno valutato le loro capacità su benchmark consolidati, evidenziando prestazioni eccellenti in problemi di calcolo matematico, spesso paragonabili a quelle
umane. Tuttavia, quando si tratta di compiti che richiedono ragionamento
complesso e intuitivo, i LLM mostrano ancora limiti significativi, lasciando
ampi margini di miglioramento. Questa tesi introduce MathGames, un nuovo benchmark matematico progettato per valutare le capacità dei LLM su
problemi logico-deduttivi, composto esclusivamente da quesiti tratti da competizioni internazionali tra umani. MathGames si distingue dai benchmark
tradizionali, che tendono a concentrarsi su calcoli ed equazioni, proponendo invece problemi che richiedono creatività, deduzione logica e, in alcuni casi, anche
una componente visiva. I risultati ottenuti su questo benchmark mostrano che,
contrariamente a quanto suggerito da alcuni studi recenti, i LLM non hanno
ancora raggiunto una piena maturità nel ragionamento logico-matematico e
rimangono lontani dal competere con le capacità umane in questo ambito.

Valutazione del Quoziente Intellettivo di Large Language Model Multimodali

Eduard Toni Alexandru

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Giacomo Frisoni

2024

Automatizzare la Codifica Clinica con i Large Language Models: Un Approccio per Migliorare la Codifica ICD in Regimi Low-Resource

Francesco Buda

Supervisor
Gianluca Moro
Co-supervisors
Alessio Cocchieri
Abstract

La codifica di documenti sanitari è un attività che consiste nell’assegnare codici relativi a diagnosi legate alla medicina a partire da note mediche scritte sotto forma di testo libero. È un’attività svolta manualmente da professionisti della salute con lo scopo di tenere traccia di diagnosi e procedure relative ai pazienti. Rendere questo processo completamente o parzialmente automatico è un ambito di ricerca molto importante in quanto permetterebbe di far risparmiare moltissimo lavoro meccanico e ripetitivo a molti medici esperti. In questo studio si iniziano ad esplorare le possibilità che i nuovi Large Language Models possono offrire in questo campo, fornendo una strategia operativa composta da due fasi: nella prima si seleziona, utilizzando un modello sentence transformer e calcolando le similarità tra termini medici ed etichette, un sottoinsieme ristretto di codici contenente il maggior numero possibile di label corrette; nella seconda fase invece, si sfrutta un large language model per analizzare a pieno
il contenuto della nota medica e selezionare tra i codici restituiti dalla prima fase, le etichette più adatte. L’approccio proposto e implementato è risultato promettente e fornisce una buona base per la ricerca futura, che può portare all’utilizzo effettivo del sistema descritto per situazioni reali anche in regimi Low-Resource.

creazione di un dataset legislativo e sperimentazione di llm open source nel question answering giuridico italiano

Giacomo Antonelli

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Cristiano Casadei, Paolo Italiani
Abstract

Questa tesi si inserisce nel contesto della legislazione italiana, proponendo l'utilizzo di tecnologie avanzate di Intelligenza Artificiale e di strumenti di scraping per la creazione di un dataset legale contenente, 721 quiz a tema legislativo e 98.929 articoli di leggi italiane. L’obiettivo principale è rendere disponibile un corpus di dati utile sia per l'addestramento di modelli AI sia come benchmark che per la valutazione di altri sistemi nel dominio legale. Inoltre, il lavoro include un'analisi statistica approfondita delle prestazioni di diverse architetture e modelli di linguaggio, addestrati per rispondere a domande legislative, l'analisi considera vari fattori, come la lingua utilizzata e il contesto fornito al modello.

Mixture of Masters: Merging Specialized Chess Language Models

Giosuè Giocondo Mainardi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Recent advancements in Language Models (LMs) have raised the possibility of applying these models to strategic domains beyond text, such as chess. A significant challenge in this area is determining whether LMs can replicate the distinctive playing styles of an individual, rather than merely generating plausible moves. Addressing this challenge involves training models that are not only accurate in move generation but also capable of capturing stylistic nuances unique to each player.

To tackle this problem, we propose a *Mixture of Experts* (MoE) framework for chess, where each expert model is fine-tuned separately on the historical games of specific grandmasters, including Hikaru Nakamura, Magnus Carlsen, and Garry Kasparov. This approach allows each model to specialize in a single grandmaster's style, and we then explore techniques for merging these experts into a combined model that retains the stylistic diversity of its individual components.

To evaluate the efficacy of this MoE framework, we developed a custom evaluation system incorporating metrics for move legality, style fidelity, and performance benchmarking against the Stockfish engine. Our results show that the expert models achieve up to 16.7% more accuracy in replicating grandmaster moves compared to the baseline, with a high rate of legal move generation. The merged model, while experiencing a slight decrease in accuracy, exhibits emergent properties, demonstrating the potential for further improvements in model merging techniques. This research advances our understanding of specialization and model merging in LMs, highlighting their potential for complex strategic games and human-AI alignment.

UniBot: A Retrieval-Augmented Conversational Agent for the University of Bologna

Nicolas Amadori

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Recently, the utility and convenience of Large Language Models (LLMs), especially as generative chatbots, have gained significant attention in various contexts. Chatbots are designed with simplicity and intuitiveness, leveraging natural conversational interfaces that align with user habits. They can effectively handle a wide range of tasks, from everyday inquiries to complex professional applications. However, the current limitations of these chatbots often restrict their functionality, primarily in responding to general public information queries. This constraint diminishes their effectiveness, particularly in specialized fields that demand more granular and contextualized information.
This thesis proposes developing a prototype of a conversational agent specifically designed to meet the needs of the University of Bologna. The primary objective is to enable the chatbot to respond comprehensively to all types of questions a student might ask related to the university context. This goal will be achieved by integrating authentic information ensuring the chatbot can respond precisely and accurately to student inquiries. To facilitate this, the project will implement a Retrieval-Augmented Generation pipeline that utilizes a customized University of Bologna-specific information dataset, scraped and cleaned from the official university website. This innovative approach combines LLMs' advanced natural language understanding and response generation capabilities with targeted academic knowledge. Preliminary results indicate a significant enhancement in the chatbot's performance, with an improvement of approximately 25-30\% in its ability to respond to questions relevant to the university setting, compared to direct generation using the same language model. This allows the chatbot to provide detailed answers on topics like course structures and Erasmus programs.

Generative Information Retrieval of Chest X-Rays

Riccardo Mazzi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Traditional information retrieval methods have relied on similarity matching, where representations generated by encoder-only models are used to rank and retrieve relevant documents.
The recent advancements in pre-trained language models have enabled a new paradigm--generative information retrieval.
This approach leverages the generative capabilities of large language models (LLMs) to produce relevant document identifiers directly.
However, generative techniques remain unexplored in medicine.
Within this domain, physicians often need to quickly find relevant radiographic images and reports of previous cases to assist in diagnosis and treatment.
For these reasons, we present GENerative Information Retrieval of Chest X-Rays (GenIrCxr).
We assign a numerical identifier to each report by applying hierarchical k-means on top of PubMedBERT semantics-aware representations.
Then, we train a decoder-only LLM from scratch to generate report identifiers in response to queries from a medical expert.
Significant effort was invested in developing optimization techniques to enhance model performance, including custom output vocabularies and constrained beam search generation at inference time.
We train GenIrCxr using a custom dataset built on top of MIMIC-CXR-JPG v2.0.0, where the input query describes medical concepts of interest and the output is the semantic identifier of the target report computed offline.
Retrieval performance is measured using Recall@K and Mean Reciprocal Rank as automatic metrics.
Given the complexity of this task, GenIrCxr demonstrates strong performance, which we validate through comparative experiments against several encoders. GenIrCxr not only surpasses these baselines but also outperforms a seq-to-seq model specifically designed for generative information retrieval, accepted at NeurIPS 2022.

Migliorare la Named Entity Recognition zero-shot attraverso l’utilizzo di descrizioni delle entità: un caso studio in dominio biomedico

Francesco Candoli

Supervisor
Gianluca Moro
Co-supervisors
Alessio Cocchieri
Abstract

Nel Natural Language Processing l'attività nota come Named Entity Recognition (NER) consiste nell'identificare e classificare, ossia annotare, porzioni di testo all'interno di documenti in base a un set di etichette predefinite, note come Entità. Ottenere annotazioni di questo tipo nel mondo reale è complesso e la generalizzazione verso entità non precedentemente viste rappresenta una sfida significativa. In tale contesto, l'apprendimento zero-shot (Picco et al., 2023; Xian et al., 2020) diventa essenziale per compensare l'assenza di istanze di addestramento. Tuttavia, per ottenere risultati significativi, è necessario disporre di ampie conoscenze pregresse, soprattutto in scenari specifici di dominio.

Sebbene i Large Language Model (LLM) abbiano un grande potenziale, il loro costo computazionale e inefficienza ne limitano fortemente l'applicabilità, favorendo l'utilizzo di reti neurali più piccole e specializzate. In questo lavoro proponiamo una metodologia che integra descrizioni testuali delle entità direttamente nel processo di riconoscimento, con l'obiettivo di migliorare le performance dell'apprendimento zero-shot. Questo approccio consente a language model pre-addestrabili con risorse limitate, come BERT (Devlin et al., 2019), con dimensioni inferiori di diversi ordini di grandezza rispetto ai LLM, di sfruttare informazioni semantiche dettagliate sulle entità target, migliorando la loro capacità di generalizzare a nuovi contesti.

Questa tesi ha sviluppato una nuova soluzione NER per il dominio biomedico nel quale persistono i limiti sopra menzionati, come si evince in lavori di Yu (Yin et al., 2024) e Wang (Wang et al., 2018).

Gli esperimenti condotti dimostrano che la soluzione ha superato lo stato dell'arte in diversi benchmark, battendo anche modelli come GPT-4 e LLM addestrati per NER, dimostrando l'efficacia nell'uso delle descrizioni delle entità nel contesto della NER zero-shot.

Insegnare ai Large Language Models l'Arte del Ragionamento con l'Utilizzo e il Posizionamento dei Thinking Tokens

Virginia Foschi

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta
Abstract

Migliorare le capacità di ragionamento dei modelli di linguaggio di grandi dimensioni (LLM) è diventato un'area critica di ricerca nell'intelligenza artificiale. La scarsità di dati di alta qualità per compiti complessi di ragionamento ha spinto i ricercatori a esplorare approcci alternativi che si concentrano sulla modulazione e sull'interpolazione delle informazioni all'interno di questi modelli. Questa tesi presenta un'architettura innovativa end-to-end che apprende a identificare i punti ottimali in cui il modello deve fare una pausa e svolgere ulteriori calcoli prima di generare una risposta. Il nostro approccio riprende il concetto di ``thinking token" introdotto nel paper ``Think before you speak: training language models with pause tokens" \citep{Pause-Tokens} lasciando però al modello la libertà di inserirli in posizioni strategiche della sequenza di input. Questi token fungono da segnali per il modello, incoraggiandolo a interrompere temporaneamente la generazione del testo e a eseguire un ragionamento più approfondito sui dati forniti in modo da migliorare la qualità e la precisione delle risposte generate per domande particolarmente complesse. Per dimostrare l'efficacia del nostro metodo, conduciamo esperimenti su alcuni dataset di question answering, in particolare su domande a risposta multipla. I risultati mostrano che, lasciare libero il modello di decidere dove inserire i thinking tokens nelle sequenze di input, non solo migliora le performance del 25\% rispetto alle configurazioni predefinite, ma consente anche di mantenere l'efficienza in termini di risorse computazionali. L'architettura proposta riesce a bilanciare la necessità di una riflessione approfondita con la limitazione delle risorse, evitando il sovraccarico computazionale spesso associato a tecniche di ragionamento più elaborate.

Large Language Model per l’Analisi di Bilanci Aziendali: Sviluppo e Studio Comparativo tra Modelli Open Source e Proprietari

Nicolò D'Addabbo

Supervisor
Gianluca Moro
Abstract

Questo lavoro di tesi è stato condotto presso l’azienda Luna S.R.L., in collaborazione con RBHQ S.R.L., nell’ambito del progetto HYKEE AI. Il progetto si propone di sviluppare un assistente virtuale a supporto di analisti e consulenti finanziari, in grado di interpretare i bilanci delle aziende italiane e offrire una panoramica chiara e sintetica della loro salute finanziaria.
La tesi presenta non solo una descrizione approfondita del progetto HYKEE AI, ma anche uno studio comparativo tra modelli di linguaggio di grandi dimensioni (LLMs) open source e proprietari. Questa comparazione è stata effettuata attraverso valutazioni fornite da un esperto umano, utilizzate poi per addestrare un modello noto come LLM-as-a-Judge. Il modello così addestrato è stato impiegato per valutare le performance dei modelli LLM open source e proprietari nel contesto dell’analisi di bilancio.
Ogni LLM è stato testato con tre differenti prompt, creati utilizzando il metodo del In-Context Learning.
I risultati del lavoro hanno evidenziato una differenza statisticamente significativa nelle prestazioni dei modelli considerati, mentre non è emersa una differenza significativa tra i vari prompt utilizzati; il modello migliore è risultato essere Claude 3 Haiku.

Diverse and Sparse Query Embeddings for Retrieval Enhanced Multi-Document Question Answering

Andrea Micheli

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta

Augmenting Large Language Models with Memory Using Mixture of Experts

Andrea Dotti

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta

ParlaMentis: Agente Conversazionale Retrieval-Enhanced per la Camera dei Deputati

Giorgio Fantilli

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Il diritto svolge un ruolo centrale e fondamentale nel plasmare la nostra società, influenzando ed insinuandosi in ogni aspetto della vita civile. In questo contesto, le risorse giuridiche fonte di diritto, sia testuali che multimediali, sono ubique, in continua espansione, di ardua interpretazione e intrise di riferimenti incrociati. I moderni sistemi di elaborazione del linguaggio naturale presentano il potenziale per ottimizzare l'attività normativa, permettendo ai legislatori di semplificare la ricerca, comprensione e generazione di documenti, e allo stesso tempo promuovere una maggiore trasparenza verso i cittadini. Strumenti come i Large Language Model sono infatti estremamente efficaci per la consultazione automatica di vasti corpora di documenti legali, possedendo la capacità di estrapolazione selettiva e di correlazione delle informazioni impensabili per un utente umano.
A tale scopo proponiamo ParlaMentis, un agente conversazionale multi-lingua e multi-task basato su una innovativa architettura Multi-Document Agent, che combina la potenza dei Large Language Model, tecniche di information retrieval, ed il paradigma Reasoning and Acting. Questi strumenti consentono la costruzione di un modello che è in grado di soddisfare domande riguardanti un vasto corpus di atti di iniziativa della Camera dei Deputati italiana e di video-interventi avvenuti in sedute dell’Assemblea. ParlaMentis fa uso di un Large Language Model appositamente addestrato sul contesto giuridico di riferimento, capace di ragionamento e rielaborazione delle richieste utente, fino alla predisposizione e successiva esecuzione di un dettagliato piano d’azione dinamico volto al selettivo ed efficiente recupero delle nozioni necessarie per generare una risposta quanto più possibile fattuale.

Agriveritas: Chatbot Generativo per il Supporto Normativo allo Sviluppo dell'Agricoltura Sostenibile

Jacopo Pesaresi

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Luca Ragazzi
Abstract

Sempre più organizzazioni e imprese del terzo settore esprimono interesse sulle potenzialità che offrono i “chatbot”. Infatti, a differenza dei canonici sistemi di comunicazione quali e-mail e numeri di telefono, questi strumenti, se ovviamente ben programmati, sono personalizzabili, esaustivi per ogni dubbio
e sempre disponibili, garantendo un servizio h24 e quanto più simile a come oggi si è abituati comunicare, ovvero per messaggistica.

Il lavoro di tesi che si descriverà di seguito vuole essere un primo prototipo che desidera concretizzare e esemplificare queste potenzialità immergendosi in tutte le sfide incorse, e nella loro prima soluzione, nella creazione ex-novo di un nuovo chatbot al servizio delle “agenzie per le erogazioni in agricoltura”. Ne esiste una a livello nazionale, che prende il nome di “AGEA”, ma ne esistono anche alcune a livello regionale, le prime a esprimere un concreto interesse nei confronti di questo potenziale tool.


Oltre a offrire un primo prototipo, potenzialmente distribuibile, il lavoro di tesi si occupa anche di esplorare un lato più teorico e affine al settore della ricerca. Questa sfumatura di lavoro servirà allora a dimostrare i sforzi compiuti dalla prototipazione della soluzione proposta, che riesce ad offrire un primo sistema di collezionamento, organizzazione e reperibilità di informazioni specifiche alle richieste dell’utente. Come verrà descritto debitamente nel lavoro, si desidera infatti provare che un sistema basato su un Large Language Model che sfrutta a livello preliminare una fase di recupero informazioni, generalmente referenziata come “RAG”, sia in grado di riceve un incremento di prestazioni di circa 3-6%.

Large Action Models: End-to-End Retrieval-Enhanced Learning for Generating Function Calls from Instruction Manuals

Nicolo Monaldini

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Large action models are agents that leverage the reasoning abilities of large language models (LLMs) to make decisions in real-life scenarios. Existing approaches often fine-tune LLMs for specific instruction-function mappings, which leads to limited generalizability and eventual obsolescence. LLMs that support function calling natively require a list of tools to be passed to the model, usually in JSON format. However, their context length limits the number of supported tools. Additionally, leveraging this functionality with pay-as-you-go closed-source models can result in high inference costs. Moreover, even cutting-edge models can hallucinate or make errors in tool selection when presented with many options. This work evaluates how retrieval-augmented generation could enhance generalization in tool selection and function-calling tasks. Specifically, we treat the LLM as a frozen black box and augment it with a tunable retriever module, trained to find the documentation chunks that maximize the LLM accuracy in tool selection. Our retriever preselects relevant function headers for a given query to mitigate context length restrictions and hallucination phenomena of the LLM to which it is plugged. We conducted extensive evaluations with various models, datasets, and loss functions. For functions already seen during training, using RoBERTa-base, we observed significant performance improvements: Rank@1 increased from 22.5% to 85.0%, Rank@2 from 27.5% to 100.0%, and Rank@3 from 30.0% to 100.0%. For functions not seen during training, Rank@1 improved from 40.0% to 75.0%, Rank@2 from 50.0% to 97.5%, and Rank@3 from 50.0% to 97.5%.

Diagnose Your Text: A Plausibility Estimation Model for Medical Statements

Federica Bedeschi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Today's large language models (LLMs) are extremely good at generating text practically indistinguishable from the human one, but are prone to hallucinate information. Therefore, there is a need for fact-checking, particularly in sensitive and critical domains where misinformation could have life-threatening consequences, as seen in the medical field. This task presents a significant challenge due to the exceptional quality of the artificial text. Moreover, developing highly effective fact-checking tools in specialized domains still needs to be solved in the literature. In this thesis, we introduce Med-vera, taking a step in automatically quantifying the plausibility of declarative medical statements. To better align with real-world scenarios, we focus on evidence-free fact-checking, which requires a statement as input without needing a trustworthy source paragraph to compare with. Using LLaMA-2-chat, Med-vera verbalizes existing heterogeneous medical resources to generate over 1 million correct and incorrect artificial statements, which serve as the basis for training closed-book classification models. The converted resources are question-answering datasets (BioASQ, MedMCQA, PubMedQA) and knowledge graphs (UMLS).

Benchmarking e Prompt Tuning di Large Language Model per la Generazione di Codice

Luca Bighini

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Luca Ragazzi
Abstract

Questo lavoro esplora le capacità di generazione di codice Java avanzato da parte degli attuali modelli generativi di intelligenza artificiale open source, con un focus particolare sul contesto accademico universitario. Attraverso la valutazione di tre Large Language Model (LLM) – Deepseek-Coder, Mistral e CodeLlama – questo studio introduce un nuovo benchmark derivato da compiti di programmazione avanzati richiesti a studenti laureandi. I risultati indicano che, nonostante le generali buone prestazioni, vi è un ampio margine di miglioramento, soprattutto per quanto riguarda la generazione di codice che aderisce ai principi della programmazione orientata agli oggetti e nell'uso efficace degli stream di Java. È stata inoltre studiata la tecnica del prompt tuning, rivelatasi un fattore chiave per aumentare la versatilità dei modelli. Questo lavoro suggerisce nuove prospettive per la ricerca futura, sottolineando il potenziale dell'intelligenza artificiale nel semplificare lo sviluppo software.

Large Language Model per Dataset Giuridici Italiani: Esperimenti con Prompting, Retrieval-Augmented Generation e Fine-Tuning

Luca Lucioli

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta
Abstract

Il NLP è uno dei settori dell'intelligenza artificiale che cattura maggiore interesse al giorno d'oggi. Negli ultimi anni abbiamo assistito alla crescita esponenziale delle capacità dei modelli di linguaggio e conseguentemente della loro diffusione. L'avvento dei modelli preaddestrati ha rivoluzionato il settore consentendo una vasta gamma di applicazioni in innumerevoli contesti.
Questa tesi affronta in particolare l'impiego del NLP nel dominio legale, un campo applicativo che rappresenta una della sfide maggiori per questi sistemi, essendo caratterizzato da un linguaggio molto complesso di cui è necessaria una conoscenza profonda.
Lo scopo di questo elaborato è quello di sperimentare e combinare diverse strategie come il prompting, il fine-tuning, la Retrieval-Augmented Generation (RAG) per migliorare le capacità di alcuni modelli di linguaggio nell'attività di question answering.

Reinforcement learning on emerging referential communication in Atari games

Zhaohui Song

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta, Paolo Italiani
Abstract

In the process of learning new tasks, humans don't rely on random action sequences; instead, they draw from prior knowledge and experiences, often guided by instructional materials like videos, books, or online tutorials. Conversely, policy gradient-based methods, known for their struggle with exploration, typically resort to random environmental interactions until a reward signal is received. However, in a more complex learning environment, this approach may never converge, communicating and interpreting prior knowledge is essential to accelerate the learning process. Addressing this challenge, instruction-following reinforcement learning has emerged as a popular approach to augment exploration in policy gradient methods. By integrating reward shaping with instruction following, these methods optimize not only for maximizing task rewards but also align actions with human intention and instructions.

In this paper, we investigate the feasibility of training two agents to play video games in collaboration in a referential game setting, where one agent explains the game observation and another agent interprets it to choose a valid action, we search the emergent communication protocol between two agents to achieve higher reward in the Atari games. To achieve this, we propose an Explainer-Interpreter framework that harnesses a large Vision-Language Model to generate instructions and a frozen pre-trained large Language Model that interprets and executes these instructions. We employ the Proximal Policy Optimization (PPO) algorithm to optimize instruction generation. Through detailed studies of the implementation intricacies, we assessed their impact on performance. Despite our efforts, the findings underscore that training the vision-language model solely on policy for text generation, without leveraging downstream datasets, fails to converge and results in a negligible improvement in reward.

2023

Survey on Few-Shot Summarization

Emanuele Artegiani

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Giacomo Frisoni
Abstract

Low-Resource Summarization (LRS), chiamato anche Few-shot Summarization, si riferisce all'operazione di creare riassunti concisi e coerenti partendo da contenuti testuali quando l'accesso ai dati di addestramento è limitato. Questo argomento di ricerca ha suscitato grande interesse da parte di una vasta comunità di ricercatori ed è attualmente considerato una delle aree di ricerca più utili per le applicazioni del mondo reale, come la sintesi di cartelle cliniche, documenti legali oppure di campi di studio emergenti o molto specializzati. Questo studio offre una panoramica approfondita e attuale dei metodi di LRS esistenti. Include, inoltre, definizioni formali di termini chiave rilevanti per il ramo dell'apprendimento automatico (ML) preso in considerazione. In primo luogo, per aiutare i ricercatori ad orientarsi nella moltitudine di lavori relativi a LRS, proponiamo una tassonomia dettagliata per classificare i contributi presentati dalla comunità. In secondo luogo, definiamo chiaramente il termine "few-shot", spesso usato in modo ambiguo. In terzo luogo, abbiamo stilato delle classifiche confrontando ed analizzando 20 proposte per risolvere il compito della sintesi di dialoghi e documenti in contesti con scarsità di dati su 5 dataset differenti ed utilizzando una metrica comune.

Summarization Astrattiva di Lunghi Articoli Scientifici mediante Estrazione di Frammenti Rilevanti

Filippo Di Pietro

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Paolo Italiani
Abstract

L’obiettivo di questo lavoro, nel contesto della text summarization, eviden-
ziare le limitazioni degli attuali language model nel concentrarsi sulle parti
rilevanti di un documento. Coinvolgendo la specializzazione di un modello
nella generazione di sequenze di testo o frasi comuni tra l’articolo originale
e il suo riassunto. Attraverso esperimenti condotti utilizzando il dataset di
arXiv [Cohan et al., 2018], e SciLay. Il lavoro metterà in luce che, pur esi-
stendo opportunità di apportare miglioramenti significativi in alcuni contesti,
tali miglioramenti rimangono fuori portata a causa di alcune restrizioni nei
modelli attuali. La struttura della tesi prevede l’analisi delle diverse tecniche
di estrazione del testo comune, la definizione dei vari algoritmi impiegati, il
loro potenziale di miglioramento e la valutazione delle performance di ciascun
modello mediante il fine tuning in ogni fase del processo.
vii

Progettazione e sviluppo di un software per la gestione automatizzata di un sistema di HVAC aziendale

Giacomo Sirri

Supervisor
Mirko Viroli
Co-supervisors
Gianluca Moro
Abstract

Il progetto ha come scopo la realizzazione di un software che consenta di automatizzare con facilità la gestione dell’HVAC di un’azienda del territorio. Con l’acronimo HVAC (Heating, Ventilation, Air Conditioning) si intende l’insieme delle tecnologie e dei sistemi impiegati in un edificio per garantire un adeguato benessere ambientale agli occupanti. Il corretto utilizzo del sistema HVAC all’interno di un’azienda ha il duplice obiettivo di assicurare il comfort termico dei dipendenti e di ridurre i consumi di energia. In questo lavoro si mostra come sia possibile addestrare diversi modelli predittivi, utilizzando i dati storici raccolti dall’HVAC e dai sensori installati nella sede, in grado di stimare con ottima accuratezza la temperatura futura all’interno dell’ambiente di lavoro principale. Tali modelli vengono utilizzati dal software che fornisce l’accesso alle predizioni, implementato facendo uso della piattaforma di sviluppo .NET, grazie al quale il controller dell’HVAC potrà scegliere costantemente la miglior modalità operativa per perseguire gli obiettivi di cui sopra. Il risultato finale è un modulo software che, una volta integrato con il già esistente applicativo di gestione dell'HVAC, ne consente un uso efficiente e automatizzato.

Clip et Impera: Topic-Centric Video Segmentation with Large Language Models

Luca Babboni

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Negli ultimi anni abbiamo assistito a un incremento dell’utilizzo di video per la fruizione di contenuti come conferenze e lezioni. Si presenta quindi la necessità di semplificarne la fruizione, permettendo agli utenti di trovare le informazioni di interesse in tempi rapidi.
Questa tesi presenta due contributi principali: un metodo innovativo di segmentazione dei video in capitoli e la creazione di un nuovo dataset.
Mentre le attuali soluzioni si affidano a tecniche di analisi testuale primitive, l’impiego delle avanzate tecnologie di Large Language Models rappresenta un territorio inesplorato. Di conseguenza proponiamo una nuova metodologia
che sfrutta questa opportunità, utilizzando tali modelli generativi per dividere le trascrizioni in paragrafi in modo che questi risultino contigui rispetto agli argomenti contenuti, previo addestramento atto a permettergli di prevedere gli indici di frase che ne fanno da delimitatore.
Nonostante l’evidente rilevanza applicativa di questo argomento, la letteratura attuale non dispone di dataset adeguatamente etichettati. In risposta a questa
lacuna introduciamo un nuovo set di dati che incorpora trascrizioni e relative suddivisioni in capitoli con annotazioni supervisionate. Questi dati provengono da video che affrontano temi scientifici e presentano diversità nelle caratteristiche e variazioni di durata.
I risultati, valutati con il dataset proposto utilizzando le metriche Pk Score e WindowDiff, indicano che il Large Language Model addestrato presenta una notevole precisione nella suddivisione del testo, fornendo un contributo significativo nel contesto della divisione di video in capitoli.

scilay: un nuovo dataset per long document summarization scientifici e divulgativi di studi biomedici

Mattia Panni

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Paolo Italiani, Giacomo Frisoni
Abstract

Questa tesi esplora il prospero settore dell’intelligenza artificiale (AI) e dell’elaborazione del linguaggio naturale (NLP), con l’obiettivo di automatizzare la creazione di riassunti comprensibili per gli articoli scientifici. Sfruttando metodologie AI all’avanguardia, questo studio si propone di ridurre il divario tra
i dettagli intricati racchiusi nelle pubblicazioni scientifiche e la loro comprensione da parte del grande pubblico. La complessità e la profondità tecnica degli articoli accademici spesso costituiscono una barriera alla comprensione generalizzata.
Mentre gli abstract tecnici si rivolgono bene agli esperti del settore, possono risultare criptici per i “non addetti ai lavori”. Affrontando questo divario comunicativo, la tesi propone un nuovo dataset denominato SciLay il cui scopo è quello di fornire una base solida per l’addestramento di modelli di generazione automatica di riassunti laici (o lay) e tecnici di ricerche scientifiche.

studio ed ottimizzazione di un sistema di recommendation per corpora di documenti

Pablo Sebastian Vargas Grateron

Supervisor
Gianluca Moro
Co-supervisors
Cristiano Casadei, Valgimigli Lorenzo, Lorenzo Valgimigli
Abstract

Questa tesi si concentra sull'analisi e sull'ottimizzazione dell'algoritmo di recommendation Glocal-K, mirando a migliorare l'efficienza e l'accuratezza.
La ricerca si articola in diverse fasi: prima un'analisi approfondita di Glocal-K per identificare aree di miglioramento, seguita dall'implementazione di approcci ottimizzati per migliorare complessità computazionale e precisione.
Un aspetto chiave è lo sviluppo di API progettate per diversi sistemi di recommendation, inclusi quelli basati su Glocal-K. Queste API offrono un'interfaccia standardizzata per facilitare l'integrazione del sistema su diverse piattaforme, promuovendo l'implementazione su contesti eterogenei.
Questa tesi non solo contribuisce al perfezionamento di Glocal-K, ma fornisce anche strumenti pratici per l'implementazione su vari sistemi di recommendation.

Graph neural network benchmark per la selezione di contenuto rilevante nella low-resource summarization

Riccardo Fiorani

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Lorenzo Valgimigli
Abstract

Nel cuore di questo elaborato vi è G-SEEK, un approccio innovativo presentato recentemente dal team di ricerca del prof. Gianluca Moro, insieme ai dott. Lorenzo Valgimigli e Luca Ragazzi, in un paper dedicato. G-SEEK è stato introdotto come un modello rivoluzionario per la Summarization, progettato specificamente per affrontare le sfide legate alla Summarization di documenti lunghi, combinando tecniche avanzate di elaborazione del linguaggio naturale con metodi di apprendimento automatico. Questo modello si propone come soluzione per la Summarization abstrattiva basata su grafi, avendo la capacità di creare grafi di conoscenza da grandi quantità di testo, fornendo una rappresentazione semantica ricca e compressa dei dati.

In questo lavoro, sono stati esplorati ulteriormente le potenzialità di G-SEEK combinandolo con nuove Graph Neural Networks(GNN). Ogni GNN porta con sé un insieme unico di caratteristiche e tecniche di modellazione, offrendo diverse prospettive sulla semantica dei grafi creati da G-SEEK.Inoltre, per migliorare ulteriormente l'efficacia, sono stati integrati nuovi Large Language Models(LLM).Ogni LLM, sono noti per le loro capacità di elaborazione del linguaggio naturale, hanno fornito un ulteriore strato di comprensione e hanno migliorato significativamente la qualità dei riassunti generati.

To Generate or to Retrieve: On the Effectiveness of Artificial Contexts for Biomedical Question Answering

Alex Presepi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Large Language Models (LLMs) nowadays are used to solve more tasks, focusing on knowledge-intensive tasks like open-domain question answering (ODQA). Most state-of-the-art solutions rely on retrieve-then-read pipelines that first retrieve relevant documents from external sources and then generate a response by augmenting the language model context. This methodology is based on embeddings and their indexing in vector databases but has several limitations. Generate-then-read (GenRead) replaces the retrieval component with LLM generators. This approach has recently exceeded previous retrieve-then-read solutions and pure generation without augmented context in tasks such as domain-general ODQA, fact-checking, and dialogue systems. In the biomedical field, these contributions become exceptionally significant due to the specialized terminology, the abundance of entities, the rapid advancement of scientific knowledge, the intolerance of hallucinations, and the necessity for evidence to verify the generated inferences. This thesis explores the generate-then-read paradigm in the biomedical domain using open-source LLM and with a limited number of parameters. Ensembling solutions are implemented for document generation, using different LLMs trained on different datasets. A pipeline is proposed in which k questions related to the context of the query are initially generated, followed by the generation of answers by an LLM. We also examine and compare different strategies for the document reading and response phase using chatbots, Fusion-in-Decoder (FiD), and encoder-only models. Using MedMCQA as the multiple-choice question dataset, medllama2 as the direct document generator, and LLaMA 2 as the chatbot to formulate the answer, an accuracy of 39.1% is achieved, compared to 36.8% for medllama2 and 35.2% for LLaMA 2.

The Summary Imitation Game: Improving Abstractive Summarizers via Neural-Approximated Decoding Strategies

Benedetta Pacilli

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

In recent years, abstract summarization has undergone significant advancements driven by the emergence of novel neural language models, transformer-based architectures, the utilization of high-dimensional spaces, the availability of extensive datasets, and innovative pre-training tasks. Within this evolving landscape, decoding strategies play a crucial role in transforming the probability distributions generated by these models into coherent text, following an autoregressive approach.
Summarization systems make numerous decisions about summary properties during inference, e.g. degree of copying, specificity, and length of outputs, etc. However, these are implicitly encoded within model parameters and specific styles cannot be enforced. Goyal et al. in 2021 introduced Hydrasum, a summarization model with multiple decoders. The peculiarity of Hydrasum relies upon its architecture, which includes multiple decoding channels. HydraSum provides a simple mechanism to obtain stylistically diverse summaries by sampling from either individual decoders or their mixtures through a gating mechanism.
The thesis presents an architecture comprising two Large Language Models that replicate distinct decoding strategies. Given the inherent non-differentiability of decoding strategies, an innovative approach is employed wherein the emulation of these strategies is achieved through the integration of a second language model, rather than relying on differentiable layers for each strategy. In this configuration, the initial language model is provided with input text intended for summarization, but the primary objective is not the generation of the summary itself. Instead, the first language model computes the probability distribution of each token for the given input text. Subsequently, these probability distributions are utilized as input for the second language model, responsible for producing the token that corresponds to the selection made by a specific decoding strategy.

From Words to Codes: Large Language Models for ICD-9 Extraction in Clinical Documents

Salvatore Antonio Addimando

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

In the realm of real-world named entity recognition and classification (NERC), the utilization of ICD-9 codes proves to be invaluable. Annotation scarcity and the need to generalize to unseen types present formidable obstacles in the field. In such situations, leveraging ICD-9 codes becomes a pivotal strategy to address these challenges effectively. ICD-9 codes offer a standardized system for categorizing medical diagnoses and procedures, providing a well-established framework to classify entities within the healthcare domain. By incorporating ICD-9 codes into NERC systems, practitioners can harness a wealth of prior knowledge and domain-specific information, thus enhancing the accuracy and efficiency of their NERC models. This integration empowers NERC systems to achieve remarkable outcomes, ensuring the precise identification and classification of medical entities, ultimately benefiting both healthcare providers and patients. Although large language models (LLMs) hold great potential, computational cost and inefficiency can limit their applicability, favoring smaller specialized networks. In this paper, we introduce \textsc{ICD-Juicer}, a novel LLM distillation framework tailored for improving NERC performance in resource-constrained environments, specifically focusing on the extraction of ICD-9 codes from clinical documents. Mechanically, \textsc{ICD-Juicer} transfers LLM clinical knowledge to BERT-based models. Accuracy is further enhanced by incorporating textual target class short descriptions in the prompt. We conducted extensive prompt engineering with different LLMs on an extremely large dataset, counting almost 2 million medical reports covering a wide variety of domains. It is important to note that the prompt provides document-level annotations from the MIMIC-III dataset to restrict GPT-3.5-turbo's output options. This way we managed to get consistent outputs throughout the creation of the augmented dataset.

Text Expansion con Language Model Generativo con e senza Knowledge Graph Injection

Lorenzo Sansone

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Valgimigli
Abstract

Lo sviluppo e l’impiego dell’Intelligenza Artificiale (AI) cresce esponenzial-
mente ogni anno. I vantaggi ed i possibili impieghi di questi strumenti sono
innumerevoli. Uno dei campi più importante dell’AI che sta assumendo un
ruolo fondamentale è la Natural Language Processing (NLP). Progressivamen-
te i calcolatori stanno acquisendo una maggiore capacità di padroneggiare il
linguaggio umano ma è ancora una sfida con molte insidie e con margini di mi-
glioramento. Tra le varie possibilità che offre questo settore c’è la text-expansion
che permette di espandere una frase in linguaggio naturale ottenendo un testo
scritto il più simile possibile a ciò che farebbe un umano. Questo strumento
trova applicazioni interessanti in tutti i contesti dove si vuole automatizzare
l’interazione con l’utente finale attraverso l’utilizzo di frasi o testi. Un fattore
comune che influisce sul rendimento di questa tipologia di modelli, anche detti
language models, è il livello di conoscenza che riescono ad estrarre in fase
di addestramento. Più elevato è questo livello più il modello sarà capace di
generalizzare adattandosi a maggiori contesti. La seguente tesi mira a capire
se i language models applicati alla text-expansion possono creare un risultato
migliore aggiungendo informazioni supplementari da fonti esterne sull’input
che verrà usato per generare il testo. Quindi l’obiettivo è quello di studiare
se l’esito finale migliora fornendo conoscenze aggiuntive sui concetti trattati
oppure se sono più che sufficienti le conoscenze apprese dal modello in fase di
addestramento utilizzando i testi di base. Per espandere le stringhe in input
ed aggiungere le informazioni in più arricchendo il contesto verranno utilizzati
i knowledge graph. Infine, saranno confrontati tutti gli esperimenti svolti per
valutare gli effetti delle elaborazioni. I test hanno dimostrato che non c’è
un miglioramento nell’inserire le informazioni inerenti al testo utilizzando le
tecniche prese in esame.

Information Retrieval Biomedicale con Testo Arricchito Mediante Knowledge Graph Clinico

Elisa Barberini

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Valgimigli
Abstract

Una rete neurale artificiale, chiamata ANN, è un sistema informatico formato da neuroni interconnessi tra loro. Aggiungendo complessità ad un'ANN si ottiene una rete neurale profonda, DNN, ancora più potente. Una DNN è capace di lavorare a problemi non lineari, potendo quindi generare modelli più complessi e con maggior precisione. Vengono infatti impiegate con enorme successo in task di NLP. Negli anni le ricerche scientifiche hanno portato alla creazione dei Large Language Model (LLM), modelli con miliardi di parametri che li permettono di apprendere e conservare conoscenza dentro di se. Una importante corrente di ricerca sta studiando come sfruttare questi modelli insieme ai Knowledge Graph (KG), grafi contenenti conoscenza su specifici domini. Questi KG, potrebbero essere fondamentali per ridurre i dati di train necessari, rendere le DNN più flessibili e veloci ad adattarsi a nuovi task. Lo scopo di questo progetto consiste sia nello studio di un algoritmo per arricchire il testo biomedico utilizzando la conoscenza di un KG che nell'addestramento di alcune DNN nella rappresentazione del linguaggio biomedico per il task di document retrieval. In dettaglio proponiamo un algoritmo per arricchimento del testo biomedico, che sfrutta algoritmi State-Of-The-Art (SOTA) per la selezione dei termini biomedici più importanti (NER). Dopo di che, i termini selezionati verranno arricchiti dal punto di vista descrittivo e di relazioni con altre entità biomediche, sfruttando un Knowledge Graph clinico. In un secondo momento, proviamo ad utilizzare l'algoritmo di document retrieval, dove per ogni query espressa in linguaggio naturale, bisogna selezionare i documenti più attinenti. Questo perché in letteratura è noto che una maggiore informazione espressa nella query porti a una più precisa selezione dei documenti. Si vuole quindi verificare se determinati language model, specifici per il dominio biomedico, ottengano performance migliori attraverso l'utilizzo del testo arricchito.

Annotazione automatica di token rilevanti per dialog summarization astrattiva

Federico Raffoni

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Negli ultimi anni, la sintesi astrattiva dei dialoghi è emersa come un'area di ricerca critica nell'elaborazione del linguaggio naturale. Sebbene abbia svariate applicazioni, tra cui il miglioramento di agenti conversazionali e l'estrazione di conoscenza strutturata, riassumere automaticamente dialoghi rimane un task sfidante, oggetto di ricerche continue. La natura del dialogo, infatti, richiede di gestire multipli speaker, co-referenze, ed evoluzioni di stato. La natura informale di colloqui o chat, inoltre, aggrava la complessità di tale processo generativo. Per far fronte a queste sfide, i sistemi di input augmentation e semantic parsing sono sempre più utilizzati, consentendo di arricchire il contesto fornito a una rete neurale e di incrementare le capacità di comprensione di quest'ultima. Questa tesi propone un'originale tecnica di input augmentation capace di migliorare l'efficacia di language model per sintesi astrattiva di dialoghi.
Il sistema prevede due fasi di addestramento. Nella prima, un modello generativo viene addestrato ad annotare, mediante tag speciali, le porzioni di testo rilevanti nel documento sorgente, escludendo quelle prive di informazioni. Nella seconda, un summarizer neurale viene addestrato a fare il riepilogo dei dialoghi stessi, sfruttando il corpus aumentato. Il sistema di annotazione permette di raggiungere prestazioni all'avanguardia sul dataset attualmente più voluminoso, \textsc{SAMSum}, con un incremento dei punteggi ROUGE-1, ROUGE-2 e ROUGE-L rispetto ai modelli esistenti.
Il sistema di tagging introdotto permette al modello di concentrarsi sulle parole che più sono utili alla produzione di un riepilogo accurato, trascurando le altre. Analisi qualitative sugli score di attention confermano tale comportamento.

Vision-Language Transformer: Retrieval ed Explainability in ambito Biomedico

Lorenzo Zanetti

Supervisor
Gianluca Moro
Co-supervisors
Stefano Salvatori
Abstract

All’interno di questo elaborato sono state analizzate e sperimentate recenti tecnologie di retrieval cross modale e di explainability in ambito biomedico, allo scopo di identificare una radiografia toracica partendo dal referto che ne riporta le osservazioni e/o la diagnosi e di poter "spiegare" le scelte fatte dal modello implementato evidenziando le parti del referto e della radiografia più rilevanti.
La soluzione sviluppata sfrutta un modello di tipo Vision-Language Transformer addestrato, per prima cosa, a riconoscere la pertinenza di un referto rispetto ad una data radiografia toracica, raggiungendo un'accuratezza dell'87%; successivamente, lo stesso modello è stato applicato, utilizzando tecniche di deep metric learning, ad un problema di retrieval cross-modale da testo a immagine e viceversa raggiungendo il 37% di precisione nel restituire la risposta corretta come primo risultato su un insieme di 100 documenti candidati (il 74% sui primi cinque e l'89% sui primi dieci).
Per quanto riguarda la parte di explainability, sono state applicate tecniche note in letteratura che hanno prodotto risultati interessanti, permettendo in alcuni casi di fornire le parole del referto o le parti di immagine più rilevanti per la rete.
E' stato infine sviluppato un applicativo web che permette di effettuare un'analisi qualitativa delle capacità del modello nel task di retrieval da testo a immagine, utilizzabile all'indirizzo: https://disi-unibo-nlp.github.io/projects/radiography_retrieval/.

generazione di riassunti fattuali mediante parsing semantico

Luca Grandi

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Giacomo Frisoni
Abstract

Negli ultimi anni, si è prestata sempre più attenzione da parte della comunità scientifica alla risoluzione di uno dei problemi principali del Natural Language Generation (NLG), in particolare nel task di summarization: la presenza nel risultato prodotto di informazioni errate o fittizie rispetto al testo di partenza, noto come "Hallucination". Le strategie tradizionali utilizzate da NLG hanno raggiunto un buon compromesso tra prestazioni e qualità del risultato prodotto. Tuttavia, tali strategie falliscono sotto l’aspetto della fattualità in quanto quest’ultima non viene valutata durante il processo di generazione. Per affrontare questo problema, proponiamo una nuova strategia di decoding chiamata Sentence-Level Faithful Greedy Search. Questa tecnica mira ad aumentare la fedeltà del riassunto rispetto ad uno o più documenti di partenza, e a ridurre al minimo il numero di Hallucination, attraverso l’utilizzo congiunto di diverse beam search e dei grafi AMR per la valutazione della fattualità del risultato durante il processo di generazione. Infine per valutare l’efficacia della nostra strategia di decoding, abbiamo condotto degli esperimenti su 100 campioni casuali appartenenti al dataset XSUM, confrontando successivamente i risultati ottenuti con quelli acquisiti
tramite Greedy Search, una strategia di decoding tradizionale. I risultati degli esperimenti mostrano che la nostra strategia ha portato ad un miglioramento della fattualità del testo in circa il 35% dei casi.

Applicazione di Graph Neural Network nella Multi-Document Summarization con risorse limitate

Marco Lisotta

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Valgimigli
Abstract

L'avvento dell'internet ha portato ad un incremento considerevole nella quantità di testi digitali disponibili online. Visto la velocità con cui viaggiano le informazioni ci troviamo molto spesso a dover riepilogare un gran numero di dati per poter accedere alle informazioni chiave in modo dinamico. Da qui la nascita di grandi sforzi nel campo del Automatic Text Summarization e Multi-Document Summarization. Le applicazioni che queste tecnologie hanno portato ad oggi sono vaste e di grande utilità a molte aziende. Ad oggi la maggior parte dei modelli di ATS viene proposta e sviluppata dalle grosse imprese, grazie alle loro grossa quantità, quasi illimitata, di risorse e dati a disposizione. Il problema sorge con le piccole e medie imprese che vogliono utilizzare queste tecnologie, visto la quantità di risorse limitate. Nella nostra soluzione proponiamo l'utilizzo di una Graph Neural Network nel task di Multi-Document Summarization. Solo di recente è stato introdotto l'utilizzo delle GNN all'interno di ATS. Questo approccio porta una serie di vantaggi come la scalabilità e flessibilità del modello ed una migliore comprensione delle attività che vengono svolte. Il nostro modello si occupa di applicare un filtro ai documenti, selezionando un numero di frasi che vengono considerate come le più importanti per la generazione di un riepilogo. Le frasi selezionate vengono poi utilizzate da un modello ormai già costatato come tra i più performanti per MDS, PRIMERA. Utilizziamo un hardware accessibile e un dataset di un centinaio di entry per simulare la scarsità di risorse.

2022

prism: rinfrangere distribuzioni di probabilità in riassunti astrattivi mediante strategie di decoding

David Cohen

Supervisor
Antonella Carbonaro
Co-supervisors
Giacomo Frisoni, Gianluca Moro
Abstract

Negli ultimi quattro anni la summarization astrattiva è stata protagonista di una evoluzione senza precedenti dettata da nuovi language model neurali, architetture transformer-based, elevati spazi dimensionali, ampi dataset e innovativi task di pre-training. In questo contesto, le strategie di decoding convertono le distribuzioni di probabilità predette da un modello in un testo artificiale, il quale viene composto in modo auto regressivo. Nonostante il loro cruciale impatto sulla qualità dei riassunti inferiti, il ruolo delle strategie di decoding è frequentemente trascurato e sottovalutato. Di fronte all'elevato numero di tecniche e iperparametri, i ricercatori necessitano di operare scelte consapevoli per ottenere risultati più affini agli obiettivi di generazione.
Questa tesi propone il primo studio altamente comprensivo sull'efficacia ed efficienza delle strategie di decoding in task di short, long e multi-document abstractive summarization. Diversamente dalle pubblicazioni disponibili in letteratura, la valutazione quantitativa comprende 5 metriche automatiche, analisi temporali e carbon footprint. I risultati ottenuti dimostrano come non vi sia una strategia di decoding dominante, ma come ciascuna possieda delle caratteristiche adatte a task e dataset specifici. I contributi proposti hanno l'obiettivo di neutralizzare il gap di conoscenza attuale e stimolare lo sviluppo di nuove tecniche di decoding.

Sviluppo di Retrieval-based Chatbot per l'Italiano con Transformer

Luca Morlino

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi
Abstract

L’Intelligenza Artificiale negli ultimi anni sta plasmando il futuro dell’umanità in quasi tutti i settori. È già il motore principale di diverse tecnologie emergenti come i big data, la robotica e l’IoT e continuerà ad agire come innovatore tecnologico nel futuro prossimo. Le recenti scoperte e migliorie sia nel campo dell’hardware che in quello matematico hanno migliorato l’efficienza e ridotto i tempi di esecuzione dei software. È in questo contesto che sta evolvendo anche il Natural Language Processing (NLP), un ramo dell’Intelligenza Artificiale che studia il modo in cui fornire ai computer l'abilità di comprendere un testo scritto o parlato allo stesso modo in cui lo farebbe un essere umano. Le ambiguità che distinguono la lingua naturale dalle altre rendono ardui gli studi in questo settore. Molti dei recenti sviluppi algoritmici su NLP si basano su tecnologie inventate decenni fa. La ricerca in questo settore è quindi in continua evoluzione. Questa tesi si pone l'obiettivo di sviluppare la logica di una chatbot help-desk per un'azienda privata. Lo scopo è, sottoposta una domanda da parte di un utente, restituire la risposta associata presente in una collezione domande-risposte. Il problema che questa tesi affronta è sviluppare un modello di NLP in grado di comprendere il significato semantico delle domande in input, poiché esse possono essere formulate in molteplici modi, preservando il contenuto semantico a discapito della sintassi. A causa delle ridotte dimensioni del dataset italiano proprietario su cui testare il modello chatbot, sono state eseguite molteplici sperimentazioni su un ulteriore dataset italiano con task affine. Attraverso diversi approcci di addestramento, tra cui apprendimento metrico, sono state raggiunte alte accuratezze sulle più comuni metriche di valutazione, confermando le capacità del modello proposto e sviluppato.

Sviluppo di Metodi di Soft Labeling per la Multi-Document Summarization in Ambito Legale

Luca Rubboli

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi
Abstract

In questo elaborato viene trattata l’analisi del problema di soft labeling applicato alla multi-document summarization, in particolare vengono testate varie tecniche per estrarre frasi rilevanti dai documenti presi in dettaglio, al fine di fornire al modello di summarization quelle di maggior rilievo e più informative per il riassunto da generare. Questo problema nasce per far fronte ai limiti che presentano i modelli di summarization attualmente a disposizione, che possono processare un numero limitato di frasi; sorge quindi la necessità di filtrare le informazioni più rilevanti quando il lavoro si applica a documenti lunghi. Al fine di scandire la metrica di importanza, vengono presi come riferimento metodi sintattici, semantici e basati su rappresentazione a grafi AMR. Il
dataset preso come riferimento è Multi-LexSum, che include tre granularità di summarization di testi legali. L’analisi in questione si compone quindi della fase di estrazione delle frasi dai documenti, della misurazione delle metriche stabilite e del passaggio al modello stato dell’arte PRIMERA per l’elaborazione del riassunto. Il testo ottenuto viene poi confrontato con il riassunto target già fornito, considerato come ottimale; lavorando in queste condizioni l’obiettivo è di definire soglie ottimali di upper-bound per l’accuratezza delle metriche, che potrebbero ampliare il lavoro ad analisi più dettagliate qualora queste superino lo stato dell’arte attuale.

Self-supervised Information Retrieval basato su deep metric learning

Federico Pirazzoli

Supervisor
Gianluca Moro
Co-supervisors
Cristiano Casadei, Andrea Romanelli
Abstract

La tesi ha lo scopo di ricercare, esaminare ed implementare un sistema di Machine Learning, un Recommendation Systems per precisione, che permetta la racommandazione di documenti di natura giuridica, i quali sono già stati analizzati e categorizzati appropriatamente, in maniera ottimale, il cui scopo sarebbe quello di accompagnare un sistema già implementato di Information Retrieval, istanziato sopra una web application, che permette di ricercare i documenti giuridici appena menzionati.

Studio e sperimentazione di approcci neurali predittivi per il mercato azionario.

Rostyslav Dovganyuk

Supervisor
Gianluca Moro
Abstract

Il mercato azionario è sempre stato caso di studio, soprattutto per la sua complessità, e la difficolta di predirne il comportamento. I fattori in gioco sono davvero tanti, dalla politica ai problemi aziendali stessi.
Pur sapendo che il mondo finanziario è un mondo complicato, permette però possibilità di guadagno elevate.
Nel documento vengono descritti alcuni approcci utilizzati per eseguire delle predizioni, dai metodi più classici come la regressione, fino all'utilizzo di reti neurali. Vengono infatti descritti tre modelli che sfruttano le caratteristiche della LSTM, e un modello che sfrutta l'architettura Transformer, proposto recentemente,

LAWSU-IT: Un Nuovo Dataset Giudiziario italiano per Long Document Summarization con Baseline Estrattive e Astrattive

Stefano Guidi

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi
Abstract

L'avanzamento nel campo della long document summarization dipende interamente dalla disponibilità di dataset pubblici di alta qualità e con testi di lunghezza considerevole. Risulta pertanto problematico il fatto che tali dataset risultino spesso solo in lingua inglese, comportandone una limitazione notevole se ci si rivolge a linguaggi le cui risorse sono limitate. A tal scopo, si propone LAWSU-IT, un nuovo dataset giudiziario per long document summarization italiana. LAWSU-IT è il primo dataset italiano di summarization ad avere documenti di grandi dimensioni e a trattare il dominio giudiziario, ed è stato costruito attuando procedure di cleaning dei dati e selezione mirata delle istanze, con lo scopo di ottenere un dataset di long document summarization di alta qualità. Inoltre, sono proposte molteplici baseline sperimentali di natura estrattiva e astrattiva con modelli stato dell'arte e approcci di segmentazione del testo. Si spera che tale risultato possa portare a ulteriori ricerche e sviluppi nell'ambito della long document summarization italiana.

Annotazione di Riferimenti e Tipologie di Sentenze Citate in Documenti Legali Mediante Natural Language Processing

Lorenzo Massone

Supervisor
Gianluca Moro
Abstract

Il seguente elaborato tratta lo sviluppo e l'implementazione di un modello di Natural Language Processing in grado di riconoscere ed evidenziare riferimenti a sentenze all'interno di documenti legali.
Il modello è stato creato per facilitare l'estrazione delle informazioni rilevanti relative a ciascuna delle sentenze rilevate, in modo tale da trovare eventuali corrispondenze che intercorrono tra il riferimento e un documento già presente all'interno della base documentale.
Ciò è stato fatto costruendo manualmente un dataset di training costituito da frammenti di testo appartenenti al database aziendale. Il modello è poi stato ottimizzato e confrontato con altre soluzioni già presenti in letteratura, mostrando buoni risultati. Successivamente è stato implementato nell'applicazione di Natural Language Processing già presente in azienda in modo da divenire utilizzabile.

Predire la borsa valori con language model neurali

Gian Luca Nediani

Supervisor
Gianluca Moro
Abstract

Nonostante lo scetticismo di molti studiosi circa la possibilità di prevedere l'andamento della borsa valori, esistono svariate teorie ipotizzanti la possibilità di utilizzare le informazioni conosciute per predirne i movimenti futuri. L’avvento dell’intelligenza artificiale nella seconda parte dello scorso secolo ha permesso di ottenere risultati rivoluzionari in svariati ambiti, tanto che oggi tale disciplina trova ampio impiego nella nostra vita quotidiana in molteplici forme. In particolare, grazie al machine learning, è stato possibile sviluppare sistemi intelligenti che apprendono grazie ai dati, riuscendo a modellare problemi complessi. Visto il successo di questi sistemi, essi sono stati applicati anche all’arduo compito di predire la borsa valori, dapprima utilizzando i dati storici finanziari della borsa come fonte di conoscenza, e poi, con la messa a punto di tecniche di elaborazione del linguaggio naturale umano (NLP), anche utilizzando dati in linguaggio naturale, come il testo di notizie finanziarie o l’opinione degli investitori. Questo elaborato ha l’obiettivo di fornire una panoramica sull’utilizzo delle tecniche di machine learning nel campo della predizione del mercato azionario, partendo dalle tecniche più elementari per arrivare ai complessi modelli neurali che oggi rappresentano lo stato dell’arte. Vengono inoltre formalizzati il funzionamento e le tecniche che si utilizzano per addestrare e valutare i modelli di machine learning, per poi effettuare un esperimento in cui a partire da dati finanziari e soprattutto testuali si tenterà di predire correttamente la variazione del valore dell’indice di borsa S&P 500 utilizzando un language model basato su una rete neurale.

End-to-end Deep Metric Learning con Vision-Language Model per il Fashion Image Captioning

Riccardo Gennari

Supervisor
Gianluca Moro
Co-supervisors
Stefano Salvatori
Abstract

L'image captioning è un task di machine learning che consiste nella generazione di una didascalia, o caption, che descriva le caratteristiche di un'immagine data in input. Questo può essere applicato, ad esempio, per descrivere in dettaglio i prodotti in vendita su un sito di e-commerce, migliorando l'accessibilità del sito web e permettendo un acquisto più consapevole ai clienti con difficoltà visive. La generazione di descrizioni accurate per gli articoli di moda online è importante non solo per migliorare le esperienze di acquisto dei clienti, ma anche per aumentare le vendite online. Oltre alla necessità di presentare correttamente gli attributi degli articoli, infatti, descrivere i propri prodotti con il giusto linguaggio può contribuire a catturare l'attenzione dei clienti.
In questa tesi, ci poniamo l'obiettivo di sviluppare un sistema in grado di generare una caption che descriva in modo dettagliato l'immagine di un prodotto dell'industria della moda dato in input, sia esso un capo di vestiario o un qualche tipo di accessorio. A questo proposito, negli ultimi anni molti studi hanno proposto soluzioni basate su reti convoluzionali e LSTM. In questo progetto proponiamo invece un'architettura encoder-decoder, che utilizza il modello Vision Transformer per la codifica delle immagini e GPT-2 per la generazione dei testi. Studiamo inoltre come tecniche di deep metric learning applicate in end-to-end durante l'addestramento influenzino le metriche e la qualità delle caption generate dal nostro modello.

Anonimizzazione di documenti mediante Named Entity Recognition e Neural Language Model

Sergiu Gabriel Rolnic

Supervisor
Gianluca Moro
Abstract

I transformers hanno rivoluzionato il mondo dell'interpretazione linguistica da parte delle macchine. La possibilità di addestrare un neural language model su vocabolari ed enciclopedie intere, per poi utilizzare le conoscenze acquisite e trasmetterle a task specifici, ha permesso di raggiungere lo stato dell'arte in quasi tutti i domini applicativi del Natural Language Processing. In questo contesto è stato sviluppato un applicativo per l'anonimizzazione di file, in grado di identificare entità specifiche rappresentative di dati personali.

2021

sintesi generativa multi-documento con discriminazione della rilevanza mediante probabilità marginale: una soluzione neurale end-to-end per la letteratura medica

Davide Freddi

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi
Abstract

Nonostante lo sviluppo scientifico in molti task di Natural Language Processing (NLP), il task di multi-document summarization rimane meno esplorato, lasciando ampi margini di miglioramento. Nella comunità medica e scientifica, questo task trova applicazione nella generazione delle revisioni sistematiche della letteratura, che sono articoli che riassumono molti studi su uno stesso argomento. In questo lavoro di tesi si esplorano le principali tecnologie in ambito di NLP e text generation, concentrandosi in particolare su BlenderBot 2, un'architettura sviluppata da Facebook AI che rappresenta lo stato dell'arte tra i modelli di chatbot. Le tecnologie studiate sono poi state estese e adattate al task di abstractive multi-document summarization in campo medico per affrontare la generazione automatica delle revisioni sistematiche della letteratura, proponendo un nuovo approccio che miri a risolvere alcuni dei problemi più comuni dei modelli utilizzati in tale ambito.

Apprendimento non supervisionato di rappresentazioni e legami di similarità tra eventi menzionati nella letteratura biomedica

Eleonora Bertoni

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

L'estrazione automatica degli eventi biomedici dalla letteratura scientifica ha catturato un forte interesse nel corso degli ultimi anni, dimostrandosi in grado di riconoscere interazioni complesse e semanticamente ricche espresse all'interno del testo.
Purtroppo però, esistono davvero pochi lavori focalizzati sull'apprendimento di embedding o di metriche di similarità per i grafi evento. Questa lacuna lascia le relazioni biologiche scollegate, impedendo l'applicazione di tecniche di machine learning che potrebbero dare un importante contributo al progresso scientifico.
Approfittando dei vantaggi delle recenti soluzioni di deep graph kernel e dei language model preaddestrati, proponiamo Deep Divergence Event Graph Kernels (DDEGK), un metodo non supervisionato e induttivo in grado di mappare gli eventi all'interno di uno spazio vettoriale, preservando le loro similarità semantiche e strutturali. Diversamente da molti altri sistemi, DDEGK lavora a livello di grafo e non richiede nè etichette e feature specifiche per un determinato task, nè corrispondenze note tra i nodi. A questo scopo, la nostra soluzione mette a confronto gli eventi con un piccolo gruppo di eventi prototipo, addestra delle reti di cross-graph attention per andare a individuare i legami di similarità tra le coppie di nodi (rafforzando l'interpretabilità), e impiega dei modelli basati su transformer per la codifica degli attributi continui. Sono stati fatti ampi esperimenti su dieci dataset biomedici. Mostriamo che le nostre rappresentazioni possono essere utilizzate in modo efficace in task quali la classificazione di grafi, clustering e visualizzazione e che, allo stesso tempo, sono in grado di semplificare il task di semantic textual similarity.
Risultati empirici dimostrano che DDEGK supera significativamente gli altri modelli che attualmente detengono lo stato dell'arte.

Rassegna su Quantum Machine Learning

Gianluca De Bonis

Supervisor
Gianluca Moro
Abstract

Il Quantum Computing (QC) e il Machine Learning (ML) sono due dei settori più promettenti dell’informatica al giorno d’oggi. Il primo riguarda l’utilizzo di proprietà fisiche di sistemi quantistici per realizzare computazioni, mentre il secondo algoritmi di apprendimento automatizzati capaci di riconoscere pattern nei dati. In questo elaborato vengono esposti alcuni dei principali algoritmi di Quantum Machine Learning (QML), ovvero versioni quantistiche dei classici algoritmi di ML. Il tutto è strutturato come un’introduzione all’argomento: inizialmente viene introdotto il QC spiegandone le proprietà più rilevanti, successivamente vengono descritti gli algoritmi di QML confrontandoli con le loro controparti classiche e infine vengono discusse le principali tecnologie attuali, mostrando alcune implementazioni degli algoritmi precedentemente discussi.

Descriptive Text Mining in ambito medico: applicazione della metodologia POIROT

Riccardo Battistini

Supervisor
Gianluca Moro
Abstract

Poiché la nostra conoscenza collettiva continua ad essere digitalizzata e memorizzata, diventa più difficile trovare e scoprire ciò che stiamo cercando.
Abbiamo bisogno di nuovi strumenti computazionali per aiutare a organizzare, rintracciare e comprendere queste vaste quantità di informazioni.
I modelli di linguaggio sono potenti strumenti che possono essere impiegati per estrarre conoscenza statisticamente significativa ed interpretabile tramite apprendimento non supervisionato, testuali o nel codice sorgente.
L’obiettivo di questa tesi è impiegare una metodologia
di descriptive text mining, denominata POIROT, per analizzare i rapporti medici del dataset Adverse Drug Reaction (ADE). Si vogliono stabilire delle
correlazioni significative che permettano di comprendere le ragioni per cui un determinato rapporto medico fornisca o meno informazioni relative a effetti collaterali dovuti all’assunzione di determinati farmaci.

Studio e applicazione di tecniche di classificazione di attività motorie con deployment di una soluzione su smartphone

William Carletti

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Sempre più dispositivi, in seguito allo sviluppo tecnologico degli ultimi anni, fanno impiego di sensori di movimento; tra questi troviamo gli smartphone, che, in particolare, sfruttano accelerometri e giroscopi. La reperibilità e ampia programmabilità di tali dispositivi li rendono ottimi mezzi per il reperimento di registrazioni di lunghezza arbitraria di attività fisica. Queste sequenze possono in seguito essere utilizzate nel campo di Human Activity Recognition (HAR), che prevede l'addestramento di modelli di Machine Learning che siano in grado di classificare le attività in base alla loro tipologia. I modelli di conoscenza ottenuti possono poi essere impiegati negli smartphone stessi che, grazie alla loro potenza, possono utilizzarli in delle applicazioni appositamente studiate, con l'obiettivo di effettuare predizioni. Un ostacolo allo sviluppo di una tale applicazione è la necessità di scrivere del codice sorgente separato per ogni sistema operativo mobile in cui si vuole rilasciare. Una soluzione a questa problematica che sta diventando sempre più frequente è la creazione di applicativi ibridi, in grado di funzionare su sistemi diversi malgrado lo sviluppo di una singola versione condivisa. In questo elaborato vengono analizzate e sperimentate le principali tecniche di Machine Learning utilizzate in campo di Activity Recognition, con particolare attenzione sulle reti neurali artificiali e Transformer; in seguito, viene sviluppata un'applicazione ibrida utilizzabile per dispositivi Android e iOS in grado di registrare attività fisiche e di sfruttare uno dei modelli ottenuti per classificare tali sequenze.

Topic Analysis della letteratura scientifica sul tema Computer Chess con Metodi di Text Mining Non Supervisionati

Andrea Borghesi

Supervisor
Angelo Di Iorio
Co-supervisors
Paolo Ciancarini, Gianluca Moro
Abstract

Progettazione e implementazione di modelli di text mining non supervisionati su un dataset di dati non strutturati: articoli sulla storia del computer chess. Si sono affrontati per cui argomenti legati al Natural Language Processing (NLP). Inoltre, sono state affrontate tecniche di text augmentation per provvedere al bilanciamento delle classi del dataset. Tra i modelli utilizzati sono presenti: LDA, Word Embeddings, algoritmi di Clustering e Transformers.

Classificazione di Radiografie Toraciche per la Diagnosi del COVID-19 con Reti Convoluzionali e Vision Transformer

Davide Domini

Supervisor
Gianluca Moro
Abstract

Negli ultimi due anni, per via della pandemia generata dal virus Covid19, la vita in ogni angolo del nostro pianeta è drasticamente cambiata. Ad oggi, nel mondo, sono oltre duecentoventi milioni le persone che hanno contratto questo virus e sono quasi cinque milioni le persone decedute. In alcuni periodi si è arrivati ad avere anche un milione di nuovi contagiati al giorno e mediamente, negli ultimi sei mesi, questo dato è stato di più di mezzo milione al giorno.

Gli ospedali, soprattutto nei paesi meno sviluppati, hanno subito un grande stress e molte volte hanno avuto una carenza di risorse per fronteggiare questa grave pandemia. Per questo motivo ogni ricerca in questo campo diventa estremamente importante, soprattutto quelle che, con l'ausilio dell'intelligenza artificiale, riescono a dare supporto ai medici. Queste tecnologie una volta sviluppate e approvate possono essere diffuse a costi molto bassi e accessibili a tutti.

In questo elaborato sono stati sperimentati e valutati due diversi approcci alla diagnosi del Covid-19 a partire dalle radiografie toraciche dei pazienti: il primo metodo si basa sul transfer learning di una rete convoluzionale inizialmente pensata per la classificazione di immagini. Il secondo approccio utilizza i Vision Transformer (ViT), un'architettura ampiamente diffusa nel campo del Natural Language Processing adattata ai task di Visione Artificiale. La prima soluzione ha ottenuto un’accuratezza di 0.85 mentre la seconda di 0.92, questi risultati, soprattutto il secondo, sono molto incoraggianti soprattutto vista la minima quantità di dati di training necessaria.

Sperimentazione di Deep Metric Loss per Self-Supervised Information Retrieval Systems su CORD19.

Enrico Brunetti

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Valgimigli
Abstract

Dopo lo sviluppo dei primi casi di Covid-19 in Cina nell’autunno del 2019, ad inizio 2020 l’intero pianeta è precipitato in una pandemia globale che ha stravolto le nostre vite con conseguenze che non si vivevano dall’influenza spagnola. La grandissima quantità di paper scientifici in continua pubblicazione sul coronavirus e virus ad esso affini ha portato alla creazione di un unico dataset dinamico chiamato CORD19 e distribuito gratuitamente. Poter reperire informazioni utili in questa mole di dati ha ulteriormente acceso i riflettori sugli information retrieval systems, capaci di recuperare in maniera rapida ed efficace informazioni preziose rispetto a una domanda dell'utente detta query. Di particolare rilievo è stata la TREC-COVID Challenge, competizione per lo sviluppo di un sistema di IR addestrato e testato sul dataset CORD19. Il problema principale è dato dal fatto che la grande mole di documenti è totalmente non etichettata e risulta dunque impossibile addestrare modelli di reti neurali direttamente su di essi. Per aggirare il problema abbiamo messo a punto nuove soluzioni self-supervised, a cui abbiamo applicato lo stato dell'arte del deep metric learning e dell'NLP. Il deep metric learning, che sta avendo un enorme successo soprattuto nella computer vision, addestra il modello ad "avvicinare" tra loro immagini simili e "allontanare" immagini differenti. Dato che sia le immagini che il testo vengono rappresentati attraverso vettori di numeri reali (embeddings) si possano utilizzare le stesse tecniche per "avvicinare" tra loro elementi testuali pertinenti (e.g. una query e un paragrafo) e "allontanare" elementi non pertinenti. Abbiamo dunque addestrato un modello SciBERT con varie loss, che ad oggi rappresentano lo stato dell'arte del deep metric learning, in maniera completamente self-supervised direttamente e unicamente sul dataset CORD19, valutandolo poi sul set formale TREC-COVID attraverso un sistema di IR e ottenendo risultati interessanti.

Verbalizzazione di eventi biomedici espressi nella letteratura scientifica: generazione controllata di linguaggio naturale da grafi di conoscenza mediante transformer text-to-text

Lorenzo Balzani

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Il periodo in cui viviamo rappresenta la cuspide di una forte e rapida evoluzione nella comprensione del linguaggio naturale, raggiuntasi prevalentemente grazie allo sviluppo di modelli neurali. Nell'ambito dell'information extraction, tali progressi hanno recentemente consentito di riconoscere efficacemente relazioni semantiche complesse tra entità menzionate nel testo, quali proteine, sintomi e farmaci. Tale task -- reso possibile dalla modellazione ad eventi -- è fondamentale in biomedicina, dove la crescita esponenziale del numero di pubblicazioni scientifiche accresce ulteriormente il bisogno di sistemi per l'estrazione automatica delle interazioni racchiuse nei documenti testuali. La combinazione di AI simbolica e sub-simbolica può consentire l'introduzione di conoscenza strutturata nota all'interno di language model, rendendo quest'ultimi più robusti, fattuali e interpretabili. In tale contesto, la verbalizzazione di grafi è uno dei task su cui si riversano maggiori aspettative. Nonostante l'importanza di tali contributi (dallo sviluppo di chatbot alla formulazione di nuove ipotesi di ricerca), ad oggi, risultano assenti contributi capaci di verbalizzare gli eventi biomedici espressi in letteratura, apprendendo il legame tra le interazioni espresse in forma a grafo e la loro controparte testuale. La tesi propone il primo dataset altamente comprensivo su coppie evento-testo, includendo diverse sotto-aree biomediche, quali malattie infettive, ricerca oncologica e biologia molecolare. Il dataset introdotto viene usato come base per l'addestramento di modelli generativi allo stato dell'arte sul task di verbalizzazione, adottando un approccio text-to-text e illustrando una tecnica formale per la codifica di grafi evento mediante testo aumentato. Infine, si dimostra la validità degli eventi per il miglioramento delle capacità di comprensione dei modelli neurali su altri task NLP, focalizzandosi su single-document summarization e multi-task learning.

Identificazione di deambulazione anomala dal rilevamento di punti chiave corporei con visione artificiale

Giacomo Accursi

Supervisor
Gianluca Moro
Abstract

La deambulazione è una delle attività più svolte quotidianamente. Una normale camminata richiede la coordinazione del sistema nervoso, muscoloelettrico e cardiorespiratorio.
La camminata è influenzata dall'età, dall'umore e persino da fattori socioculturali.
I disturbi nella deambulazione portano ad una perdita della libertà personale, a cadute, seguite da possibili lesioni, e in generale ad una riduzione nella qualità della vita.
Negli anziani la velocità è un potente predittore della mortalità.
L'attrezzatura e le metodologie utilizzate per l'analisi della camminata hanno fatto sostanziali progressi negli ultimi anni. Gli strumenti utilizzati permettono di diagnosticare in modo più efficiente e accurato coloro che hanno subito una lesione che influisce sulla loro capacità di camminare.
L'obiettivo della tesi è creare un modello che, attraverso il riconoscimento dei punti chiave corporei mediante tecniche di visione artificiale, riesca a classificare corretamente le deambulazioni anomale e quelle normali.

Abstractive Long Document Summarization: Studio e Sperimentazione di Modelli Generativi Retrieval-Augmented

Veronika Folin

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi
Abstract

In questa tesi si trattano lo studio e la sperimentazione di un modello generativo retrieval-augmented, basato su Transformers, per il task di Abstractive Summarization su lunghe sentenze legali. La sintesi automatica del testo (Automatic Text Summarization) è diventata un task di Natural Language Processing (NLP) molto importante oggigiorno, visto il grandissimo numero di dati provenienti dal web e banche dati. Inoltre, essa permette di automatizzare un processo molto oneroso per gli esperti, specialmente nel settore legale, in cui i documenti sono lunghi e complicati, per cui difficili e dispendiosi da riassumere. I modelli allo stato dell’arte dell’Automatic Text Summarization sono basati su soluzioni di Deep Learning, in particolare sui Transformers, che rappresentano l’architettura più consolidata per task di NLP. Il modello proposto in questa tesi rappresenta una soluzione per la Long Document Summarization, ossia per generare riassunti di lunghe sequenze testuali. In particolare, l’architettura si basa sul modello RAG (Retrieval-Augmented Generation), recentemente introdotto dal team di ricerca Facebook AI per il task di Question Answering. L’obiettivo consiste nel modificare l’architettura RAG al fine di renderla adatta al task di Abstractive Long Document Summarization. In dettaglio, si vuole sfruttare e testare la memoria non parametrica del modello, con lo scopo di arricchire la rappresentazione del testo di input da riassumere. A tal fine, sono state sperimentate diverse configurazioni del modello su diverse tipologie di esperimenti e sono stati valutati i riassunti generati con diverse metriche automatiche.

Elaborazione del Linguaggio Naturale con Metodi Probabilistici e Reti Neurali

Michele Pio Prencipe

Supervisor
Gianluca Moro
Abstract

L'elaborazione del linguaggio naturale (NLP) è il processo per il quale la macchina tenta di imparare le informazioni del parlato o dello scritto tipico dell'essere umano. La procedura è resa particolarmente complessa dalle numerose ambiguità tipiche della lingua o del testo: ironia, metafore, errori ortografici e così via.

Grazie all'apprendimento profondo, il Deep Learning, che ha permesso lo sviluppo delle reti neurali, si è raggiunto lo stato dell'arte nell'ambito NLP, tramite l'introduzione di architetture quali Encoder-Decoder, Transformers o meccanismi di attenzione.
Le reti neurali, in particolare quelle con memoria o ricorrenti, si prestano molto bene ai task di NLP, per via della loro capacità di apprendere da una grande mole di dati a disposizione, ma anche perché riescono a concentrarsi particolarmente bene sul contesto di ciascuna parola in input o sulla sentiment analysis di una frase.

In questo elaborato vengono analizzate le principali tecniche per fare apprendere il linguaggio naturale al calcolatore elettronico; il tutto viene descritto con
esempi e parti di codice Python. Per avere una visione completa sull'ambito, si prende come riferimento il libro di testo "Hands-On Machine Learning with Scikit-Learn, Keras and Tensorflow" di Aurélien Géron, oltre che alla bibliografia correlata.

Sviluppo di un sistema di riconoscimento di stenosi coronariche non gravi.

Matteo Scala

Supervisor
Gianluca Moro
Abstract

L’Intelligenza Artificiale è un campo dell’informatica che da tempo si afferma come valido strumento alternativo per la risoluzione di problemi tipicamente
riservati esclusivamente all’intelletto umano.
Se in principio gli algoritmi sfruttati nel campo dell’Intelligenza Artificiale
erano basati su insiemi di regole codificate da esperti del dominio di applicazione dell’algoritmo, con l’arrivo del secondo millennio questo approccio è stato
superato in favore di algoritmi che sfruttano grandi quantità di dati ed elevata
potenza di calcolo per fare scelte ottimali. Un esempio di questo approccio può
essere Deep Blue, che nel 1996, anche grazie ad un database di 4mila aperture
e un’architettura che permetteva 11 GFLOPS fu la prima macchina a vincere
una partita a scacchi contro un grande maestro.
Col passare degli anni, l’aumentare degli investimenti e della ricerca, questo
approccio ha portato alla strutturazione del campo dell’Apprendimento Automatico (Machine Learning, in inglese) dal quale sono scaturiti numerosi
avanzamenti che hanno influenzato una moltitudine di ambiti: dall’agricoltura
di precisione alla traduzione automatica, dal riconoscimento di frodi con carte
di credito alla farmaceutica, dal marketing alla visione artificiale e molti altri,
inclusa la medicina.
Questo lavoro si concentra su proprio questioni relative al campo della medicina. In particolare si occupa di provare a riconoscere se le stenosi coronariche
di un paziente sono gravi o meno attraverso l’uso di angiografie coronariche
invasive e tomografie coronariche angiografiche; in maniera da diminuire delle
angiografie coronariche invasive effettuate su pazienti che non ne hanno davvero
bisogno.

Similarità semantica e clustering di concetti della letteratura medica rappresentati con language model e knowledge graph di eventi

Giulio Carlassare

Supervisor
Antonella Carbonaro
Co-supervisors
Giacomo Frisoni, Gianluca Moro, Antonella Carbonaro
Abstract

Sul web è presente una grande quantità di informazioni principalmente in formato testuale e la diffusione dei social network ne ha incrementato la produzione. La mancanza di struttura rende difficile l'utilizzo della conoscenza contenuta, generalmente espressa da fatti rappresentabili come relazioni (due entità legate da un predicato) o eventi (in cui una parola esprime una semantica relativa anche a molte entità). La ricerca sta muovendo recentemente il proprio interesse verso i Knowledge Graph che permettono di codificare la conoscenza in un grafo dove i nodi rappresentano le entità e gli archi indicano le relazioni fra di esse. Nonostante al momento la loro costruzione richieda molto lavoro manuale, i recenti passi nel campo del Natural Language Understanding offrono strumenti sempre più sofisticati: in particolare, i language model basati su transformer sono la base di molte soluzioni per l'estrazione automatica di conoscenza dal testo.
I temi trattati in questa tesi hanno applicazione diretta nell'ambito delle malattie rare: la scarsa disponibilità di informazioni ha portato alla nascita di comunità di pazienti sul web, in cui si scambiano pareri di indubbia rilevanza sulla propria esperienza. Catturare la "voce dei pazienti" può essere molto importante per far conoscere ai medici la visione che i diretti interessati hanno della malattia.
Il caso di studio affrontato riguarda una specifica malattia rara, l'acalasia esofagea e il dataset di post pubblicati in un gruppo Facebook ad essa dedicato.
Si propone una struttura modulare di riferimento, poi implementata con metodologie precedentemente analizzate. Viene infine presentata una soluzione in cui le interazioni in forma di eventi, estratte anche con l'utilizzo di un language model, vengono rappresentate efficacemente in uno spazio vettoriale che ne rispecchia il contenuto semantico dove è possibile effettuare clustering, calcolarne la similarità e di conseguenza aggregarli in un unico knowledge graph.

Sperimentazione e confronto di soluzioni per il rilevamento della mascherina sanitaria facciale

Matteo Andreotti

Supervisor
Gianluca Moro
Abstract

L’obiettivo principale della tesi, è quello di mettere a confronto soluzioni basate su tecnologie diverse e individuare la soluzione migliore che permetta di stabilire se le persone inquadrate in un’immagine indossano correttamente o meno la mascherina protettiva come previsto dalle norme anti-covid. Per raggiungere l’obiettivo verranno confrontate diverse architetture costruite per lo stesso scopo e che si basano sui principi di Machine Learning e Deep Learning, e verranno messe in funzione su insieme di dataset individuati, che sono stati creati per propositi affini.

Sperimentazione di soluzioni di machine learning per la previsione di indice di borsa

Paolo Penazzi

Supervisor
Gianluca Moro
Abstract

Il Machine Learning ha portato al raggiungimento di ottimi risultati in diversi ambiti, tra cui il mercato azionario. Sono nati molti fondi di investimento che basano la loro strategia sulle decisioni prese da un algoritmo. Questa tesi tratta della sperimentazione di una soluzione per la previsione di un indice di borsa, che utilizza architetture note in altri ambiti del machine learning. Facendo uso di tecnologie disponibili in letteratura come il meccanismo di attention e i Transformer, si riesce a prevedere l'andamento dell'indice di borsa S&P500 con un'accuratezza superiore a quella di un modello baseline utilizzato come riferimento.

2020

Estrazione di Correlazioni Medicali da Social Post non Etichettati con Language Model Neurali e Data Clustering

Alessandro Lombardini

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

La progressiva informatizzazione della società a cui il mondo contemporaneo sta assistendo, ha generato un radicale cambiamento nelle abitudini delle persone, le quali oggi giorno trascorrono sempre più tempo online e creano reti di conoscenza prima inimmaginabili. Tale cambiamento ha coinvolto, nel suo avanzare, anche gli individui affetti da malattie di varia natura. In particolare, la scarsa disponibilità di informazioni che caratterizza alcuni contesti medici, unita al bisogno di dialogare con altre persone aventi la medesima problematica, ha determinato negli ultimi anni una forte crescita di comunità sulle piattaforme social, all’interno delle quali vengono scambiati dettagli rispetto a trattamenti, centri specializzati e dottori. In questo senso, i social network sono diventati il luogo in cui i pazienti sono più propensi a condividere le proprie esperienze e opinioni maturate durante il corso della propria malattia. Questa tesi nasce dalla consapevolezza del valore di tali dati e dalla volontà di consentire un ragionamento logico deduttivo al di sopra di essi. Nello specifico, si intende estrarre — con un approccio non supervisionato, mediante l’uso di language model neurali e data clustering — le correlazioni semantiche racchiuse nell’elevata quantità di testo generato dagli utenti attraverso interazioni social, prendendo l’Acalasia Esofagea come caso di studio.

Master Theses 46

2026

Foundational Transformer Models for Financial Time Series Forecasting

Mohammad Pourtaheri

Supervisor
Gianluca Moro
Co-supervisors
Giovanni Pio Delvecchio
Abstract

Predicting short-horizon equity price movements remains a fundamental challenge in quantitative finance. Forecasting models typically use regression metrics like RMSE, measuring prediction fidelity rather than trading performance. Deep learning, particularly pretrained time-series foundation models, has renewed interest in this task through zero-shot forecasting.

This thesis addresses that gap through a multi-phase empirical study of modern forecasting methods under a single, integrity-checked protocol. We compare prompt-based large language models, the Chronos family of pretrained forecasters, xLSTM-ts, StockMixer, and cgc_x, a novel hybrid architecture that couples a frozen Chronos-T5 backbone with an xLSTM covariate encoder trained under walk-forward optimisation. A systematic integrity audit identified global normalisation leakage in the StockMixer and xLSTM-ts pipelines; both were patched before evaluation.

On standard regression metrics, patched baselines and Chronos variants achieve similar next-day price error (RMSE ~3.6). The main distinction emerges in cross-sectional ranking: cgc_x v1 achieves the highest information coefficient (IC = 0.093, IC IR = 0.261), indicating superior within-day asset ranking. Its RMSE remains comparable to zero-shot Chronos-T5, suggesting walk-forward domain adaptation strengthens cross-sectional signals without materially improving absolute price forecasts. ChronosX achieves the second-highest IC, indicating covariate injection also improves ranking relative to zero-shot inference.

The audit framework, evaluation protocol, and patched reruns provide a reproducible baseline for future work. The study is deliberately bounded: next-day daily forecasting, a 10-symbol universe, and frictionless backtests.

State-Grounded GUI Agents for Long-Horizon Tasks in Web Environments

Ehsan Ramezani

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta

RadRelBench: A Benchmark for Deep Learning on Multimodal Relational Databases of Chest Radiographs

Luca Mercuriali

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Traditional Machine Learning approaches applied to Electronic Health Records (EHRs) often require flattening complex relational databases into single tabular matrices. This conventional preprocessing step leads to the destruction of the sequential clinical hierarchy, the creation of highly sparse feature spaces, and a significantly increased risk of temporal data leakage. To
overcome these fundamental limitations, this thesis proposes and validates a Multimodal Relational Deep Learning pipeline leveraging the open-source RelBench framework.
By natively mapping the relational schema of the MIMIC-IV database into a Heterogeneous Temporal Graph, the proposed architecture preserves the intrinsic chronological order of patient admissions, laboratory results, and clinical interventions. Furthermore, this methodology successfully extends the relational structure to encompass unstructured visual data by seamlessly integrating high-dimensional Med-SigLIP embeddings, extracted from MIMIC- CXR-JPG chest radiographs, directly into the graph topology.
The predictive capabilities of the architecture are empirically evaluated across three distinct clinical tasks: ICU Length of Stay (administrative), In-Hospital Mortality (prognostic), and CXR Multilabel Pathology Classification (diagnostic). The core learning mechanism, utilizing HeteroGraphSAGE, effectively aggregates multi-hop clinical and visual context through strict temporal neighborhood sampling, rigorously guaranteeing the absence of future data leakage.
Experimental results demonstrate the clear superiority of the Multimodal Graph Neural Network. The proposed model consistently outperforms both traditional feature-engineered baselines (LightGBM) and unimodal network variants (Tabular-Only and Image-Only GNNs). Ultimately, this work establishes a robust, leakage-free, and highly scalable paradigm for transforming raw, heterogeneous hospital databases into accurate predictive intelligence.

Unsupervised Optimization of Accuracy and Interpretability in Multimodal Models for Medical Disease Diagnosis

Federico Marchi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

In recent years, contrastive models like CLIP have dominated cross-modal retrieval by aligning images and text in a shared embedding space for zero-shot flexibility. Yet most represent images as single global embeddings, lacking mechanisms to identify regions driving text similarity, a fundamental barrier to interpretable retrieval.
In the medical field, this limitation is critical. Models like GLoRIA, BioViL and BiomedCLIP improve representations via domain-specific pre-training but discard spatial structure. In chest radiography, when pathologies occupy only a small fraction of the image, indiscriminate processing of all patches dilutes discriminative signals and obscures which regions drive predictions.
This thesis systematically explores families of text-conditioned patch selection strategies built on BiomedCLIP, progressively moving from post-ViT local alignment through external patch masking to fully integrated intra-ViT selection, where patches are scored via FILIP (Fine-grained Interactive Language-Image Pre-training) at intermediate layers and either hard-dropped or soft-gated. Each approach is evaluated across multiple configurations on MIMIC-CXR and MS-CXR, measuring retrieval quality, interpretability, and embedding structure.
Results show that text-conditioning is the critical design choice: FILIP-based intra-ViT selection consistently improves embedding structure over the global contrastive baseline without sacrificing retrieval quality. Among intra-ViT methods, soft sigmoid gating achieves the strongest spatial grounding, while adaptive thresholding produces dramatically more faithful patch attributions than any fixed-budget approach. These findings establish text-conditioned intra-ViT patch selection as a promising direction for interpretable vision-language retrieval, revealing a fundamental trade-off between clustering quality, retrieval, and faithfulness that provides concrete design guidelines for future architectures beyond the radiology domain.

Automated Classification of Multilingual User Feedback in Fitness Applications Through Hybrid Retrieval and Large Language Models

Javokhir Isomurodov

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta
Abstract

The proliferation of connected fitness applications generates large volumes of unstructured, multilingual user feedback that must be classified in real time. Traditional approaches such as manual review and keyword-based rules fail to scale with growing user bases and cannot capture the semantic nuance of text where users describe software bugs without explicit technical terminology. This thesis presents a hybrid classification pipeline combining vector database retrieval with Large Language Models (LLMs) to automatically detect software bugs in user-submitted feedback. The architecture follows a Retrieval-Augmented Generation (RAG) paradigm: incoming feedback is vectorised and queried against a Pinecone vector database of historically classified entries; if a sufficiently similar entry is found, its label is inherited directly; otherwise, the feedback is routed to an LLM ensemble (Gemini and GPT-4o) for context-aware semantic classification. A multilingual data engineering pipeline handles normalisation, language detection, and deduplication of the raw corpus. Extensive experiments compare four embedding models, multiple k-NN voting strategies, two distance metrics, and two LLM backends on a production dataset of 17,822 feedback entries from the Technogym App.
Results demonstrate that the hybrid pipeline achieves an F1 score of 0.74 and an Average Precision of 0.84, outperforming standalone LLM classification by +0.54 F1 points (F1: 0.74 vs. 0.20) and improving recall by +0.11 over standalone vector search (recall: 0.70 vs. 0.58), while routing 69% of feedback through a cost-free retrieval path and reducing LLM API calls by 69%.

Enhancing Entity Representations through Soft Prompt Tuning: An Efficient Approach to Biomedical Named Entity Recognition

Alessandro Becci

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta, Stefano Fantazzini
Abstract

Named Entity Recognition (NER) has evolved in recent years from closed-vocabulary systems, constrained by fixed label sets, to zero-shot models capable of identifying entities dynamically through semantic descriptions. Models such as GLiNER exemplify this paradigm shift, making entity recognition generalizable to unseen entity types without additional supervision.
Such models use natural language descriptions and Transformer-based architectures to generalize across diverse domains without requiring retraining for new entity types.
However, their performance degrades in highly specialized domains such as biomedicine, where complex nomenclature and technical terminology demand domain-specific tuning. While full fine-tuning remains the prevailing method for domain adaptation in NER, the extent to which parameter-efficient fine-tuning (PEFT) techniques can provide comparable specialization has yet to be investigated.
We present a comparative analysis of five distinct adaptation techniques applied to GLiNER for biomedical entity recognition: (1) Label Descriptions as Semantic Anchors, a description-driven bi-encoder baseline where entity types are grounded via fine-tuning of the label encoder; (2) Soft Prompting, comprising three sub-approaches: (2.1) Base Approach, using learnable embedding matrices; (2.2) Embedding Injection, inserting trainable prompts into Transformer layers; (2.3) Custom GLiNER Extension, combining Embedding Injection with native fine-tuning; and (3) Baseline Fine-tuning, included as reference method for comparative evaluation.
Experiments are conducted on JNLPBA and BC5CDR, two biomedical benchmarks, with evaluation based on Macro and Micro F1 scores.
Our Custom GLiNER Extension, training only 13% of model parameters, achieves competitive performance (JNLPBA Macro F1: 0.7016, BC5CDR Macro F1: 0.8526), closely matching standard fine-tuning (0.7164 and 0.8833) at a fraction of the trainable parameters, offering empirical guidance for PEFT approaches.

Chess-Reachy: Autonomous Robotic Chess Gameplay through Large Language Models and Model Context Protocol

Andrea Bianchi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

Physical AI has rapidly become one of the most challenging but exciting frontiers in artificial intelligence, where AI systems must perceive, reason, and act within the real world. This thesis presents an application that integrates Large Language Models, the Model Context Protocol, and the Reachy Mini desktop humanoid robot to enable autonomous chess games and human-robot interaction.
The system is built around a custom MCP server developed using FastMCP, exposing a set of nine tools that allow an AI host such as Claude to control the robot's physical capabilities, including speech, expressions, audio perception, and visual analysis. The core challenge addressed is chessboard understanding: given a photograph of a chess game and the previous board state in ASCII or FEN notation, the system must identify the last move played and return it in Standard Algebraic Notation. To support this, a dataset of approximately 9.800 labeled chessboard images was constructed from 3D rendered sources and used to fine-tune two vision-language models, Qwen3-VL-8B and Gemma-3-4B, using Supervised Fine-Tuning with LoRA adapters and NF4 quantization.
Experimental results show that while training converges healthily, exact-match accuracy on 3D rendered images remains limited, with Qwen achieving the best exact-match rate of 8,55\% and Gemma 7,7\%. Despite this, the full application pipeline successfully demonstrates expressive human-robot interaction, conversational capabilities, and correct move identification on 2D chessboard inputs, confirming the viability of LLM-driven Physical AI for complex real-world tasks.

Multimodal Retrieval-Enhanced Large Language Models for Pictogram Interaction in Augmentative and Alternative Communication

Laura Lucchiari

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Giacomo Frisoni
Abstract

Pictogram-based Augmentative and Alternative Communication (AAC) systems are essential for individuals with complex communication needs, yet navigating large symbol vocabularies remains slow and cognitively demanding. This thesis investigates multimodal, retrieval-enhanced methods to streamline pictogram selection by aligning natural-language intent with AAC repositories, specifically the ARASAAC library.

Analysis of ARASAAC metadata reveals significant heterogeneity. To address this, a description-generation pipeline was developed using a vision-language model to assign each pictogram a consistent, keyword-grounded English phrase. Quantitative validation via embedding-based metrics demonstrates that these descriptions provide superior alignment and coverage compared to original metadata.

A structured sentence-concept-pictogram dataset was constructed using CommonGen as a grammatical backbone. Concept-to-pictogram mappings were reconstructed through a multi-stage retrieval involving dense retrieval, multimodal filtering, and LLM-based selection. Using this resource, a CLIP-style multimodal retriever was fine-tuned for prefix-based pictogram completion. Evaluations show the fine-tuned model significantly outperforms frozen baselines, with Recall@1 increasing from 4.23% to 10.66% and Recall@5 from 13.07% to 27.79%, proving the efficacy of domain-adapted retrieval for predictive AAC.

Finally, an original, profile-aware AAC sentence corpus is introduced, designed to reflect clinically grounded user profiles and pragmatic intent. By modeling variability across age groups and goals, this resource enables ecologically valid evaluation. The corpus is paired with a retrieval pipeline to stress-test reranking and selection under realistic distributions, facilitating the study of generalization and profile-dependent semantic alignment.

Graph-of-Mark: Graph-Based Visual Prompting for Enhanced Spatial Reasoning in Multimodal Language Models

Mattia Buzzoni

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

In recent years, with the widespread adoption of Multimodal Language Models (MLMs), there has been growing interest in integrating visual information into language models. Despite notable progress, current models still face significant limitations in understanding and performing spatial reasoning over complex visual scenes. Several visual prompting approaches have been proposed to mitigate these challenges. For example, Set-of-Mark partitions an image into multiple regions and assigns numerical
identifiers before passing the modified input to the MLM.
However, such methods often neglect the spatial relationships between objects, restricting the model’s ability to capture the global context of the scene. This thesis presents Graph of Marks, a hybrid framework that combines traditional computer vision techniques with multimodal language models to construct enriched scene graphs for structured visual representation. The proposed method integrates multiple object detectors (OWLv2, YOLOv8, Detectron2), automatic segmentation algorithms (SAM),
and modules for extracting spatial and semantic relations. The resulting scene graphs capture both the detected objects and their interconnections, providing the MLM with the original
image augmented with visual annotations (bounding boxes, segmentation masks, identifiers) as well as structured textual descriptions that explicitly encode spatial and semantic relationships. Experiments were conducted on widely used datasets such as RefCOCOg, GQA, VQAv1, and VQAv2,
employing state-of-the-art models including Gemma-3, Qwen2.5-VL, Qwen3-VL and LlamaV-o1. The evaluation focused on assessing spatial reasoning and relational understanding.
Results demonstrate that integrating structural information through scene graphs, in combination with enriched visual and textual prompts, leads to significant improvements
in answer accuracy, particularly in tasks requiring complex spatial reasoning.

2025

The Pixel Piper: Guiding Diffusion Models with Attention-Based Predicate Logic for Feature Consistent Text-to-Image Generation

Kankana Ghosh

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Giacomo Frisoni

Train an Agent to Evaluate your Models: a Dataset for Metric Function Call Built through Autonomous Trial and Error

Matteo Belletti

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta

From-Scratch Development of a Domain-Adaptive Mixture of Expert Language Model for Biomedical Named Entity Recognition

Umberto Carlucci

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Giacomo Frisoni

2024

End-to-End Extraction and Injection of Graphs: A Self-Supervised Neuro-Symbolic Method for Explainable Large Language Models

Andrea Zecca

Supervisor
Gianluca Moro
Co-supervisors
Lorenzo Molfetta, Giacomo Frisoni
Abstract

The increasing adoption of Large Language Models (LLMs) in diverse domains highlights the need to enhance their explainability, scalability, and adaptability to domain-specific challenges. This thesis introduces Graph In The Middle (GITM), a self-supervised neuro-symbolic framework for the end-to-end extraction and injection of graphs into LLMs. GITM leverages graph-based representations to improve the interpretability and reasoning capabilities of LLMs, particularly for Multiple Choice Question Answering (MCQA) tasks.

The framework comprises three core components: the Graph Extractor, generating adjacency matrices for relational modeling; the Graph Encoder, transforming graph structures into embeddings; and the Answer Generator, integrating graph insights into LLMs. SparseMAP and LP-SparseMAP ensure efficient, interpretable structured predictions while maintaining end-to-end differentiability.

Experimental evaluation on the CommonsenseQA dataset, enriched with ConceptNet-derived graphs, demonstrates the efficacy of GITM. Using Llama3.2 (1B and 3B), we achieved an average of 63% accuracy with frozen LLMs (+29.58 points over baseline) and 72.86% with trainable LLMs (+19.90 points over baseline). These results highlight the critical role of graph-based embeddings in enhancing reasoning and explainability.

This research bridges neural and symbolic reasoning, offering a robust methodology to improve LLMs while addressing hallucinations, interpretability, and domain-specific challenges. It advances explainable AI with implications for transparency and trustworthiness in critical applications.

End-to-End Vision Language Processing of Identity Documents: Detection, Classification and Extraction

Matteo Vannucchi

Supervisor
Gianluca Moro
Abstract

The efficient processing of identity documents is essential in sectors such as finance, healthcare and government. Traditional manual methods are often slow and susceptible to errors. This thesis develops an end-to-end pipeline that integrates object detection, image classification and vision-language models to automate the processing of identity documents, including detection, classification and data extraction from images. This work was conducted in two distinct phases: the first phase, conducted during an industry internship, focused on detection and classification using state-of-the-art models, such as RTMDet, YOLOX and EfficientNet, achieving near-perfect accuracy across various document types. The second phase, carried out in an academic setting, leveraged advanced vision language models, such as Donut, Qwen2 and LayoutLMv3, to extract structured information directly from document images. These models demonstrated remarkable accuracy in text extraction tasks, even in challenging real-world scenarios. By integrating object detection, classification and vision-language approaches, this thesis highlights the potential of combining visual and linguistic processing for scalable, efficient and precise document analysis.

First-Order Logic Formulation and Injection into Large Language Models for Driven Question Answering

Francesco Zangrillo

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Molfetta
Abstract

This project enhances question-answering (QA) capabilities by integrating First-Order Logic (FOL) into Large Language Models (LLMs) through an iterative refinement process that directly translates natural language into FOL. Unlike traditional models like SymbCoT and LogicLLaMA, which exhibit limitations in planning and reasoning coherence on complex tasks, this approach embeds FOL predicates and logical clauses into both the contexts and questions from the outset of model training. The method involves creating an augmented dataset based on the MS MARCO benchmark, fine-tuned with FOL enhancements to improve the logical reasoning capabilities of LLMs. The architecture performs iterative FOL translation directly on inputs, ensuring logical consistency throughout the reasoning process. It combines symbolic solvers like Prover9 with a semantic refinement mechanism using LogicLLaMA to ensure the syntactic and semantic accuracy of the generated logic structures. Evaluation results show significant improvements in both exact match and ROUGE scores across various inference techniques. The FOL fine-tuned model achieves an exact match score of 0.226 in zero-shot inference, marking a substantial enhancement of +16 points over the base model. ROUGE scores also see notable increases: ROUGE-1 is up by +17 points, ROUGE-2 by +10 points, and both ROUGE-L and ROUGE-Lsum by +19 points. These findings demonstrate that integrating FOL from the early stages of training enables LLMs to handle complex reasoning tasks with greater accuracy and coherence. This method reduces inconsistencies in logical conclusions while providing clearer, more transparent justifications for model decisions, setting a new standard for logic-enhanced question-answering systems.

Open-Domain Medical Question Aswering with Graph-Enhanced Large Language Models

Davide Freddi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Claudio Sartori, Paolo Papotti

Multi-Domain Conversational Agents based on Semantic Parsing and Retrieval of External Knowledge

Nicola Poggialini

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Retrieval-enhanced conversational agents are able to access external sources and exploit them to generate better responses to a given input prompt. Different solutions based on this paradigm have already been proposed in the literature, but they have never been presented together with Abstract Meaning Representation (AMR) graphs. AMRs provide structured modeling of what is said in a document, regardless of its form: they can extract the concepts expressed in a sentence and have the potential to alleviate its ambiguity. This thesis introduces a conversational agent that relies on a combined use of retrieval technology and AMRs. In particular, a retriever identifies relevant documents from an external source, while AMRs are used to refine these selections. The model has been trained and tested on the MultiDoc2Dial dataset, which comprehends multi-domain dialogues and a knowledge base of a few thousand snippets. Our proposal demonstrates consistent performance across different conversation topics. We provide evidence that this approach can enhance a conversational agent's abilities. The results show that the AMR augmentation improves the ROUGE-L on the generation of the next utterance.

Infusing Structured Medical Knowledge into Language Models: Graph Neural Prompting for Healthcare Question Answering

Yiran Zeng

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Lorenzo Valgimigli
Abstract

Current natural language processing models have made significant strides in understanding medical texts. Recent research leverages non-parametric external sources of relevant factual information. It taps into latent world knowledge to enhance performance and interpretability in the medical domain. However, a lack of in-depth understanding of structured medical knowledge limits its practical application in complex medical contexts.
In this thesis, we present MedGNP, the first method for infusing structured medical knowledge into language models, a plug-and-play new approach applying a prompting framework by grounding knowledge to enhance models’ capabilities in addressing question-answering tasks within the medical domain. MedGNP incorporates various designs, including a graph attention network, cross-modal attention module, domain projector, and a bilinear model for self-supervised link prediction.
We evaluated our method on three popular medical question-answering datasets: PubMedQA, BioASQ and MedQA. After knowledge grounding using MedGNP method, we get improvement across all datasets from 1.26% to 6.0% by leveraging 30M extra parameters, which takes only 12% of the original model. Furthermore, MedGNP allows a generalist model to achieve comparable results with state-of-the-art models that underwent a domain-specific pre-training extension while using up to 12x fewer trainable parameters, proving the effectiveness of this approach to successfully knowledge grounding language model. Finally, we discuss potential future work on this topic.

2023

Neural Self-Supervised Information Retrieval: An Efficient and Effective Solution in Large Document Corpora

Samuele Marino

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Cristiano Casadei, Lorenzo Valgimigli
Abstract

This thesis delves into the transformative impact of Transformer models, such as BERT and GPT, within the realm of search engines. It underscores their prowess in enhancing natural language processing by capturing intricate linguistic relationships and context, leading to more precise and context-aware search outcomes. The study recognizes the challenges associated with computational resources and unlabeled data and proposes a novel approach, a self-supervised information retrieval system utilizing unlabeled data from GRUPPO MAGGIOLI.

In addition to addressing these challenges, the research endeavors to enhance multilingual Transformer models, particularly for the Italian language, thereby contributing to the field of Italian information retrieval. Moreover, it sheds light on the necessity for specialized vector databases to efficiently handle the voluminous data generated by Transformer models. The vector database assumes a crucial role in ensuring rapid and accurate indexing, especially in the context of managing extensive datasets, as exemplified by the scenario at GRUPPO MAGGIOLI. This comprehensive exploration aims to provide insights into the adaptability, challenges, and potential impact of incorporating Transformer models into search engines.

Introduzione a PAR(Parse And Repeat): un nuovo approccio alla trasformazione Text-to-AMR

Andrea Negri

Supervisor
Antonella Carbonaro
Co-supervisors
Giacomo Frisoni, Gianluca Moro
Abstract

I Large Language Model (LLM) hanno rivoluzionato il campo del Natural Language Processing e dell'intelligenza artificiale, dimostrandosi in grado di risolvere un gran numero di "language task". Tuttavia, operano come "scatole nere", con limitato accesso a conoscenze fattuali. D'altra parte, i Knowledge Graph (KG) offrono maggior trasparenza e accesso a conoscenze fattuali mentre gli Abstract Meaning Representation (AMR) forniscono una rappresentazione strutturata della semantica di una frase. Di contro, la creazione e la gestione di KG e AMR sono spesso complesse e laboriose. Integrare LLM con KG e AMR emerge quindi come una strategia vantaggiosa, sfruttando le capacità dei LLM per affrontare le sfide nella costruzione di KG e AMR.

In questa tesi viene introdotto PAR (Parse And Repeat), un nuovo approccio alla trasformazione Text-to-AMR. Questo modello sfrutta il meccanismo di prompt dei LLM e una verifica iterativa per raffinare i grafi AMR. Quest'ultima consente di migliorare incrementalmente i grafi AMR prodotti sulla base dei suggerimenti forniti da un verificatore, cercando quindi di ottenere prestazioni ottimali in un ambiente zero-shot.

Explaining generative model for long-form question answering with reasoning graph

Fabian Vincenzi

Supervisor
Gianluca Moro
Co-supervisors
Luca Ragazzi, Lorenzo Valgimigli
Abstract

Question Answering (QA) is a branch of Natural Language Processing (NLP) that focuses on constructing systems that can answer human inquiries in natural language. There are various approaches to achieve this objective, the primary distinction is whether the system is open or closed-domain, and in the case of open-domain, whether it is text-based, knowledge-based, or a hybrid.

Even if the model can store domain information in its parameters and leverage it to answer questions, open-domain QA systems fail to encode all the external knowledge needed, such as Wikipedia text corpus, because of the vast amount of it. That would be theoretically possible for Large Language models with billions of parameters.
This approach has two important drawbacks: (i) training such model requires highly expansive hardware, enormous datasets, and a lot of time; (ii) updating the knowledge is a not-trivial task that involves retrain.

Thus, it is better to leverage external Knowledge Bases (EKB) such as Knowledge Graph (KG) that models world knowledge via relational triplets between entities. This approach is called retrieval-based QA.

Despite the high accuracy of these models, the reasoning behind the generated answer is not transparent, indeed these models are called black box. This has raised the question of whether we can trust these answers. This is now a major area of research known as Explainability.

This work examines how to improve open-domain QA responses by introducing a custom layer that interacts with a knowledge graph.

Leveraging Large Language Model Distillation to Enhance Zero-Shot Named Entity Recognition and Classification

Alessio Cocchieri

Supervisor
Claudio Sartori
Co-supervisors
Gianluca Moro, Giacomo Frisoni, Marcos Martínez Galindo
Abstract

Named entity recognition and classification (NERC) is a crucial task in natural language processing. Annotations help a lot in this task but, in the real world, annotations are chronically difficult to obtain and generalization to unseen types loom large. Embracing zero-shot learning becomes essential to surmount the absence of training examples. However, substantial prior knowledge is required to achieve remarkable outcomes, particularly in domain-specific scenarios. Although large language models (LLMs) hold great potential, computational cost and inefficiency severely hamper their applicability, favoring smaller specialized networks. In this paper, we propose JUICER, the first LLM distillation framework for zero-shot NERC in resource-constrained environments. Mechanically, JUICER transfers LLM knowledge to BERT-based models with a preliminary fine-tuning process centered on generative data augmentation above massive pre-training corpora. Generalizability is further promoted by injecting textual target class descriptions through cross-attention. We conduct extensive experiments on three zero-shot adapted BIO-format datasets. In this pursuit, we center our distillation process on biomedicine and assess adaptability to news and legal domains. Our knowledge-distilled models outperform state-of-the-art baselines across all benchmarks up to 0.27 macro-averaged F1 points, proving the benefit of numerous observed classes. Compared to zero-shot and reparametrized LLMs, we achieve superior overall results across all datasets using 510× fewer parameters. Interestingly, when trained in cross-domain setups, JUICER models experience a further increase of up to 0.07 points.

Knowledge-enhanced neural models for question answering based on retrieval

Lorenzo Molfetta

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni, Stefano Lodi
Abstract

Explainability in AI models has emerged as a paramount concern in various domains, including natural language processing (NLP). Understanding and interpreting AI models' decision-making processes is crucial for ensuring their ethical and trustworthy deployment. This thesis addresses the pressing need to improve explainability in language models, explicitly focusing on knowledge retrieval and integration for question-answering tasks. It delves into the rich landscape of neuro-symbolic and sub-symbolic techniques in reasoning, highlighting their strengths in combining rule-based interpretability with data-driven learning. The study provides a comprehensive overview of research advances in explainable AI. Also, it proposes to adopt a context-augmentation strategy for tackling the question-answering task in the biomedical field. This approach aims at enhancing the performances of retrieval models without intervening directly on its core functioning, namely modifying its parameters, but rather carrying out a reranking of the retrieved passages internally to the inference network. The proposed strategy suggests leveraging external sources more efficiently by integrating structured knowledge into the answer generation. This thesis encourages the usage of systems fostering explainability by showing the theoretical foundations and results of knowledge-enhanced solutions in the question-answering field. By inspiring confidence in users, regulators, and stakeholders, we propel the deployment of AI technologies towards a more transparent and accountable future.

Next Pictogram Prediction via Vision-Language Modeling: Enhancing Communication of Autistic Children

Martina Ianaro

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Individuals with complex communication needs often face speech barriers that hinder social inclusion. As said by I. Estrada, "If a child cannot learn the way we teach, maybe we should teach the way they learn". This philosophy guides our research, which focuses on empowering children with autism and other communication disorders to effectively utilize Augmentative and Alternative Communication Systems, better predicting their needs.
Recent multi-modal AI breakthroughs have opened up new avenues for enhancing the lives of these individuals. In this context, we introduce PictoViLT, a Vision-and-Language Transformer Encoder fine-tuned on text datasets and ARASAAC pictograms. Our approach involves employing various self-supervised masking techniques that transition from single to multiple text tokens, effectively addressing the challenge of predicting the next pictogram.
PictoViLT breaks the strict dependence on WordNet concept sequences as input, being able to manage natural language and pictogram sequences directly. In-depth experiments conducted on various datasets, grounded on commonsense resources and verbalized knowledge graphs, reveal significant enhancements compared to prior state-of-the-art models. In contrast to PictoBERT and statistical n-gram models, PictoViLT achieves up to +0.60 Top-1 accuracy points. Ultimately, token--patch alignments and attention areas make predictions interpretable.

Predicting protein functions with ensemble deep learning and Protein Language Models

Marcello Fuschi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

The exponential growth in the discovery of protein sequences has rendered large-scale automated protein function prediction (AFP) increasingly challenging. Since a protein is typically associated with numerous Gene Ontology terms, AFP can be seen as a complex large-scale multi-label classification issue. In this work, we propose a solution that uses the recently-developed Protein Language Model (PLM) technology, specifically ESM-2, a SOTA model by Meta AI which had never been used for the AFP task. PLMs, in fact, are able to generate very informative protein sequence embeddings. Our study also fills the gap in the literature regarding the performance comparison between neural network approaches and more efficient methods like those based on the cosine-similarity between embeddings. We propose a Stacked Ensemble model which combines predictions from five classifiers, revealing insights into the capabilities of different predictive techniques. The method proposed in this work achieves results that surpass the winning solutions of the CAFA3 challenge. Its best method, in fact, achieves F-max values of (0.580, 0.370, 0.687) on the 3 sub-ontologies of Gene Ontology, while the method we propose scores (0.594, 0.493, 0.722) when evaluated on the same dataset. A comparative analysis is included to assess the contribution of the various components to the overall result.

AMR Beam Search: generating faithful summaries with semantic graph representations

Yuwei Ke

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

In recent years, notable strides have been made in abstractive summarization. However, a persistent challenge remains: many existing summarization models often produce summaries that lack semantic consistency with the source document. These models and evaluation methods tend to focus on word level, which may not necessarily bring results for being faithful. This thesis introduces a novel decoding strategy named AMR Beam Search (ABS) which leverages the potential of Abstract Meaning Representation (AMR). ABS is designed to integrate textual and structured semantic knowledge during the decoding process, promoting factual consistency between the generated summary and the source document. It accomplishes this by reranking hypotheses during decoding, where it computes the factuality score for beams completed through saliency-enhanced greedy decoding, considering both their corresponding source documents and AMRs in the process. Experiments conducted on 2 datasets, XSum and CNN/DM, demonstrate the superiority of the proposed ABS method. Across multiple faithfulness evaluation metrics, ABS outperforms the baseline method by an average gap of 0.77%, thus underscoring its effectiveness in achieving higher faithfulness in abstractive summarization.

Retrieving and incorporating external knowledge into compressed Large Language Models

Simone Marasi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Large Language Models (LLMs) have recently become a crucial resource due to their ability to generate human-like text in almost any language, but ethical and practical concerns have arisen. These include data privacy, the accuracy of model predictions, and the ecological footprint of large-scale model training. Techniques such as Retrieval Augmented Generation (RAG) and finetuning empower pretrained language models to acquire specific knowledge on a given topic from a proprietary knowledge base trying to overcome these challenges. This can be useful for industrial purposes where data confidentiality and the absence of hallucinations in responses are crucial. In this thesis, we implemented efficient quantisation and compression techniques to make it possible to significantly reduce the number of parameters involved in loading or finetuning LLMs without substantially compromising performance. This reduction in parameter size translates into substantial gains in terms of resource efficiency, both in terms of time and hardware requirements. Furthermore, with compression techniques, we finetuned models with 13 billion parameters like LLaMA-2, even on GPU with just 15 GB of memory. We also integrated RAG techniques, which represent a noteworthy stride forward since they enable models to be enriched directly with external knowledge by way of vector databases. These databases can efficiently embed different sources in the form of texts and knowledge graphs, exploiting their intrinsic structural strengths. By leveraging RAG and incorporating external knowledge, we demonstrated substantial enhancements in retrieval result quality, promising more contextually relevant and accurate responses, and compared different retrieval techniques involving knowledge graphs. These advancements democratize generative AI, making it accessible even to small companies, and reduce the energy consumption and carbon footprint associated with training large-scale AI models.

Survey on Retrieval Enhanced Transformers applied to the Biomedical Domain

Nicolò Donati

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni

PictoAI: Un'applicazione per il supporto all'apprendimento mediante Comunicazione Aumentativa e Alternativa rinforzata dall'Intelligenza Artificiale

Konrad Gomulka

Supervisor
Antonella Carbonaro
Co-supervisors
Giacomo Frisoni, Gianluca Moro
Abstract

Il recente progresso nel campo dell’Intelligenza Artificiale ha aperto la strada ad una vasta gamma di possibili applicazioni innovative, il cui limite è dato solamente dalla capacità di trovare la giusta idea e dalla volontà di realizzarla. Il settore educativo potrebbe beneficiare in particolar modo dell’utilizzo di IA, dal momento che ciò aprirebbe la possibilità di offrire contenuti personalizzati e soluzioni adattabili alle esigenze dei singoli utenti. Questa tesi si concentra sull’impiego dell’Intelligenza Artificiale per aiutare persone con difficoltà nella
comunicazione, come disturbi dello spettro autistico, che necessitano di maggior supporto, sia per permettere loro di comunicare efficacemente che per migliorare l’apprendimento adattandosi alle specifiche capacità dell’individuo. Per raggiungere tale obiettivo è
stato realizzato un applicativo che integra Intelligenza Artificiale e
CAA (Comunicazione Aumentativa Alternativa), un’insieme di tecniche che offre un metodo per comunicare a persone con difficoltà, fornendo loro un supporto accessibile ed efficace all’apprendimento e alla comunicazione.

Subgraph Retrieval for Biomedical Open-Domain Question Answering: Unlocking the Knowledge Graph Embedding Power

Faisal Ramzan

Supervisor
Claudio Sartori
Co-supervisors
Gianluca Moro, Giacomo Frisoni
Abstract

Structured KG is more popular than KG; Language Models do not capture the semantic meaning of the same context with billions of parameters. While retrieving the entire Knowledge Graph is quite challenging concerning the size and memory issues. Moreover, inferring the answer to the question takes time during the reasoning on the whole KG, affecting the reasoning phase, which causes finding the incorrect solution.
Pre-trained LMs have broad knowledge coverage but must perform better on structured reasoning, such as handling negation and flipped conditions. We aim to retrieve the relevant portion of the subgraph from the large KG graph. The existing subgraph retrieval solutions primarily focus on discriminative k-hop approaches or SPARQL queries on massive KGs. However, they require time-consuming, unsustainable operations in real-world contexts like biomedicine, where entities and known relationships among them are massive. They frequently rely on Named entity-linking NEL tools that fail in recognizing and mapping entities without being capable of generalizing to similar or high-order concepts. Instead, approximated search on dense representations of KGs and text can significantly boost the effectiveness and efficiency of subgraph construction with the help of enhanced generalization capabilities that overcome NEL limits and the possibility of indexing embeddings and speeding up top-K retrieval operations. In our work, we analyzed the existing methods of subgraph construction. However, they could be more efficient because of their size and quality of retrieved subgraph, which affect the reasoning process for extracting an answer to the question. Therefore, we propose the Subgraph Retrieval that tries to find the more relevant entities through linked paths (path queries) to the topic entities. The goal is to find the sequence of relations and their connected entities linked to the topic entities by measuring their similarity between them in the dense space setting.

Subgraph Retrieval for Biomedical Open-Domain Question Answering: Predicting Relational Paths with Language Models

Mattia Achilli

Supervisor
Antonella Carbonaro
Co-supervisors
Giacomo Frisoni, Gianluca Moro
Abstract

Negli ultimi anni, l'open book question answering (QA) è diventato un campo di ricerca di grande interesse, che mira a rispondere a domande complesse utilizzando conoscenze esterne. La maggior parte delle soluzioni esistenti si basa sull'utilizzo di grafi per rappresentare la conoscenza semantica, strutturata e non ambigua, che può essere utilizzata per rispondere alle domande.

Tuttavia, la costruzione di grafi su larga scala è una sfida complessa, che richiede l'utilizzo di tecniche di reasoning avanzate. Inoltre, molte delle soluzioni esistenti si basano su approcci discreti o simbolici, che sono inefficienti e portano a molto rumore.

In questo lavoro di tesi, è stata progettata e implementata una soluzione di subgraph retrieval approssimata, che lavora all'interno di spazi densi ed è plug and play. Inoltre, la soluzione proposta si focalizza sul dominio biomedico, dove la conoscenza è molto vasta e spesso altamente specializzata.

In particolare, la soluzione proposta si basa sul predire, partendo dalle entità della domanda, le relazioni da visitare in modo autoregressivo grazie al fine-tuning di un language model biomedico encoder only e cross document allo stato dell'arte, cosi da sfruttare al massimo la conoscenza e il significato del testo e dei concetti.

La soluzione proposta è stata testata e confrontata con diverse tecniche di KG embedding come TransE e DistMult, e query SPARQL attraverso GraphDB. I risultati empirici mostrano l'efficacia e l'efficienza della soluzione proposta all'interno della tesi, comparata a quelle disponibili in letteratura.

2022

Bio-QA-GNN: Reasoning with Language Models and Knowledge Graphs for Interpretable Biomedical Question Answering

Enrico Gnagnarella

Supervisor
Antonella Carbonaro
Co-supervisors
Giacomo Frisoni, Gianluca Moro
Abstract

Nowadays the idea of injecting world or domain-specific structured knowledge into pre-trained language models (PLMs) is becoming an increasingly popular approach for solving problems such as biases, hallucinations, huge architectural sizes, and explainability lack—critical for real-world natural language processing applications in sensitive fields like bioinformatics. One recent work that has garnered much attention in Neuro-symbolic AI is QA-GNN, an end-to-end model for multiple-choice open-domain question answering (MCOQA) tasks via interpretable text-graph reasoning. Unlike previous publications, QA-GNN mutually informs PLMs and graph neural networks (GNNs) on top of relevant facts retrieved from knowledge graphs (KGs). However, taking a more holistic view, existing PLM+KG contributions mainly consider commonsense benchmarks and ignore or shallowly analyze performances on biomedical datasets.

This thesis start from a propose of a deep investigation of QA-GNN for biomedicine, comparing existing or brand-new PLMs, KGs, edge-aware GNNs, preprocessing techniques, and initialization strategies. By combining the insights emerged in DISI's research, we introduce Bio-QA-GNN that include a KG. Working with this part has led to an improvement in state-of-the-art of MCOQA model on biomedical/clinical text, largely outperforming the original one (+3.63\% accuracy on MedQA). Our findings also contribute to a better understanding of the explanation degree allowed by joint text-graph reasoning architectures and their effectiveness on different medical subjects and reasoning types.

Codes, models, datasets, and demos to reproduce the results are freely available at: \url{https://github.com/disi-unibo-nlp/bio-qagnn}.

Novel Text-to-Text Retrieval-Enhanced Transformer for Biomedical Literature

Miki Mizutani

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni

Guess The Link: Deciphering the Best Knowledge Graph Completion Techniques in Dense Spaces

Ilaria Ferrari

Supervisor
Claudio Sartori
Co-supervisors
Gianluca Moro, Giacomo Frisoni

Graph-based Vision-Language Model for Multi-Modal Retrieval of Fashion Products

Francesco Farinola

Supervisor
Gianluca Moro
Co-supervisors
Stefano Salvatori
Abstract

Artificial Intelligence is reshaping the field of fashion industry in different ways. E-commerce retailers exploit their data through AI to enhance their search engines, make outfit suggestions and forecast the success of a specific fashion product. However, it is a challenging endeavour as the data they possess is huge, complex and multi-modal. The most common way to search for fashion products online is by matching keywords with phrases in the product's description which are often cluttered, inadequate and differ across collections and sellers. A customer may also browse an online store's taxonomy, although this is time-consuming and doesn't guarantee relevant items. With the advent of Deep Learning architectures, particularly Vision-Language models, ad-hoc solutions have been proposed to model both the product image and description to solve this problems. However, the suggested solutions do not exploit effectively the semantic or syntactic information of these modalities, and the unique qualities and relations of clothing items. In this work of thesis, a novel approach is proposed to address this issues, which aims to model and process images and text descriptions as graphs in order to exploit the relations inside and between each modality and employs specific techniques to extract syntactic and semantic information. The results obtained show promising performances on different tasks when compared to the present state-of-the-art deep learning architectures.

Edge-aware Graph Attention Networks: Joint Reasoning On Text and Knowledge Graphs for Biomedical Question Answering

Francesco Boschi

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Much of the real-world dataset, including textual data, can be represented using graph structures. The use of graphs to represent textual data has many advantages, mainly related to maintaining a more significant amount of information, such as the relationships between words and their types.
In recent years, many neural network architectures have been proposed to deal with tasks on graphs. Many of them consider only node features, ignoring or not giving the proper relevance to relationships between them. However, in many node classification tasks, they play a fundamental role.
This thesis aims to analyze the main GNNs, evaluate their advantages and disadvantages, propose an innovative solution considered as an extension of GAT, and apply them to a case study in the biomedical field.
We propose the reference GNNs, implemented with methodologies later analyzed, and then applied to a question answering system in the biomedical field as a replacement for the pre-existing GNN. We attempt to obtain better results by using models that can accept as input both node and edge features.
As shown later, our proposed models can beat the original solution and define the state-of-the-art for the task under analysis.

Event-Augmented Summarization of Biomedical Scientific Reviews

Paolo Italiani

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni

Italian Retrieval-Augmented Generative Question Answering System for Legal Domains

Gianluca Busatta

Supervisor
Gianluca Moro
Co-supervisors
Andrea Montefiori, Cristiano Casadei
Abstract

A typical scenario involves a user searching an information about something and obtaining a list of documents from an information retrieval system. The retrieved documents may be more or less relevant and it could happen that the information sought is contained in several documents. This would possibly leave the task of searching the information in different documents to the user. In this thesis, it is has been developed an Italian question answering system for legal domains with a Retrieval-Augmented Generation (RAG) approach that aims to directly satisfy the information need of the user. The model is composed of a retriever and a generator both of which are based on Transformer and it has been trained firstly in a self-supervised way on the library of Gruppo Maggioli company, and then in a supervised way on a novel Italian question answering dataset build on purpose. Once the user has provided an input, the model automatically retrieves possibly relevant documents from the knowledge base and use them to condition the generation of an appropriate answer.

Speech Recognition per l'italiano: Sviluppo e Sperimentazione di Soluzioni Neurali con Language Model

Martina Cavallucci

Supervisor
Gianluca Moro
Co-supervisors
Andrea Montegiori, Cristiano Casadei, Andrea Montefiori
Abstract

Le e-mail e i servizi di messaggistica hanno cambiato significativamente la comunicazione umana, ma la parola è ancora il metodo più importante di comunicazione
tra esseri umani. Pertanto, il riconoscimento vocale automatico (ASR) è di particolare rilevanza perché fornisce una trascrizione della lingua parlata che può essere valutata da sistemi automatizzati.
Con altoparlanti intelligenti come Google Home, Alexa o Siri, l' ASR è già un
parte integrante di molte famiglie ed è usato per suonare musica, rispondere alle domande
o controllare altri dispositivi intelligenti come un sistema di domotica. Tuttavia, l' ASR può essere trovato anche in molti altri sistemi, come sistemi di dettatura, traduttori vocali o interfacce utente vocali.
Sempre più aziende ne comprendono le potenzialità sopratutto per migliorare i processi aziendali, il lavoro di tesi mira infatti a sperimentare modelli neurali per la trascrizione di Webinar creati dall'azienda ospitante Maggioli dove si è svolto il tirocinio, ottenendo così trascrizioni utili per il recupero delle informazioni e la loro gestione. A tale scopo si sono utilizzati modelli basati sui recenti Transformers e grazie alla tecnica dell'apprendimento auto-supervisionato che apprende da dati non etichettati è stato possibile ottenere buoni risultati su dataset con audio e trascrizioni in italiano di cui si dispongono ancora poche risorse rispetto alla lingua inglese.

2021

Previsione del Successo di Prodotti di Moda Prima della Commercializzazione: un Nuovo Dataset e Modello di Vision-Language Transformer

Matteo Andruccioli

Supervisor
Gianluca Moro
Co-supervisors
Stefano Salvatori
Abstract

A differenza di quanto avviene nel commercio tradizionale, in quello online il cliente non ha la possibilità di toccare con mano o provare il prodotto. La decisione di acquisto viene maturata in base ai dati messi a disposizione dal venditore attraverso titolo, descrizioni, immagini e alle recensioni di clienti precedenti. É quindi possibile prevedere quanto un prodotto venderà sulla base di queste informazioni. La maggior parte delle soluzioni attualmente presenti in letteratura effettua previsioni basandosi sulle recensioni, oppure analizzando il linguaggio usato nelle descrizioni per capire come questo influenzi le vendite. Le recensioni, tuttavia, non sono informazioni note ai venditori prima della commercializzazione del prodotto; usando solo dati testuali, inoltre, si tralascia l’influenza delle immagini. L'obiettivo di questa tesi è usare modelli di machine learning per prevedere il successo di vendita di un prodotto a partire dalle informazioni disponibili al venditore prima della commercializzazione. Si fa questo introducendo un modello cross-modale basato su Vision-Language Transformer in grado di effettuare classificazione. Un modello di questo tipo può aiutare i venditori a massimizzare il successo di vendita dei prodotti. A causa della mancanza, in letteratura, di dataset contenenti informazioni relative a prodotti venduti online che includono l’indicazione del successo di vendita, il lavoro svolto comprende la realizzazione di un dataset adatto a testare la soluzione sviluppata. Il dataset contiene un elenco di 78300 prodotti di Moda venduti su Amazon, per ognuno dei quali vengono riportate le principali informazioni messe a disposizione dal venditore e una misura di successo sul mercato. Questa viene ricavata a partire dal gradimento espresso dagli acquirenti e dal posizionamento del prodotto in una graduatoria basata sul numero di esemplari venduti.

Presidi di Sicurezza per il Contrasto alla Pandemia mediante Integrazione e Ingegnerizzazione di Soluzioni di Visione Artificiale

Alessandro Oliva

Supervisor
Gianluca Moro
Abstract

La pandemia di COronaVIrus Disease 2019 (COVID-19), tuttora in corso con la diffusione di nuove varianti, porta alla necessità di disporre di presidi a tutela della sicurezza delle persone ricorrendo a soluzioni di computer vision. Queste soluzioni possono essere integrate a soluzioni di sicurezza sul lavoro, al fine di ottimizzare l'impiego delle risorse disponibili dagli enti che effettuano questi monitoraggi, come aziende o enti pubblici. Il lavoro proposto ha lo scopo di sviluppare soluzioni di rilevamento di mascherine indossate correttamente, conteggio di persone all'interno di una stanza passando attraverso una porta, rilevamento dei dispositivi di sicurezza indosso al lavoratore e classificazione della corretta esecuzione di una attività di manutenzione (in questo caso su una bicicletta). Le specifiche di queste soluzioni devono massimizzare lo sfruttamento dell'hardware a disposizione, permettendo di essere distribuite su piattaforme con risorse limitate mantenendo il giusto compromesso tra prestazioni e qualità dei modelli. Sono state sperimentate diverse architetture per le varie soluzioni basate su YOLO, SSD e Transformer, le quali, anziché essere implementate con diversi framework come spesso avviene, sono state ripensate per utilizzare una base software comune per favorire il risparmio di risorse. I modelli sono stati inoltre resi fruibili attraverso una applicazione web dedicata, permettendo agli utenti di interfacciarsi con i modelli attraverso dispositivi di acquisizione o file video.

Self-supervised information retrieval: a novel approach based on Deep Metric Learning and Neural Language Models

Alex Rossi

Supervisor
Gianluca Moro
Co-supervisors
Andrea Montefiori, Cristiano Casadei
Abstract

Most of the existing open-source search engines, utilize keyword or tf-idf based techniques to find relevant documents and web pages relative to an input query. Although these methods, with the help of a page rank or knowledge graphs, proved to be effective in some cases, they often fail to retrieve relevant instances for more complicated queries that would require a semantic understanding to be exploited.
In this Thesis, a self-supervised information retrieval system based on transformers is employed to build a semantic search engine over the library of Gruppo Maggioli company. Semantic search or search with meaning can refer to an understanding of the query, instead of simply finding words matches and, in general, it represents knowledge in a way suitable for retrieval.
We chose to investigate a new self-supervised strategy to handle the training of unlabeled data based on the creation of pairs of ’artificial’ queries and the respective positive passages. We claim that by removing the reliance on labeled data, we may use the large volume of unlabeled material on the web without being limited to languages or domains where labeled data is abundant.

BlenderBot 2.0: Studio e Modellazione di un Chatbot basato su Transformers

Emanuel Scaglione

Supervisor
Claudio Sartori
Co-supervisors
Gianluca Moro
Abstract

I Transformers hanno raggiunto lo stato dell’arte in qualsiasi ambito del Natural Language Processing (NLP) e del Natural Language Understanding (NLU), in questo lavoro di tesi è stata studiata l’architettura originale e alcune delle migliorie apportate a questa nel corso degli ultimi anni.
In una seconda fase è stato studiato un Chat Bot rivoluzionario reso pubblico nel Luglio del 2021, chiamato Blender Bot 2.0. Questo bot di Facebook è sia capace di sfruttare una memoria a lungo termine facilmente estendibile e sostituibile per immagazzinare informazioni sui propri interlocutori e sul mondo esterno, sia di effettuare ricerche online quando posto di fronte a quesiti di cui non è sicuro di conoscere la risposta. Il tutto è stato osservato non solo in termini di qualità dei risultati generati dai modelli, ma anche da un punto di vista di risorse impiegate. L’obiettivo è stato quello di minimizzare il consumo di memoria e il tempo necessario per addestrare i modelli, in modo da poter rendere accessibili le loro abilità su larga scala anche in presenza di hardware economici, diminuendo conseguentemente i costi per chiunque voglia farci affidamento; un grande passo per singoli individui appassionati, ma soprattutto per aziende interessate ad impiegarli in un contesto produttivo.

Generare con transformer lineare spiegazioni di concept set medicali costituiti da termini correlati estratti da social post di pazienti

Alessia Ventani

Supervisor
Gianluca Moro
Co-supervisors
Giacomo Frisoni
Abstract

Le malattie rare pongono diversi scogli ai pazienti, ai loro familiari e ai sanitari. Uno fra questi è la mancanza di informazione che deriva dall'assenza di fonti sicure e semplici da consultare su aspetti dell'esperienza del paziente. Il lavoro presentato ha lo scopo di generare da set termini correlati semanticamente, delle frasi che abbiamo la capacità di spiegare il legame fra di essi e aggiungere informazioni utili e veritiere in un linguaggio semplice e comprensibile. Il problema affrontato oggigiorno non è ben documentato in letteratura e rappresenta una sfida interessante si per complessità che per mancanza di dataset per l'addestramento. Questo tipo di task, come altri di NLP, è affrontabile solo con modelli sempre più potenti ma che richiedono risorse sempre più elevate. Per questo motivo, è stato utilizzato il meccanismo di recente pubblicazione del Performer, dimostrando di riuscire a mantenere uno stesso grado di accuratezza e di qualità delle frasi prodotte, con una parallela riduzione delle risorse utilizzate. Ciò apre la strada all'utilizzo delle reti neurali più recenti anche senza avere i centri di calcolo delle multinazionali.
Il modello proposto dunque è in grado di generare frasi che illustrano le relazioni semantiche di termini estratti da un mole di documenti testuali, permettendo di generare dei riassunti dell'informazione e della conoscenza estratta da essi e renderla facilmente accessibile e comprensibile al pazienti o a persone non esperte.

Detecting Face Masks and Social Distancing Against COVID-19 with Embedded Systems and Deep Learning Technologies

Mattia Vandi

Supervisor
Gianluca Moro
Abstract

Social distancing and face mask wearing have been proven as effective measures against the spread of the infectious COronaVIrus Disease 2019 (COVID-19). However, individuals are still adapting to COVID-19 regulations. In fact, you can often see people in public places wearing face masks incorrectly or not wearing face masks at all, besides not tracking the required two meters (6 feet) distance between themselves and their surroundings.

An active surveillance system that can both determine whether or not a person is wearing a face mask and tracking distances between individuals would be able to correctly report when they are at risk of being exposed to the disease. Thus, such active surveillance system would be able to keep people safer and slow down the spread of the disease.

On the other hand, recording data and labeling individuals who do not follow the measures would breach individuals' rights in free societies. Thus, in this work we present a deep learning-based real-time social distancing monitoring and face mask detection system considering two important ethical factors: (i) the system should never record/cache data, and no human supervisor should be in the detection loop.

Given the limited computational capabilities of embedded devices, achieving near real-time processing times while still retaining high accuracy in terms of both object localization and classification is an extremely challenging task. To this end, a trade-off between inference speed and detection accuracy must be found.

Text-to-Image Information Retrieval Basato sul Transformer Lineare Performer: Sviluppo e Applicazioni per l'Industria della Moda

Stefano Salvatori

Supervisor
Gianluca Moro
Abstract

Il lavoro svolto si inserisce nell’ambito dei Neural Ranking Models, modelli che stanno gradualmente superando lo stato dell’arte raggiunto dai classici sistemi di Information Retrieval sfruttando i più recenti sviluppi ottenuti sulle reti neurali profonde. Una delle architetture più utilizzate in questo contesto è quella del Transformer, che si è dimostrata essere estremamente versatile ed efficace in svariati domini applicativi. Uno dei problemi che caratterizzano però questo modello è la complessità spaziale e
temporale quadratica rispetto alla dimensione dell’input che non permette di sfruttare una dimensione del batch size ottimale e una lunghezza delle sequenze in input sufficientemente grande. Lo scopo di questo lavoro è studiare i miglioramenti ottenibili in un sistema di Information Retrieval basato su Neural Ranking Models applicando il transformer efficiente Performer. È stato scelto come caso di studio il dominio della moda, per il quale sono state proposte in letteratura diverse soluzioni nell’ambito dell’intelligenza artificiale per task di retrieval e non. Gao, Dehong, et al. in particolare, hanno ottenuto risultati
allo stato dell’arte sviluppando FashionBERT, un neural ranking model basato BERT applicato a problemi di Text-Image Matching (dire se una descrizione ed un’immagine sono o meno legate allo stesso prodotto) e Retrieval (data una query testuale, ritrovare l’immagine dell’indumento che descrive).
In questo lavoro si vuole mostrate innanzitutto come sia possibile migliorare i risultati di FashionBERT sia in termini di efficacia che efficienza sostituendo il layer di attention quadratica con la rispettiva versione lineare proposta in Performer. Vengono infine condotti ulteriori esperimenti applicando il modello sviluppato
ad un task di Metric Learning dimostrando che è possibile in questo modo superare lo stato dell'arte ottenuto nel paper originale di FashionBERT.

Bibliographic metadata for imported theses: AMS Laurea · University of Bologna.