| Nome: | Descrição: | Tamanho: | Formato: | |
|---|---|---|---|---|
| 1.49 MB | Adobe PDF |
Autores
Resumo(s)
Safety Data Sheets (SDS) are essential documents for ensuring the safe handling, storage, and transportation of chemical products. Despite their standardized structure, SDS documents are often distributed as semi-structured PDF files, making the automatic extraction of key information a challenging task. This work addresses the problem of information extraction from SDS documents, with the objective of developing and evaluating different Natural Language Processing (NLP) techniques for this purpose.
A complete data processing pipeline was developed to transform SDS PDF files into a structured, model-ready dataset. This pipeline includes document collection, text extraction, section segmentation based on the standardized 16-section SDS format, and the construction of a question-answering dataset linking document context with target fields. Multiple extraction strategies were explored, ranging from rule-based methods using regular expressions to machine learning approaches based on Bidirectional encoder representations from transformers (BERT), and more recent approaches based on Large Language Models (LLM).
The evaluation focused on a set of representative fields, including binary classification, single-label classification, and multi-label classification tasks. The results show that rule-based approaches perform well for highly structured patterns, such as hazard codes, while BERT-based models achieve strong performance in well-defined classification tasks, reaching an F1-score of 1.0 for binary classification and up to 0.86 for more complex classification scenarios. LLM-based approaches demonstrate competitive performance across all tasks, while offering greater flexibility and reducing the need for task-specific engineering, particularly in more complex cases.
The results indicate that while older methods remain effective for specific scenarios, LLMs provide a more generalizable solution for information extraction from semi-structured documents. This work contributes a reproducible pipeline for SDS processing, a structured dataset for evaluation, and a comparative analysis of extraction methodologies, providing a foundation for future research and practical applications in automated document understanding.
As Fichas de Dados de Segurança (FDS) são documentos essenciais para garantir o manuseamento, armazenamento e transporte seguros de produtos químicos. Apesar da sua estrutura padronizada, as FDS são frequentemente distribuídas sob a forma de ficheiros PDF semiestruturados, o que torna a extração automática de informação relevante uma tarefa desafiante. Este trabalho aborda o problema da extração de informação a partir de FDS, com o objetivo de desenvolver e avaliar diferentes técnicas de Processamento de Linguagem Natural (PLN) para este fim. Foi desenvolvido um processo completo de processamento de dados para transformar ficheiros PDF de FDS num conjunto de dados estruturado e pronto para utilização em modelos. Este processo inclui a recolha de documentos, a extração de texto, a segmentação em secções com base no formato padronizado de 16 secções das FDS, e a construção de um conjunto de dados de perguntas e respostas que relaciona o contexto do documento com os campos de interesse. Foram exploradas múltiplas estratégias de extração, desde métodos baseados em regras utilizando expressões regulares, até abordagens de aprendizagem automática baseadas em BERT, bem como abordagens mais recentes baseadas em Modelos de Linguagem de Grande Escala (LLM). A avaliação centrou-se num conjunto de campos representativos, incluindo tarefas de classificação binária, single-label e multi-label. Os resultados mostram que as abordagens baseadas em regras apresentam um bom desempenho em padrões altamente estruturados, como códigos de perigo, enquanto os modelos baseados em BERT alcançam um desempenho sólido em tarefas de classificação bem definidas, atingindo um F1-score de 1,0 para a classificação binária e até 0,86 para cenários de classificação mais complexos. As abordagens baseadas em LLM demonstram um desempenho competitivo em todas as tarefas, enquanto oferecem maior flexibilidade e reduzem a necessidade de esforço aplicado para cada tarefa, particularmente em casos mais complexos. Os resultados indicam que, embora os métodos mais antigos continuem a ser eficazes em cenários específicos, as LLMs oferecem uma solução mais generalizável para a extração de informação a partir de documentos semiestruturados. Este trabalho contribui com um processo de trabalho reproduzível para o processamento de FDS, um conjunto de dados estruturado para avaliação e uma análise comparativa dos métodos de extração, proporcionando uma base para futuras investigações e aplicações práticas na compreensão automatizada de documentos.
As Fichas de Dados de Segurança (FDS) são documentos essenciais para garantir o manuseamento, armazenamento e transporte seguros de produtos químicos. Apesar da sua estrutura padronizada, as FDS são frequentemente distribuídas sob a forma de ficheiros PDF semiestruturados, o que torna a extração automática de informação relevante uma tarefa desafiante. Este trabalho aborda o problema da extração de informação a partir de FDS, com o objetivo de desenvolver e avaliar diferentes técnicas de Processamento de Linguagem Natural (PLN) para este fim. Foi desenvolvido um processo completo de processamento de dados para transformar ficheiros PDF de FDS num conjunto de dados estruturado e pronto para utilização em modelos. Este processo inclui a recolha de documentos, a extração de texto, a segmentação em secções com base no formato padronizado de 16 secções das FDS, e a construção de um conjunto de dados de perguntas e respostas que relaciona o contexto do documento com os campos de interesse. Foram exploradas múltiplas estratégias de extração, desde métodos baseados em regras utilizando expressões regulares, até abordagens de aprendizagem automática baseadas em BERT, bem como abordagens mais recentes baseadas em Modelos de Linguagem de Grande Escala (LLM). A avaliação centrou-se num conjunto de campos representativos, incluindo tarefas de classificação binária, single-label e multi-label. Os resultados mostram que as abordagens baseadas em regras apresentam um bom desempenho em padrões altamente estruturados, como códigos de perigo, enquanto os modelos baseados em BERT alcançam um desempenho sólido em tarefas de classificação bem definidas, atingindo um F1-score de 1,0 para a classificação binária e até 0,86 para cenários de classificação mais complexos. As abordagens baseadas em LLM demonstram um desempenho competitivo em todas as tarefas, enquanto oferecem maior flexibilidade e reduzem a necessidade de esforço aplicado para cada tarefa, particularmente em casos mais complexos. Os resultados indicam que, embora os métodos mais antigos continuem a ser eficazes em cenários específicos, as LLMs oferecem uma solução mais generalizável para a extração de informação a partir de documentos semiestruturados. Este trabalho contribui com um processo de trabalho reproduzível para o processamento de FDS, um conjunto de dados estruturado para avaliação e uma análise comparativa dos métodos de extração, proporcionando uma base para futuras investigações e aplicações práticas na compreensão automatizada de documentos.
Descrição
Palavras-chave
Fichas de dados de segurança Extração de informação Processamento de linguagem natural Modelos Transformer Processamento de documentos
