Please use this identifier to cite or link to this item:
https://hdl.handle.net/10216/106176| Author(s): | Filipe Fernandes Miranda |
| Title: | Computing the accuracy of an automatic system for relevance detection in social networks |
| Issue Date: | 2017-07-11 |
| Abstract: | To correctly assert the precision of a classification model, previously labeled data is needed to validate the output provided by the model. The process of labeling data can be achieved either by a human manual effort or, automatically, by computers. In this dissertation, an automatic system was designed and created to assess the precision of a classification model with no human component is used throughout the process of labeling the data. The goal of the classification model, used as the basis of this project, is to identify newsworthy social network messages. The model takes advantage of the vast information spread across social networks and aims to filter relevant data, which may have important information from a journalistic point of view. To assert the precision of the classification model, social network messages need to be labeled as news-worthy or not, which can be achieved by manual labeling. While this assessment is fundamental to train the model at a first stage, the monetary, time and precision costs involved do not allow this procedure to be done regularly. Yet, the classification of data is essential to train our models and to determine their accuracy. For this reason, and to avoid the downsides of manual labeling, a four stage automatic system was created. This new approach starts with the collection of data, both messages and news articles. The collected messages will be classified based on the news articles also gathered. The second step is the information extraction. Here, the system will analyze the information present in the different texts, using several information extraction techniques, such as named entity recognition and keywords detection. These results are presented in a standardized vector of features for the messages and news. The third stage is the matching of news and social media messages, based on the similarity of contents. When a message is associated with the content of a news article, it is labeled as news related. This final part, message classification, allows the distinction of news relevant and not relevant messages. This process is also assisted by a filtering model, which helps exclude weak matches. These are cases where even though messages and news have similar information, it is not relevant or newsworthy. The matching method was validated while it was being developed. In the end, the final system has a precision of over 80% in labeling newsworthy social network messages. Nonetheless, techniques and mechanisms developed in this dissertation can be extrapolated for other uses within the media and journalism world. As an example, the research can be targeted at finding possible contradictory information in social network messages, potentially helping news entities to update their stories as live information comes through. Another application might be to detect breaking news and crisis events. |
| Description: | De forma a calcular a precisão de um modelo de classificação, são necessários dados já categorizados para validar os resultados obtidos pelo modelo. O processo de categorização pode ser feito manualmente, por pessoas, ou de forma automática, por máquinas. Nesta dissertação, foi desenhado e criado um sistema automático, capaz de aferir a precisão de um modelo de classificação sem qualquer interferência humana na categorização de dados. O modelo de classificação, usado como base para este projeto, tem por objetivo identificar mensagens de redes sociais consideradas relevantes no contexto jornalístico. O modelo faz proveito da imensidão de dados fornecidos por diversas redes sociais de forma a filtrar mensagens com informação potencialmente relevante para jornalistas ou organizações noticiosas. Para afirmar a precisão deste modelo, mensagens e publicações de redes sociais terão de ser categorizadas como sendo relevantes ou não, o que pode ser feito através de um trabalho manual. Embora esta categorização seja fundamental para treinar o modelo numa primeira fase, acaba por se tornar inviável para o projeto executar esta constante categorização devido aos custos de precisão, monetários e de tempo que acarta. Contudo, a categorização de mensagens continua a ser necessária para calcular a precisão do modelo. De forma a evitar as desvantagens do trabalho de classificação manual, um sistema automático dividido em quatro etapas foi desenvolvido. Esta nova abordagem começa pela agregação de dados, tanto mensagens de redes sociais como artigos de organizações noticiosas. As mensagens recolhidas serão classificadas tendo por base os artigos reunidos. A segunda etapa deste sistema é a extração de informação. Aqui, o sistema irá analisar a informação presente em textos de diferentes fontes, utilizando técnicas de extração de informação, como reconhecimento de entidades e deteção de palavras-chave. O resultado é depois acessível através de um vetor de features uniforme para mensagens e notícias. A terceira etapa é a correspondência de mensagens com notícias, baseando-se na semelhança dos seus conteúdos. Quando uma mensagem é associada com uma notícia, é classificada como relevante. Esta última parte, classificação de mensagens, permite distingui-las em relevantes e não relevantes. O processo é auxiliado por um modelo de filtragem que permite a eliminação de correspondências fracas: casos onde apesar de mensagens e notícias terem informação semelhante, essa não é relevante de um ponto de vista jornalístico. Ao longo do seu desenvolvimento, o método de correspondência foi regularmente validado. O sistema final é capaz de classificar as mensagens de redes sociais como relevantes, com uma precisão de mais de 80%. No entanto, as técnicas e mecanismos desenvolvidos nesta dissertação podem ser extrapolados para outros usos no mundo jornalístico. Por exemplo, na deteção de informação potencialmente contraditória em redes sociais, o que pode ajudar entidades noticiosas a atualizar as suas histórias, enquanto recebem novas atualizações. Outra utilização é a deteção de notícias de última hora ou de eventos de crise. |
| Subject: | Engenharia electrotécnica, electrónica e informática Electrical engineering, Electronic engineering, Information engineering |
| Scientific areas: | Ciências da engenharia e tecnologias::Engenharia electrotécnica, electrónica e informática Engineering and technology::Electrical engineering, Electronic engineering, Information engineering |
| DOI: | 10.34626/6m46-1571 |
| TID identifier: | 201804425 |
| URI: | https://hdl.handle.net/10216/106176 |
| Document Type: | Dissertação |
| Rights: | openAccess |
| Appears in Collections: | FEUP - Dissertação |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| 203506.pdf | Computing the accuracy of an automatic system for relevance detection in social networks | 1.38 MB | Adobe PDF | ![]() View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.
