Pesquisa da USP distingue fake news escritas por humanos e por IA

Modelos testados superam 99% de desempenho na análise de textos em português do Brasil

Por Redação do Portal AZ,

Uma pesquisa de mestrado da Universidade de São Paulo (USP) mostrou que é possível identificar, com alto índice de acerto, se uma notícia falsa em português foi escrita por uma pessoa ou gerada por inteligência artificial. O estudo, de Pedro Lucas Castro de Andrade, foi apresentado na 25ª Conferência EPIA, em Portugal, e integra uma das frentes do projeto Synestech.ai.

Foto: Reprodução | Freepik | Imagem ilustrativaFake News

O trabalho é assinado também pelos pesquisadores Renato Moraes Silva e Thiago Pardo, do Núcleo Interinstitucional de Linguística Computacional do Instituto de Ciências Matemáticas e de Computação (ICMC-USP), em São Carlos. Segundo Andrade, as notícias falsas não são novidade, mas agora as máquinas também as produzem em larga escala e com fluência próxima à humana.

Para chegar aos resultados, a equipe analisou 10.782 textos. Metade foi escrita por humanos e faz parte de duas bases brasileiras de fake news, a Fake.br e a FakeTrueBR. A outra metade foi gerada pelo Sabiá-3, um modelo de linguagem especializado em português, sobre os mesmos assuntos.

A comparação revelou padrões distintos. Os textos humanos usam vocabulário mais concreto e cotidiano, maior variedade de pontuação, marcas de informalidade e mais referências ao passado e às relações sociais. Já os textos gerados por IA têm vocabulário mais abstrato e sofisticado, uso frequente de conectivos como "mas", maior presença de termos positivos e transição uniforme entre as frases. Um dos sinais mais importantes para a classificação foi a proporção de verbos no presente do indicativo, mais constante nos textos de máquina.

Os pesquisadores testaram ainda diferentes sistemas de classificação. O melhor resultado veio do BERTimbau, modelo treinado para o português, que obteve desempenho de 99,95% na medida F1 e errou apenas um texto entre 2.158 avaliados. Um sistema baseado em características linguísticas interpretáveis chegou a 99,86%, o que, segundo o estudo, pode permitir a criação de detectores mais leves e capazes de explicar por que um texto foi apontado como artificial.

O estudo traz ressalvas. A análise usou apenas um modelo de linguagem, em textos produzidos a partir da reescrita de notícias falsas já existentes, e os autores alertam que os sinais identificados podem perder confiabilidade conforme os modelos evoluírem e forem instruídos a imitar a escrita humana. A pesquisa também foi apresentada na 17ª Conferência Internacional sobre Processamento Computacional do Português (Propor).

Fonte: Com informações da Usp

Comente

Pequisar