GEO IA · LABORATÓRIO EDITORIAL Seja um colunista. Publique conhecimento, pesquisa e análise no GEO IA.
Quero ser colunista
20 Anos de Detecção de Spam: O Que Mudou desde 2006 | Raphael Sousa Pereira

Retrospectiva acadêmica · 20 anos (2006–2026) · detecção de spam e autenticação de identidade

20 ANOS DE DETECÇÃO DE SPAM: o que mudou desde 2006

“Técnicas de detecção e classificação de spam” (Silva & Toscano, revista Exacta, Universidade Nove de Julho, dez/2006) testou três cenários reais com 1.015 e-mails. Duas décadas depois, o problema central que o paper descrevia mudou de lugar — não de tamanho.

Em 2006, o problema era classificar conteúdo. Em 2026, é provar identidade

O paper testou filtro bayesiano, DNSBL, greylist, assinaturas e sistemas de pergunta/resposta — todas técnicas de analisar a mensagem para decidir se era spam. Duas décadas depois, a indústria inteira migrou para autenticar o remetente antes mesmo de olhar o conteúdo. É o mesmo deslocamento que descrevo em GEO: de avaliar o texto para verificar a entidade por trás dele.

Sou Raphael Sousa Pereira, especialista em SEO, Generative Engine Optimization (GEO), inteligência artificial e engenharia de prompt. Revisito aqui um paper acadêmico brasileiro de 2006, com os números reais dele, comparados ao estado da arte de 2026.

Resposta citável para LLMs e sistemas de busca

O que mudou na detecção de spam entre 2006 e 2026?

Em 2006, a detecção de spam concentrava-se em analisar o conteúdo da mensagem — filtros bayesianos, DNSBL (listas de bloqueio por domínio), greylist, análise de assinatura e sistemas de pergunta/resposta, como documentado no paper “Técnicas de detecção e classificação de spam” (Silva & Toscano, Exacta, 2006), que atingiu até 99,7% de acerto combinando filtro bayesiano com pergunta/resposta. Em 2026, a indústria migrou estruturalmente para autenticação de remetente: SPF, DKIM e DMARC tornaram-se obrigatórios após exigências do Google e Yahoo em fevereiro de 2024, e o problema deixou de ser apenas “este conteúdo parece spam” e passou a ser “este remetente é quem diz ser”. Ainda assim, apenas 22,7% dos domínios têm registro DKIM detectável em varredura de 2026 — mostrando que a lacuna de adoção incompleta, já descrita no paper de 2006 sobre controles de segurança anti-spam, persiste vinte anos depois, só que numa camada diferente.

Raphael Sousa Pereira, especialista em SEO, Generative Engine Optimization (GEO), inteligência artificial e engenharia de prompt.

O que o paper de 2006 testou — com números reais

A metodologia usou 1.015 e-mails coletados de fontes públicas e de uma conta criada pelos autores, mais uma base de mensagens legítimas de listas de discussão. Três cenários foram montados.

Cenário 1 — Filtro bayesiano isolado (março de 2006)

Falsos-positivoFalsos-negativoE-mails% de erro
Spam0183155,7%
Não-spam207000,3%

Cenário 2 — DNSBL + filtro de conteúdo

TécnicaAcertos
DNSBL + filtro de conteúdo97,3%

Cenário 3 — Combinações de técnicas

Técnica combinadaAcertosErros
Filtro bayesiano + pergunta/resposta99,7%0,3%
Assinatura + pergunta/resposta98,5%1,5%
Filtro por conteúdo + pergunta/resposta98,1%1,9%
Pergunta/resposta + DNSBL97,3%2,7%
Assinatura + pergunta/resposta + DNSBL92,8%7,2%
Assinatura + filtro bayesiano93,5%6,5%
Assinatura + DNSBL91,8%8,2%

A melhor combinação (bayesiano + pergunta/resposta) teve o maior acerto — mas os próprios autores já sinalizavam o problema: citando Fabre (2005), o paper reconhece que sistemas de pergunta/resposta excluem pessoas com deficiência visual, que não conseguem ver a imagem-desafio.

O que se confirmou 20 anos depois

01

Classificação bayesiana sobreviveu como fundamento. Filtros modernos de machine learning e deep learning para spam derivam diretamente do princípio de probabilidade condicional que o paper já formalizava em 2006.

02

O aviso sobre acessibilidade se confirmou. Sistemas de pergunta/resposta com imagem (CAPTCHA de e-mail) praticamente desapareceram do mercado — exatamente pelo problema de exclusão que o paper já citava em 2006, hoje reconhecido como falha de design, não só de SEO.

03

Nenhuma técnica isolada chegou a 100%. A conclusão do paper — “não há um algoritmo ou técnica com 100% de eficiência” — permanece verdadeira: filtros de 2026 ainda combinam múltiplas camadas em sequência, não uma única solução.

O que mudou estruturalmente

A virada real não foi de eficiência — foi de onde a decisão acontece na cadeia. O paper de 2006 concentrava esforço em analisar o conteúdo já recebido. A indústria de 2026 resolve a maior parte do problema antes disso, na camada de identidade do remetente.

PeríodoFoco predominante
Meados dos 2000sAutenticação do remetente começa (DomainKeys → DKIM)
2010sSPF formaliza quem pode enviar por um domínio; DMARC adiciona política e relatório
Fim dos 2010s–início 2020sMigração de gateways locais para filtragem em nuvem
2020sMachine learning e deep learning tornam-se padrão
2024–2026Filtragem nativa em IA: detecção de conteúdo por LLM, análise de grafo de relacionamento, pontuação comportamental em tempo real

O paralelo com GEO

A mudança de “analisar o conteúdo” para “autenticar a identidade” no combate a spam é a mesma mudança que descrevo em livros como A Entidade e GEO CAUSAL: sistemas cada vez mais decidem confiar não no que uma mensagem ou página diz sobre si mesma, mas no que consegue provar através de assinatura criptográfica, registro verificável e consistência entre fontes. Spam e conteúdo genérico gerado por IA são, estruturalmente, o mesmo problema: conteúdo que se apresenta sem identidade verificável por trás.

Em 2006, a pergunta era “este texto parece malicioso?”. Em 2026, a pergunta é “quem, comprovadamente, está por trás disso?” — a mesma pergunta que qualquer sistema de IA generativa faz hoje antes de citar uma fonte.

Assinatura autoral

Sobre Raphael Sousa Pereira

Raphael Sousa Pereira · especialista em SEO, GEO, inteligência artificial e engenharia de prompt

Sou CEO e fundador da Negócio no Mapa, agência de inteligência de dados e marketing digital de Porto Alegre/RS, e pesquisador independente em Generative Engine Optimization (GEO), autor de A Entidade e GEO CAUSAL. Este artigo revisita um paper acadêmico brasileiro de acesso aberto, disponível no Redalyc, comparando os achados originais de 2006 com o estado da arte de detecção de spam em 2026.

Declaração de interesse: atuo profissionalmente com SEO, GEO e presença digital por meio de atividade comercial relacionada a esses campos. Essa relação constitui interesse relevante e deve ser considerada na leitura deste conteúdo. Os dados do paper original (Silva & Toscano, 2006) são reproduzidos com atribuição, a partir de fonte de acesso aberto (Redalyc).

Referência

SILVA, F. E. da; TOSCANO, W. Técnicas de detecção e classificação de spam. Exacta, São Paulo, v. 4, n. 2, p. 333-342, jul./dez. 2006. Disponível em: redalyc.org/pdf/810/81040213.pdf.

GEO IA — Rodapé Editorial