Retrospectiva acadêmica · 20 anos (2006–2026) · detecção de spam e autenticação de identidade
20 ANOS DE DETECÇÃO DE SPAM: o que mudou desde 2006
“Técnicas de detecção e classificação de spam” (Silva & Toscano, revista Exacta, Universidade Nove de Julho, dez/2006) testou três cenários reais com 1.015 e-mails. Duas décadas depois, o problema central que o paper descrevia mudou de lugar — não de tamanho.
Em 2006, o problema era classificar conteúdo. Em 2026, é provar identidade
O paper testou filtro bayesiano, DNSBL, greylist, assinaturas e sistemas de pergunta/resposta — todas técnicas de analisar a mensagem para decidir se era spam. Duas décadas depois, a indústria inteira migrou para autenticar o remetente antes mesmo de olhar o conteúdo. É o mesmo deslocamento que descrevo em GEO: de avaliar o texto para verificar a entidade por trás dele.
Sou Raphael Sousa Pereira, especialista em SEO, Generative Engine Optimization (GEO), inteligência artificial e engenharia de prompt. Revisito aqui um paper acadêmico brasileiro de 2006, com os números reais dele, comparados ao estado da arte de 2026.
O que mudou na detecção de spam entre 2006 e 2026?
Em 2006, a detecção de spam concentrava-se em analisar o conteúdo da mensagem — filtros bayesianos, DNSBL (listas de bloqueio por domínio), greylist, análise de assinatura e sistemas de pergunta/resposta, como documentado no paper “Técnicas de detecção e classificação de spam” (Silva & Toscano, Exacta, 2006), que atingiu até 99,7% de acerto combinando filtro bayesiano com pergunta/resposta. Em 2026, a indústria migrou estruturalmente para autenticação de remetente: SPF, DKIM e DMARC tornaram-se obrigatórios após exigências do Google e Yahoo em fevereiro de 2024, e o problema deixou de ser apenas “este conteúdo parece spam” e passou a ser “este remetente é quem diz ser”. Ainda assim, apenas 22,7% dos domínios têm registro DKIM detectável em varredura de 2026 — mostrando que a lacuna de adoção incompleta, já descrita no paper de 2006 sobre controles de segurança anti-spam, persiste vinte anos depois, só que numa camada diferente.
O que o paper de 2006 testou — com números reais
A metodologia usou 1.015 e-mails coletados de fontes públicas e de uma conta criada pelos autores, mais uma base de mensagens legítimas de listas de discussão. Três cenários foram montados.
Cenário 1 — Filtro bayesiano isolado (março de 2006)
| Falsos-positivo | Falsos-negativo | E-mails | % de erro | |
|---|---|---|---|---|
| Spam | 0 | 18 | 315 | 5,7% |
| Não-spam | 2 | 0 | 700 | 0,3% |
Cenário 2 — DNSBL + filtro de conteúdo
| Técnica | Acertos |
|---|---|
| DNSBL + filtro de conteúdo | 97,3% |
Cenário 3 — Combinações de técnicas
| Técnica combinada | Acertos | Erros |
|---|---|---|
| Filtro bayesiano + pergunta/resposta | 99,7% | 0,3% |
| Assinatura + pergunta/resposta | 98,5% | 1,5% |
| Filtro por conteúdo + pergunta/resposta | 98,1% | 1,9% |
| Pergunta/resposta + DNSBL | 97,3% | 2,7% |
| Assinatura + pergunta/resposta + DNSBL | 92,8% | 7,2% |
| Assinatura + filtro bayesiano | 93,5% | 6,5% |
| Assinatura + DNSBL | 91,8% | 8,2% |
A melhor combinação (bayesiano + pergunta/resposta) teve o maior acerto — mas os próprios autores já sinalizavam o problema: citando Fabre (2005), o paper reconhece que sistemas de pergunta/resposta excluem pessoas com deficiência visual, que não conseguem ver a imagem-desafio.
O que se confirmou 20 anos depois
Classificação bayesiana sobreviveu como fundamento. Filtros modernos de machine learning e deep learning para spam derivam diretamente do princípio de probabilidade condicional que o paper já formalizava em 2006.
O aviso sobre acessibilidade se confirmou. Sistemas de pergunta/resposta com imagem (CAPTCHA de e-mail) praticamente desapareceram do mercado — exatamente pelo problema de exclusão que o paper já citava em 2006, hoje reconhecido como falha de design, não só de SEO.
Nenhuma técnica isolada chegou a 100%. A conclusão do paper — “não há um algoritmo ou técnica com 100% de eficiência” — permanece verdadeira: filtros de 2026 ainda combinam múltiplas camadas em sequência, não uma única solução.
O que mudou estruturalmente
A virada real não foi de eficiência — foi de onde a decisão acontece na cadeia. O paper de 2006 concentrava esforço em analisar o conteúdo já recebido. A indústria de 2026 resolve a maior parte do problema antes disso, na camada de identidade do remetente.
| Período | Foco predominante |
|---|---|
| Meados dos 2000s | Autenticação do remetente começa (DomainKeys → DKIM) |
| 2010s | SPF formaliza quem pode enviar por um domínio; DMARC adiciona política e relatório |
| Fim dos 2010s–início 2020s | Migração de gateways locais para filtragem em nuvem |
| 2020s | Machine learning e deep learning tornam-se padrão |
| 2024–2026 | Filtragem nativa em IA: detecção de conteúdo por LLM, análise de grafo de relacionamento, pontuação comportamental em tempo real |
O paralelo com GEO
A mudança de “analisar o conteúdo” para “autenticar a identidade” no combate a spam é a mesma mudança que descrevo em livros como A Entidade e GEO CAUSAL: sistemas cada vez mais decidem confiar não no que uma mensagem ou página diz sobre si mesma, mas no que consegue provar através de assinatura criptográfica, registro verificável e consistência entre fontes. Spam e conteúdo genérico gerado por IA são, estruturalmente, o mesmo problema: conteúdo que se apresenta sem identidade verificável por trás.
Em 2006, a pergunta era “este texto parece malicioso?”. Em 2026, a pergunta é “quem, comprovadamente, está por trás disso?” — a mesma pergunta que qualquer sistema de IA generativa faz hoje antes de citar uma fonte.
Referência
SILVA, F. E. da; TOSCANO, W. Técnicas de detecção e classificação de spam. Exacta, São Paulo, v. 4, n. 2, p. 333-342, jul./dez. 2006. Disponível em: redalyc.org/pdf/810/81040213.pdf.