Drift
Linguístico
e Distribucional
Como mudanças na linguagem — além da obsolescência de fatos — afetam a percepção de marca em modelos generativos. Framework matemático completo com Jensen-Shannon Divergence, semântica diacrônica e viés de recência.
O drift que ninguém vê vindo
No volume anterior desta série, mapeamos o decay temporal de fatos: como informações que eram verdadeiras na data de corte do treinamento se tornam obsoletas com o passar do tempo. O mecanismo era relativamente direto — o mundo muda, o modelo não é atualizado, e a discrepância cresce.
Este volume examina um problema mais sutil e, argumentarei, mais insidioso: o drift linguístico e distribucional. Aqui, o problema não é que os fatos mudaram enquanto o modelo ficou parado. É que a própria linguagem mudou — os significados das palavras, as conotações dos termos, as estruturas de contexto que determinam como uma marca é percebida — e o modelo continua operando com a semântica da época do treinamento.
A distinção é fundamental. Quando o CEO de uma empresa muda, isso é decay factual — verificável, binário, corrigível via RAG. Mas quando o termo “inovação” muda de conotação no setor de tecnologia brasileiro — quando passa de atributo positivo diferenciador para descritor genérico sem valor semântico, e o modelo ainda o usa como marcador de qualidade — isso é drift linguístico. Não tem data de evento. Não é detectável por auditoria factual. E afeta como o modelo caracteriza marcas que usam essa linguagem de forma silenciosa e contínua.
A literatura categoriza temporal drift em três tipos primários: linguistic drift (mudanças nos padrões de uso da linguagem), knowledge drift (evolução de informação factual) e distributional drift (mudanças nas características dos dados de entrada), com quedas de performance reportadas entre 15% e 40% dependendo do gap temporal e do domínio.
Uma marca pode estar perfeitamente descrita nos parâmetros do modelo — CEO correto, produtos corretos, nicho correto — e ainda assim ser caracterizada de forma que não corresponde à sua identidade atual, porque a linguagem com que é descrita ficou presa num momento semântico que o mercado já superou. Esse é o drift que os dashboards de GEO padrão não medem.
Taxonomia do Drift Temporal em LLMs
1.1 Os cinco tipos de drift — taxonomia expandida
A literatura de NLP estabeleceu três categorias primárias de drift temporal. Expandimos para cinco para capturar os fenômenos relevantes à gestão de marca em motores generativos:
1.2 Por que drift linguístico é diferente de decay factual
O decay factual tem uma estrutura binária: um fato era verdadeiro em t₀ e deixou de ser verdadeiro em t₁. É corrigível via RAG porque existe uma fonte de verdade verificável. O drift linguístico tem uma estrutura gradiente e contínua: uma palavra ou expressão não “deixa de ser verdadeira” — ela muda de posição no espaço semântico de forma incremental, sem evento pontual identificável.
| Dimensão | Decay Factual | Drift Linguístico |
|---|---|---|
| Estrutura | Binária — verdadeiro → falso | Gradiente — contínua e cumulativa |
| Detectabilidade | Alta — auditoria factual identifica | Baixa — sem evento pontual detectável |
| Corrigibilidade via RAG | Alta — nova fonte substitui o fato | Baixa — não há “fato correto” para substituir |
| Velocidade | Abrupta (evento) ou lenta (deprecação) | Sempre lenta — anos a décadas |
| Impacto em marca | Informações incorretas geradas | Tom, posicionamento e identidade distorcidos |
| Exemplo | “CEO da empresa é João” — estava errado | “Empresa inovadora” — o que “inovadora” significa mudou |
D_ling = drift linguístico: mudança na posição semântica de termos associados à marca
D_dist = drift distribucional: mudança na distribuição de tipos de texto que definem o domínio
D_ctx = drift contextual: mudança nas normas culturais que moldam a interpretação dos outputs
Nota = D_ling, D_dist, D_ctx são não-corrigíveis via RAG simples — exigem estratégia de conteúdo longitudinal
Drift Linguístico: Quando as Palavras Mudam de Lugar
2.1 Semântica diacrônica — a linguística por trás do drift
A mudança semântica ao longo do tempo — chamada de semântica diacrônica ou mudança lexical semântica (Lexical Semantic Change, LSC) — é um campo bem estabelecido na linguística computacional. O estudo de Kleymann et al. rastreou a deriva semântica entre “teoria” e termos relacionados como “modelo” e “método” nas humanidades digitais ao longo de cinco décadas, usando embeddings de contexto médio para medir o drift.
Para LLMs, o problema é que o modelo aprende a semântica da época do corpus de treinamento e a “congela”. Quando a linguagem do mercado evolui — neologismos emergem, termos mudam de conotação, jargões técnicos são popularizados ou descartados — o modelo continua operando com o mapa semântico do passado.
E(w, t) = embedding contextual médio da palavra w no corpus do período t
cos(·,·) = similaridade de cosseno entre dois vetores de embedding
SD = 0 = sem drift: mesma posição semântica nos dois períodos
SD = 1 = ortogonal: sem sobreposição semântica — significado completamente diferente
SD = 2 = máximo: embeddings diametralmente opostos no espaço vetorial
2.2 Neologismos e o benchmark NEO-BENCH
A linguagem evolui com a emergência de neologismos — palavras novas que surgem para descrever conceitos novos ou que colonizam conceitos existentes com novos significados. Para LLMs, neologismos representam um desafio específico: não existem no corpus de treinamento, então o modelo não tem representação paramétrica para eles. Quando aparecem em queries de usuários, o modelo tenta inferir seu significado por analogia com termos conhecidos — com resultados frequentemente incorretos.
O NEO-BENCH (arXiv:2402.12261) é o primeiro benchmark que avalia sistematicamente a degradação de performance de LLMs com neologismos. Os resultados são consistentemente negativos: modelos apresentam degradação significativa mesmo para neologismos criados apenas meses após o corte de treinamento.
2.3 Drift lexical de marca — como o vocabulário associado à sua empresa muda
Para marcas, o drift linguístico mais relevante não é o drift dos termos do nicho em abstrato — é o drift do vocabulário que co-ocorre com o nome da marca no corpus. À medida que jornalistas, clientes e concorrentes usam linguagem diferente para falar sobre a empresa, a nuvem semântica ao redor do nome de marca muda no espaço latente do modelo.
p_t₁(w) = probabilidade de w aparecer no vocabulário de marca em t₁ (peso histórico do termo)
SD(w,t₁,t₂)= drift semântico individual do termo w entre t₁ e t₂ (Eq. 2.1)
DLM ↑ = vocabulário de marca com forte drift — identidade semântica da empresa está mudando na linguagem
DLM ↓ = vocabulário estável — linguagem associada à marca é resiliente ao drift linguístico do período
Drift Distribucional: Quando o Mundo dos Textos Muda
3.1 O problema da distribuição congelada
O pré-treinamento de LLMs consome uma distribuição específica de textos — Web, livros, código, notícias — com proporções específicas de tópicos, estilos e domínios que refletem o estado da internet na época da coleta. Quando essa distribuição muda — novos tipos de conteúdo dominam, formatos emergem, audiências mudam seus padrões de escrita — o modelo enfrenta um mismatch distribucional.
Para marcas, isso significa que o modelo pode estar calibrado para um tipo de discurso sobre a empresa que não corresponde mais ao que a audiência atual usa. Uma empresa que era discutida principalmente em artigos longos de tecnologia em 2022 e passou a ser discutida principalmente em threads curtos de rede social em 2025 pode ter sua representação paramétrica inadequada para o contexto atual.
3.2 Jensen-Shannon Divergence — a métrica certa para drift distribucional
A Jensen-Shannon Divergence (JSD) é a métrica preferida para medir drift distribucional em sistemas de LLM porque é simétrica (JSD(P‖Q) = JSD(Q‖P)) e limitada (∈ [0, ln2] com logaritmo natural, ou [0,1] com log base 2). Diferente da KL Divergence, que é assimétrica e pode ser infinita quando P tem suporte fora do suporte de Q, a JSD é sempre finita e comparável.
Q = distribuição de texto em t₂ (ex: corpus atual sobre a marca)
M = distribuição mistura — média de P e Q; elimina o problema de suporte infinito do KL
D_KL(P‖M) = KL divergence de P para M: ∑ P(x) · log(P(x)/M(x))
JSD ∈ [0,1] = 0 → distribuições idênticas (sem drift); 1 → distribuições sem sobreposição (drift máximo)
JSD simétrica = JSD(P‖Q) = JSD(Q‖P) — propriedade que KL não tem
3.3 Drift distribucional de marca — aplicação da JSD
Para uma entidade de marca específica, o drift distribucional é medido sobre a distribuição de tipos de texto em que o nome da marca aparece. Se em t₁ a marca aparecia predominantemente em artigos técnicos longos, e em t₂ predominantemente em posts curtos e reviews informais, isso constitui um shift distribucional que o modelo paramétrico não captura.
P_marca,t₂ = distribuição atual de tipos de texto sobre a marca
DDM = 0 = sem drift distribucional — mesmos tipos de texto nas mesmas proporções
DDM → 1 = drift distribucional máximo — composição de texto completamente diferente
Limiar prático = DDM > 0.3 indica drift distribucional significativo que requer análise de impacto
| Tipo de Texto | Peso típico t₁ (2022) | Peso típico t₂ (2026) | Impacto no Embedding |
|---|---|---|---|
| Artigos técnicos longos (>1500 palavras) | 45% | 18% | Redução de peso de contexto formal especializado |
| Posts de blog e newsletter | 30% | 22% | Estável — linguagem semiformal mantida |
| Threads e posts curtos (<280 chars) | 8% | 28% | Aumento massivo de contexto informal e sintético |
| Reviews e avaliações de produto | 7% | 19% | Shift para linguagem emocional e experiencial |
| Transcrições de vídeo/podcast | 5% | 10% | Emergência de oralidade escrita — novo registro |
| Conteúdo gerado por IA | <1% | ~3% | Feedback loop: IA treinada em IA — achatamento de variação |
Tabela 3.1 — Estimativa de mudança na composição do corpus web sobre marcas de tecnologia B2B. Valores são aproximações baseadas em estudos de distribuição de content types (TechRxiv 2025; arXiv:2604.12097). Variam por setor e marca.
O crescimento de conteúdo gerado por IA no corpus de treinamento de ciclos futuros cria um loop de feedback: modelos treinados em texto de IA reproduzem padrões de IA, que são usados para treinar novos modelos. O estudo arXiv:2604.12097 (Temporal Flattening) documentou que textos de LLM falham em reproduzir a evolução cognitiva, emocional e estilística do texto humano ao longo do tempo. Para marcas, isso significa que conteúdo gerado por IA que menciona a empresa contribui menos para a formação de embedding rico do que texto humano autêntico — e pode introduzir “achatamento semântico” na representação da marca.
Drift Semântico de Marca: AI Brand Drift
4.1 Os quatro layers de marca narrada por IA
O framework de Brandlight.ai define quatro camadas de identidade de marca no contexto de LLMs: Known Brand (o que a empresa afirma ser), Latent Brand (o que o modelo inferiu do corpus), Shadow Brand (o que o modelo gera sem input explícito da empresa) e AI-Narrated Brand (a síntese do modelo nas respostas ao usuário). O drift semântico opera principalmente na transição entre Latent Brand e AI-Narrated Brand.
P_narrated = distribuição de atributos nos outputs do LLM sobre a marca (bateria de prompts)
JSD(·‖·) = divergência entre o que a empresa afirma ser e o que o modelo diz que ela é
DLM = drift lexical de marca (Eq. 2.2) — contribuição do drift linguístico
DDM = drift distribucional de marca (Eq. 3.2) — contribuição do shift de distribuição
α, β = pesos calibrados por setor; sugestão: α=0.3, β=0.2 (componentes de longo prazo)
4.2 Casos empíricos de AI Brand Drift — dados reais
Os dados mais concretos disponíveis sobre AI Brand Drift vêm do rastreamento da Evertune no espaço de project management software entre setembro e outubro de 2025 — apenas um mês de variação:
O que os dados de Evertune demonstram é que drift de percepção de marca em LLMs é real, mensurável e ocorre em escala de tempo de semanas a meses — não de anos. E que a causa não é sempre um evento factual único, mas frequentemente uma mudança gradual na composição do vocabulário de co-ocorrência.
O drift semântico de marca em LLMs é influenciado pelo corpus geral do modelo e por fontes de terceiros fora do controle da empresa. Isso significa que a percepção de marca em IA pode mudar mesmo quando a empresa não publicou nada de novo — porque o corpus ao redor mudou. A estratégia defensiva não é apenas publicar conteúdo próprio, mas monitorar e influenciar o ecossistema de terceiros que define o contexto semântico da marca.
Viés de Recência: Quando Novo Não É Necessariamente Melhor
5.1 O paradoxo do viés de recência
O viés de recência em LLMs funciona de forma oposta ao decay factual discutido no volume anterior. No decay, o problema é que o modelo retém informação antiga quando a nova seria mais correta. No viés de recência, o problema é que o modelo privilegia informação nova quando a antiga ainda seria mais correta — ou mais contextualmente apropriada.
Para marcas, isso cria uma vulnerabilidade específica: uma crise temporária de PR, um período de reviews negativos incomum, ou uma cobertura negativa concentrada em semanas de alta atividade noticiosa pode ter peso desproporcional nos ciclos de retreinamento que consomem esses dados. A informação é recente, tem alta densidade no corpus do período, e o modelo pode superponderar.
freq(f, t) = frequência de ocorrência de f no corpus do período t
γ = fator de desconto de recência, γ > 1 → viés de recência; γ = 1 → sem viés; γ < 1 → viés de antiguidade
t_cutoff − t = distância temporal entre a publicação e o corte de treinamento (em dias)
T_ref = período de referência de normalização (tipicamente 30 ou 90 dias)
γ = 1.2 = informação 30 dias mais recente tem 20% mais peso — viés de recência moderado
5.2 Temporal Flattening — quando o modelo não entende “quando”
LLMs têm dificuldade fundamental em entender quando um fato é verdadeiro. Isso é diferente de não saber se um fato é verdadeiro. O estudo arXiv:2604.12097 (Temporal Flattening) documentou que texto gerado por LLMs condicionado apenas em tópico e tamanho não reproduz a evolução cognitiva, emocional e estilística do texto humano ao longo do tempo — os textos ficam “achatados” temporalmente, sem marcadores de época.
Para marcas, o temporal flattening significa que o modelo pode misturar representações de diferentes épocas da empresa em uma única resposta — descrevendo simultaneamente características da empresa de 2022 e de 2026 como se fossem contemporâneas. Isso não é alucinação no sentido factual, mas um tipo de anacronismo semântico.
TAS = 0 = modelo mistura completamente épocas diferentes — anacrônico total
R_modelo = resposta gerada pelo modelo M sobre a marca
R_esperado(t) = resposta esperada para a versão da marca em t_query
D_anacrônico = proporção de claims que pertencem a épocas diferentes de t_query
Temporal Flattening: O Achatamento da Identidade Temporal
6.1 Drift intra-resposta — a divergência que cresce dentro de uma única geração
Além do drift que ocorre entre ciclos de retreinamento, existe um tipo de drift que ocorre dentro de uma única resposta gerada: o intra-output drift. Como os LLMs geram texto token a token, sem um “plano mestre” para o output completo, as respostas mais longas tendem a derivar do tema original — com a deriva aumentando em proporção ao comprimento do texto gerado.
O estudo de FAIR, Meta e Anthropic (2024) demonstrou que a maioria do drift factual e de intenção ocorre nos primeiros tokens do output — uma observação crítica para estratégia de conteúdo de marca: a parte mais importante de qualquer resposta de LLM sobre uma empresa é o início.
δ_i = divergência do token i em relação à distribuição de referência p_ref
D_KL(·‖·)= KL divergence — mede quanto a distribuição atual diverge da de referência
p_ref(x_i)= distribuição esperada do token i dado o prompt original — “intenção de tema”
D_intra ↑ com n = drift acumula com o comprimento — respostas longas derivam mais do tema
6.2 Semantic Drift em Conversas Multi-Turn
Em interfaces conversacionais, o drift se amplifica em conversas multi-turn. Erros iniciais sobre a marca são raramente corrigidos espontaneamente — o modelo tende a ser consistente com seu output anterior, mesmo que esse output contenha imprecisões. O estudo arXiv:2604.23051 (Temporal Consistency) documentou que modelos apresentam frequentemente inconsistências temporais em conversas de múltiplos turnos sobre a mesma entidade.
D_multi(k)= drift acumulado após k turnos
ε_j = fator de amplificação de drift no turno j — depende do grau de autoconsistência do modelo
ε_j > 0 = drift amplifica: modelo assume outputs anteriores como referência e deriva ainda mais
ε_j = 0 = sem amplificação — modelo independente de turno a turno (não realista)
Context reset = nova conversa zera D_multi — mas não corrige M_param subjacente
Recomendações operacionais para monitoramento de drift intra-output: Customer service bots: semantic similarity < 0.85 triggers review. Para brand monitoring em LLMs públicos: semantic similarity do output sobre a marca com o brand canon < 0.75 exige investigação. A similaridade é calculada como cosseno entre o embedding do output do modelo e o embedding do posicionamento oficial da marca — usando o mesmo modelo de embedding como referência.
Mensuração do Drift com Jensen-Shannon Divergence
7.1 O framework completo de mensuração de drift linguístico-distribucional
Integrando as equações dos capítulos anteriores, propomos o Índice de Drift Linguístico-Distribucional de Marca (IDLDM) — uma métrica composta que quantifica simultaneamente os quatro tipos de drift relevantes para gestão de marca em LLMs.
DLM = drift lexical de marca (Eq. 2.2) — mudança no vocabulário associado
DDM = drift distribucional de marca (Eq. 3.2) — mudança na composição de tipos de texto
1−TAS= complemento do Temporal Awareness Score (Eq. 5.2) — grau de anacrônico
Pesos sugeridos: w₁=0.40, w₂=0.25, w₃=0.20, w₄=0.15
IDLDM < 0.15: drift controlado — linguagem de marca estável nos modelos
IDLDM ∈ [0.15, 0.35]: zona de alerta — monitorar e considerar ação de conteúdo
IDLDM > 0.35: drift significativo — intervenção de estratégia de marca necessária
7.2 Implementação computacional — código de auditoria
A mensuração prática de IDLDM requer três componentes: (1) um corpus de textos sobre a marca em dois períodos, (2) um modelo de embedding para calcular SD e DLM, e (3) uma bateria de prompts para medir JSD(P_known‖P_narrated). O cálculo de JSD entre dois conjuntos de atributos de marca:
7.3 Thresholds operacionais e configuração de alertas
| Métrica | Verde | Alerta | Crítico | Frequência de Monitoramento |
|---|---|---|---|---|
| JSD(P_known‖P_narrated) | < 0.15 | 0.15–0.30 | > 0.30 | Mensal |
| DLM — Drift Lexical de Marca | < 0.10 | 0.10–0.25 | > 0.25 | Trimestral |
| DDM — Drift Distribucional | < 0.20 | 0.20–0.40 | > 0.40 | Semestral |
| TAS — Temporal Awareness | > 0.80 | 0.60–0.80 | < 0.60 | Mensal |
| IDLDM — Índice Composto | < 0.15 | 0.15–0.35 | > 0.35 | Mensal |
| Semantic similarity (chatbots) | > 0.85 | 0.75–0.85 | < 0.75 | Contínuo |
Tabela 7.1 — Thresholds operacionais de IDLDM e métricas componentes. Valores são recomendações baseadas em benchmarks de MLflow, Evidently AI e Alibi Detect para sistemas de LLM em produção. Calibrar por setor e por marca.
Protocolo de Defesa contra Drift Linguístico-Distribucional
8.1 Os três vetores de defesa
O drift linguístico-distribucional tem uma característica que o torna mais difícil de combater do que o decay factual: ele não é corrigível por uma única ação de conteúdo. Exige uma resposta em três vetores simultâneos — vocabulário, distribuição e ancoragem temporal.
Substituir, no vocabulário de marca, termos com alto SD (semântica instável) por termos com baixo SD e alta especificidade. “Inovação” → “primeira agência de GEO do Brasil”. “Soluções digitais” → “Generative Engine Optimization para empresas brasileiras”. Especificidade cria âncoras semânticas mais resistentes ao drift.
Produzir conteúdo que cubra todos os tipos de texto relevantes — artigos longos, posts curtos, respostas em fóruns, transcrições de entrevistas — garantindo que a distribuição de tipos de texto sobre a marca se diversifique e não fique dominada por um único formato.
Incluir marcadores temporais explícitos no conteúdo de marca: “em 2026”, “desde 2023”, “atualmente”. Isso não resolve o temporal flattening paramétrico do modelo, mas aumenta a probabilidade de o sistema RAG recuperar documentos com a versão correta da marca para o momento da query.
8.2 O Brand Canon como âncora semântica — equação de priorização
O Brand Canon é o documento oficial de posicionamento da marca — os atributos, termos e descrições que a empresa aprova como representação precisa de si mesma. No contexto de LLMs, o Brand Canon funciona como a distribuição de referência P_known na Equação 4.1. A prioridade de produção de conteúdo deve ser proporcional ao gap entre P_known e P_narrated para cada atributo:
π_a = peso estratégico do atributo no posicionamento global da marca (∑π_a = 1)
p_known(a) = proporção do atributo a no brand canon oficial
p_narrated(a) = proporção com que o modelo gera o atributo a sobre a marca
SD(a, t₁, t₂)= drift semântico do atributo a (Eq. 2.1) — atributos com alto SD precisam de reforço extra
Prio ↑ = atributo importante, sub-representado nos modelos, com linguagem instável → prioridade máxima
O drift linguístico-distribucional é o tipo de problema que os dashboards de hoje não medem e que os profissionais de GEO de amanhã vão ter que resolver. A marca pode estar factualmente correta em todos os modelos e ainda assim ser percebida de forma que não corresponde à sua identidade, porque a linguagem que a define ficou presa num momento semântico que o mercado já superou. Medir JSD entre o brand canon e o que o modelo diz é o próximo nível da auditoria de marca digital.