Retrospectiva acadêmica · 20 anos (2006–2026) · métricas de usabilidade e avaliação de agentes de IA
20 ANOS DE MÉTRICAS DE USABILIDADE: o que mudou desde 2006
“Métricas de usabilidade” (Toscano, revista Exacta, Uninove, 25 nov. 2006) propunha aplicar eficácia, eficiência e satisfação — os três parâmetros da ISO 9241-11 — ao software educacional, com IA mediando o diálogo entre usuário e máquina. Vinte anos depois, é essa mesma métrica que está sendo usada para avaliar a própria IA.
Esta não é uma história de substituição — é de continuidade
Diferente de arquiteturas técnicas que ficam obsoletas, o SUS (System Usability Scale) citado indiretamente pelo paper via Brooke (1996) não foi substituído em 20 anos — segue como o questionário de usabilidade mais citado do mundo, usado em mais de 1.300 artigos científicos. E, em 2026, está sendo aplicado para medir exatamente o que o paper de 2006 já apontava: a interação entre usuário e “inteligência computacional”.
Sou Raphael Sousa Pereira, especialista em SEO, Generative Engine Optimization (GEO), inteligência artificial e engenharia de prompt. Revisito aqui um paper acadêmico brasileiro de 2006 sobre métricas de usabilidade, comparado ao estado da arte de avaliação de sistemas de IA em 2026.
O que mudou nas métricas de usabilidade entre 2006 e 2026?
Surpreendentemente pouco na estrutura, e muito no objeto de medição. O paper “Métricas de usabilidade” (Toscano, Exacta, 2006) usava os três parâmetros da ISO 9241-11 — eficácia, eficiência e satisfação — e citava o SUS (System Usability Scale, Brooke, 1996) e o método PARADISE (Walker, Litman & Kamm, 1999) para diálogo humano-máquina. Vinte anos depois, o SUS continua sendo o questionário de usabilidade mais citado do mundo, usado em mais de 1.300 artigos científicos, e a ISO 9241-11 permanece a referência-base da área. A mudança real não foi metodológica — foi de sujeito: em 2026, pesquisas aplicam SUS e frameworks derivados do PARADISE para avaliar agentes de IA, interfaces de voz e sistemas baseados em LLM, exatamente a “inteligência computacional” que o paper de 2006 já antecipava como mediadora do diálogo entre usuário e máquina.
O que o paper de 2006 propunha
Wagner Toscano (Uninove) definia a métrica de usabilidade como a obtenção de indicadores quantitativos sobre a facilidade de uso de um objeto — no caso, softwares aplicativos educacionais — formando um histórico que revelaria problemas de usabilidade e orientaria a evolução do produto.
| Parâmetro (ISO 9241-11) | Como o paper definia |
|---|---|
| Eficácia | Percentual de tarefas executadas corretamente sobre o total de tarefas |
| Eficiência | Relação entre eficácia e tempo total gasto pelo usuário |
| Satisfação | Medida subjetiva, quantificada por questionário (SUS, Brooke 1996) |
O paper reconhecia, já em 2006, que a métrica de usabilidade é subjetiva — sem valores de grandeza fixos — e que o comportamento do usuário (irritação, desconforto, persistência no erro) pode ser aproximado por lapsos de tempo. Cita o método PARADISE (Paradigm for Dialogue System Evaluation), de Walker, Litman e Kamm (1999), como base para quantificar diálogo humano-máquina além do tempo — incluindo tarefas concluídas com sucesso e qualidade da interação. O objetivo declarado do trabalho era aplicar ferramentas de inteligência artificial (redes neurais, árvores de decisão, lógica fuzzy, algoritmo genético) ao processo de cognição, para viabilizar diálogo entre usuário e máquina.
O que sobreviveu — quase intacto
ISO 9241-11 continua a referência-base. Eficácia, eficiência e satisfação seguem os três pilares oficiais de usabilidade citados por praticamente todo guia de UX publicado em 2026.
SUS não foi substituído — foi consolidado. Criado por John Brooke em 1986 (paper de 2006 já o citava), o SUS é hoje o questionário de usabilidade mais citado do mundo, usado em mais de 1.300 artigos científicos, com validade reafirmada após quase 40 anos.
PARADISE é ancestral direto da avaliação de IA conversacional. O framework de 1999 para diálogo humano-máquina, citado no paper de 2006, antecede diretamente as métricas modernas de avaliação de chatbots e assistentes de voz baseados em LLM.
O que mudou: o sujeito da medição
Em 2026, pesquisas acadêmicas aplicam o SUS diretamente para avaliar a usabilidade percebida de agentes de IA — inclusive comparando a percepção de usabilidade de um agente de UX simulado com a de um humano real na mesma tarefa. Outro estudo de 2026 usa SUS para medir a experiência de uso de uma extensão de navegador baseada em LLM para detecção de fake news. O instrumento é literalmente o mesmo dos anos 1980; o objeto que ele mede é que se tornou, ele próprio, um sistema de inteligência artificial dialogando com o usuário — exatamente o cenário que o paper de 2006 projetava como “próximo passo” da pesquisa.
A métrica de usabilidade de 2006 não precisou ser reinventada para medir inteligência artificial em 2026 — ela só precisou de um novo tipo de sistema para medir. É uma lição de humildade sobre quais partes de um trabalho de pesquisa envelhecem, e quais não.
Referência
TOSCANO, W. Métricas de usabilidade. Exacta, São Paulo, v. 4, n. especial, p. 79-80, 25 nov. 2006. Disponível em: periodicos.uninove.br/exacta/article/download/697/642.