Como avaliar aprendizagem em um mundo com IA generativa?
A IA não tornou a avaliação obsoleta.
Tornou algumas de nossas inferências sobre aprendizagem menos seguras.
Durante muito tempo, uma premissa permaneceu relativamente implícita em muitas avaliações: a resposta observada era resultado, predominantemente, do trabalho intelectual do próprio estudante.
A inteligência artificial generativa altera essa relação.
Hoje, sistemas de IA podem resolver problemas, produzir argumentos, resumir textos, escrever códigos, interpretar informações e executar tarefas que antes eram utilizadas como evidência de determinadas aprendizagens.
Isso cria um problema mais profundo do que simplesmente perguntar se o estudante 'usou IA'.
A pergunta passa a ser:
O que esta resposta ainda nos permite concluir sobre a aprendizagem do estudante?
Resposta correta não é sinônimo de evidência suficiente
Imagine que queremos avaliar se um estudante consegue comparar duas explicações históricas e construir um argumento sustentado por evidências.
Podemos solicitar:
'Compare as duas interpretações e escreva um texto argumentativo de 500 palavras.'
A produção final pode parecer excelente.
Mas, se todo o trabalho de interpretação, seleção de evidências e construção argumentativa puder ser delegado a uma IA, observar apenas o texto final pode não ser suficiente para sustentar a inferência pretendida.
O problema não está necessariamente na qualidade da resposta.
Está na relação entre:
aquilo que queríamos avaliar
e
aquilo que conseguimos observar.
A questão central é a validade da inferência
Toda avaliação envolve uma inferência.
Observamos uma resposta ou desempenho e, a partir dele, concluímos algo sobre conhecimentos, habilidades ou competências que não conseguimos observar diretamente.
A IA pode interferir justamente nessa ponte.
Se parte significativa da atividade cognitiva que deveria produzir a evidência é realizada por outro agente, precisamos reconsiderar o que aquela evidência representa.
“Como impedir que o estudante use IA?”
“Que evidência preciso observar para sustentar a conclusão que desejo fazer sobre sua aprendizagem?”
Essa mudança desloca o debate de controle para validade da avaliação.
Uma questão respondida pela IA continua sendo uma boa questão?
Pode continuar sendo.
O fato de uma IA conseguir resolver uma questão não determina, sozinho, sua qualidade pedagógica.
Considere uma avaliação presencial, supervisionada e sem acesso a dispositivos.
Uma tarefa pode ser facilmente solucionada por uma IA e ainda produzir evidências perfeitamente úteis quando realizada pelo estudante naquele contexto.
Por outro lado, uma atividade complexa realizada em casa pode permitir que praticamente todo o trabalho cognitivo seja delegado.
É por isso que precisamos separar:
- AI Solvability
- — a IA consegue solucionar a tarefa?
- AI Delegability
- — nas condições reais da avaliação, o estudante consegue delegar à IA o trabalho intelectual que pretendíamos observar?
Se o ChatGPT responde, a questão não serve.
Não é assim.
Não precisamos criar avaliações "à prova de IA"
Provavelmente essa corrida sequer tem um ponto de chegada.
Modelos de IA continuarão melhorando.
Tentar construir tarefas que sistemas futuros jamais consigam resolver transforma avaliação educacional em uma competição tecnológica.
O objetivo da avaliação é outro.
Precisamos criar condições nas quais seja possível produzir evidências interpretáveis da aprendizagem.
- justificativas;
- decisões intermediárias;
- comparação entre alternativas;
- uso de evidências;
- resolução contextualizada;
- produção em diferentes momentos;
- reflexão sobre o processo;
- defesa de uma decisão;
- revisão crítica de uma resposta produzida por IA.
E, em determinados contextos, a própria capacidade de usar, avaliar e questionar criticamente a IA pode constituir parte do que desejamos avaliar.
O contexto de aplicação importa
A mesma questão não possui necessariamente o mesmo significado avaliativo em todos os contextos.
em sala, individualmente e sem dispositivos
em casa, durante uma semana e com acesso irrestrito à IA
Por isso, analisar somente o texto da questão é insuficiente.
Precisamos considerar conjuntamente:
- constructo
- tarefa
- contexto
- ação do estudante
- evidência observável
É nessa relação que a qualidade da inferência avaliativa é construída.
Da proibição ao desenho da evidência
A chegada da IA oferece uma oportunidade para rever práticas que já apresentavam limitações antes dela.
“Como controlar o uso de IA?”
“Como desenhar uma situação na qual a aprendizagem que me interessa se torne observável?”
Essa é uma pergunta de avaliação.
E é justamente nela que a IA deixa de ser apenas um problema e pode tornar-se também uma ferramenta para testar, analisar e fortalecer o próprio desenho avaliativo.
Inteligência de Avaliação
Chamamos essa nova perspectiva de Inteligência de Avaliação.
Ela combina critérios pedagógicos, análise de evidências e inteligência artificial para ajudar o professor a compreender melhor aquilo que uma avaliação realmente permite inferir.