A tutoria por IA igualou a humana num teste de admissão…

Uma hora com um modelo de linguagem rendeu aos estudantes tanto como uma hora com um explicador humano experiente, pelo menos num teste norte-americano de acesso à pós-graduação. A conclusão anda a circular com entusiasmo e quase sem ressalvas. Lemos o estudo inteiro, apêndices incluídos, e há nele coisas que animam e coisas que pedem travão.

O que foi feito

O trabalho chama-se StudentBench, é assinado por Curtis Northcutt e mais cinco autores e foi publicado como preprint no arXiv a 23 de setembro de 2026 (a versão que lemos é a segunda, de 30 de setembro). Quem o financiou foi a Handshake AI, o que os autores declaram na secção de ética. Não encontrámos indicação de que tenha passado por revisão de pares, e convém lê-lo com essa condição à vista.

O teste escolhido foi o GRE, a prova usada sobretudo nos Estados Unidos para candidaturas a mestrados, doutoramentos e escolas de gestão, com uma parte de raciocínio quantitativo e outra de raciocínio verbal, em inglês. Os participantes foram 2383 adultos, 83% deles entre os 18 e os 24 anos, recrutados numa plataforma de emprego para jovens e pagos com 50 dólares por sessão, fizessem bem ou mal. Cada um fez um teste inicial de 27 perguntas, passou cinco minutos a rever os erros e depois uma hora numa de três situações, atribuída ao acaso: tutoria por IA, tutoria humana ou nada (neste último caso viram documentários de natureza). Terminada a hora, fizeram um segundo teste, com perguntas novas mas da mesma dificuldade, escritas por antigos autores de questões do ETS e da Kaplan. O ganho de aprendizagem é a diferença entre as duas notas, em pontos percentuais.

Do lado da IA estiveram 13 tutores, construídos a partir de 12 modelos de várias empresas. Receberam os erros do aluno, planearam a aula, criaram os exercícios e conversaram por escrito, com instruções deliberadamente curtas. Nunca viram o teste final. Os tutores humanos davam a aula por videochamada e eram antigos funcionários do ETS ou da Kaplan, ou pessoas com pelo menos cinco anos de experiência em explicações de GRE.

O que se encontrou

As médias brutas foram de 13,9 pontos percentuais para a IA, 15,6 para os tutores humanos e 7,1 para o grupo que viu documentários. Depois de ajustar pela nota de partida, a diferença entre IA e humanos ficou em −0,58 pontos (intervalo de confiança a 90% de −2,18 a 1,03), dentro da margem de ±4,09 pontos que os autores fixaram, o que dá uma equivalência estatística com p = 0,015. Dizer «equivalente» aqui quer dizer que a diferença provável é pequena em relação a uma margem escolhida de antemão. Não quer dizer igual. Em relação a quem não teve tutoria, a IA somou 6,15 pontos (intervalo a 95% de 4,08 a 8,21), cerca de uma resposta certa e meia a duas num teste de 27.

Há um pormenor que passa despercebido nas notícias e que a nós, professores, devia dizer alguma coisa: o grupo de controlo também melhorou, 7,1 pontos, sem um único minuto de explicação. Tinha refeito um teste da mesma natureza e gasto cinco minutos a olhar para os próprios erros. Uma parte considerável do que se atribui à tutoria vem, afinal, de algo que qualquer turma pode fazer sem tecnologia nenhuma.

Onde a igualdade deixa de se aguentar

A equivalência vale para a parte quantitativa (diferença de 0,88 pontos, p = 0,028) e não ficou demonstrada na verbal (−2,19 pontos, intervalo a 90% de −4,31 a −0,07, p = 0,085). Nos três domínios verbais, os tutores humanos ficaram acima da média da IA. Na compreensão de leitura, o ganho em relação ao controlo foi de 3,1 pontos para a IA e de 3,7 para os humanos, e em ambos os casos o intervalo de confiança inclui o zero. Ou seja, o estudo não consegue garantir que a tutoria, seja de quem for, tenha feito diferença nesse domínio. Para quem ensina Português, esta é provavelmente a linha mais interessante de todo o trabalho, ainda que o teste seja em inglês e nada nos diga sobre a nossa língua.

Outra manchete que merece cuidado é a de que o melhor tutor de IA superou o humano em cinco dos sete domínios. É verdade, mas compara-se o melhor de treze com a média dos humanos, e os próprios autores avisam, num dos apêndices, que essas comparações com o máximo não são avaliadas pelos testes estatísticos principais.

As fragilidades que os autores assumem

A amostra de tutoria humana é pequena: 140 sessões, com nove tutores por secção, e muitos alunos partilharam o mesmo tutor. Isso faz com que as sessões humanas se reduzam, em termos estatísticos, a sete grupos interligados, 102 das 140 no maior, e a 1,59 graus de liberdade efetivos. Numa análise de sensibilidade sem as covariáveis do modelo principal, a equivalência não ficou estabelecida em nenhuma das secções. O resultado é apresentado com honestidade, mas assenta num pé mais curto do que o título deixa supor.

Há ainda o que o desenho não permite saber. Não havia um grupo que passasse a hora a resolver exercícios sozinho, pelo que não se mede o que a IA acrescenta em comparação com simplesmente treinar. Os ganhos são imediatos, e nada se diz sobre o que fica passados meses. Dos cerca de 70 000 estudantes convidados, entraram na análise 2383, depois de excluídos, entre outros, os que tiveram notas iniciais demasiado altas ou demasiado baixas e os que mostraram pouco empenho.

O custo: 918 vezes menos

O número que mais viajou foi este. Um dos tutores de IA, o Gemma 4 31B, um modelo de pesos abertos, teve ganhos equivalentes aos dos humanos (p = 0,044) a um custo de 0,0052 dólares por ponto percentual ganho, contra 4,81 dólares dos tutores humanos. As contas conferem. Um tutor humano a 75 dólares por hora e 15,608 pontos de ganho médio dá 75 ÷ 15,608 ≈ 4,81. O Gemma custou em média 0,06671 dólares por sessão e deu 12,742 pontos, ou seja, 0,06671 ÷ 12,742 ≈ 0,00524. Dividindo uma coisa pela outra, 4,805 ÷ 0,005235 ≈ 918.

Convém olhar para o que está dentro de cada lado da conta. Os 75 dólares são um preço de referência retirado do site de uma empresa americana de explicações, não um custo medido. Os do lado da IA são só os de inferência, o que o modelo gastou a responder, sem plataforma, sem equipa técnica, sem equipamentos, sem proteção de dados, sem o tempo que um professor precisaria de lhe dedicar. E o teste de equivalência do Gemma foi um entre doze feitos separadamente e sem correção para comparações múltiplas; seis dos doze passaram, e os autores classificam esta análise como exploratória. Para ter uma ideia da variação, o tutor mais caro (GPT-5.5 Pro) custou 21,24 dólares por sessão, cerca de 318 vezes mais do que o Gemma.

A tese de que isto pode «democratizar» o acesso a ajuda individualizada é dos autores e é plausível, ligando ao velho problema dos dois sigmas de Bloom, a pergunta sobre como tornar acessível a todos o efeito do ensino individual. Mas o salto de «custa cêntimos por sessão a quem o fornece» para «chega à escola e aos alunos que mais precisam» tem pelo meio tudo o que o estudo não mediu.

Respostas rápidas, e a falta de hesitação

Entre os 12 tutores comparados, os que respondiam mais depressa levavam os alunos a escrever mais: a resposta variou entre 1,9 segundos (GPT-5.4 mini) e 31,0 segundos (GPT-5.5 Pro), com uma correlação de −0,81 (p = 0,006). Nas sessões da parte quantitativa (1137), cada dez segundos a mais de espera associou-se a 5,19 mensagens a menos por parte do aluno; dez mensagens a mais, a 0,52 exercícios resolvidos corretamente a mais; e dez exercícios corretos a mais, a 5,62 pontos de ganho. A cadeia é interessante, mas é observacional e não aparece na parte verbal, onde os alunos escrevem menos mensagens e mais compridas, de modo que contar mensagens pode não medir a mesma coisa.

Há aqui uma tensão que nos ficou na cabeça. Na semana passada, a propósito do Nobel, escrevemos sobre Anne Carson e o tempo que o dicionário em papel obrigava a esperar, esse intervalo de hesitação em que o pensamento já anda a caminho da palavra. O StudentBench aponta quase no sentido oposto: respostas rápidas, mais conversa, mais prática, mais ganho. Não há contradição necessária (um exercício de matemática com feedback imediato não é uma tradução de grego), mas é uma boa pergunta para ter em mente quando se desenha uma atividade com IA. Quando é que a velocidade ajuda a treinar, e quando é que tira ao aluno o tempo de pensar?

Ensinar bem não é o mesmo que fazer aprender

O segundo estudo do artigo pôs 51 tutores experientes a comparar, às cegas, planos de aula e exercícios gerados por diferentes modelos, num total de 2028 comparações. Os modelos que ficaram melhor classificados nesses rankings não são os que tiveram melhores ganhos de aprendizagem. Os autores suspeitam que a rapidez e o envolvimento dos alunos ajudem a explicar por que razão modelos fracos a planear aulas conseguiram, ainda assim, resultados de nível humano. Fica a lição de que a opinião de especialistas sobre uma aula não substitui a medição do que os alunos aprendem, e vale para planos feitos por IA e para planos feitos por nós.

Um dado mais prosaico vale a pena registar. Os alunos podiam carregar num botão a dizer que discordavam da resposta de um exercício. Aconteceu em 523 de 21 769 problemas quantitativos respondidos (2,4%) e em 120 de 23 694 verbais (0,5%), com um dos tutores a chegar perto dos 11% na parte quantitativa. O botão regista discordância, não erro confirmado. Mesmo assim, é um lembrete simpático de que as soluções que a IA propõe têm de passar pelas mãos de um professor, como já víamos no texto sobre a docência redescoberta com IA generativa, onde as rubricas geradas pelo modelo só ganhavam valor depois de verificadas.

O que pode a escola aproveitar daqui

O que se segue são leituras nossas, não conclusões do estudo.

A primeira é a mais óbvia e a mais esquecida: o estudo não testou crianças nem adolescentes, nem português, nem turmas inteiras, nem currículos. Os participantes eram adultos, a prova era de admissão, a hora era de trabalho individual e a língua era o inglês. Qualquer extrapolação para o 7.º ano de Matemática em Oeiras ou em Bragança é, para já, uma hipótese.

A segunda é que a mecânica que o estudo usou é replicável sem IA: um teste de diagnóstico, uns minutos a olhar para os próprios erros, prática dirigida a esses erros, novo teste com perguntas diferentes. É isto que os tutores, humanos e artificiais, faziam, e é o que o grupo de controlo fez em versão reduzida e ainda assim subiu 7,1 pontos. Não custa nada começar por aí.

A terceira tem a ver com o que se mede. O post-teste do StudentBench foi feito sem apoio nenhum, e isso importa, porque o estudo de Bastani e colaboradores, publicado na PNAS e resumido pelos autores do StudentBench, concluiu que, em matemática do secundário, a ajuda de IA sem barreiras melhorava o desempenho nos exercícios e prejudicava o desempenho posterior sem ela. Os tutores do StudentBench tinham instruções para ensinar e não para entregar respostas. Como contámos a propósito da Estónia, uma aplicação pensada para não dar a resposta pronta recebeu dos alunos uma nota média de 3,07 em 5, quando a meta era 4,2, em boa parte porque fazia perguntas a mais. A ferramenta que ensina bem e a que os alunos preferem nem sempre coincidem, e a escola precisa de saber qual das duas está a comprar.

A quarta diz respeito a quem fica a ganhar. Nos dois primeiros grupos de nota inicial da parte quantitativa, a vantagem da IA sobre o controlo foi clara (p < 0,001); no grupo mais forte, os dados não permitem concluir (p = 0,129). Se houver efeito, é onde o apoio individual mais falta, o que é coerente com a promessa de equidade, desde que haja equipamento, ligação, regras de proteção de dados e alguém que acompanhe. Para quem está a pensar como organizar o uso de IA no agrupamento, o nosso guia de projetos educativos com inteligência artificial ajuda a pôr as perguntas pela ordem certa.

Ficamos, por fim, com a parte verbal. Se há domínio em que os humanos ainda parecem ter vantagem, é o da leitura e da escrita, e é precisamente aquele em que o nosso trabalho de professores não se resume a corrigir respostas certas. Seria um erro tirar daqui a conclusão de que se pode deixar a Português entregue a um assistente. Seria igualmente um erro ignorar que um tutor que responde em dois segundos, sem cansaço e a custo quase nulo, pode servir para treinar partes do trabalho que hoje ficam por fazer por falta de tempo.

Os dados anonimizados e o código estão disponíveis para quem os quiser analisar, no Hugging Face e no GitHub, segundo o preprint. A boa notícia deste género de trabalho é que se pode contestar.

Nota editorial e de transparência. Este artigo foi elaborado com assistência de inteligência artificial (Claude, da Anthropic), com revisão e responsabilidade editorial dos autores. Assenta numa única fonte primária, o preprint StudentBench (v2, 30 de setembro de 2026), que lemos na íntegra a partir do PDF; confirmámos no arXiv o título, os autores e as datas. Não encontrámos revisão de pares nem análises independentes dos resultados. As ligações para outros trabalhos vêm da lista de referências do preprint e não foram todas abertas por nós: a página da PNAS bloqueou o acesso automático, pelo que o estudo de Bastani e colaboradores é descrito como os autores do StudentBench o descrevem. O estudo inclui modelos da Anthropic, a empresa que desenvolve o Claude, e os modelos desta empresa aparecem bem colocados nos rankings de planos de aula, o que convém ter presente. Cálculos: 75 ÷ 15,608 = 4,81; 0,06671 ÷ 12,742 = 0,00524; 4,805 ÷ 0,005235 ≈ 918; 523 ÷ 21 769 = 2,4%; 120 ÷ 23 694 = 0,5%; 21,24 ÷ 0,06671 ≈ 318; 6,15% de 27 perguntas ≈ 1,7. Nível de confiança: alto nos números transcritos do preprint; médio nas leituras para a escola, que são nossas e não foram testadas.

Referências

Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences, 122(26), Artigo e2422633122. https://doi.org/10.1073/pnas.2422633122

Bloom, B. S. (1984). The 2 sigma problem: The search for methods of group instruction as effective as one-to-one tutoring. Educational Researcher, 13(6), 4–16. https://doi.org/10.3102/0013189×013006004

Northcutt, C., Hasmani, I., Feng, K., Khangi, T., Plesner, A., & Mueller, J. (2026). StudentBench: AI and human tutoring yield equivalent GRE learning gains (arXiv:2609.28470v2) [Preprint]. arXiv. https://arxiv.org/abs/2609.28470 (consultado em 11 de outubro de 2026)

Para saber mais

O texto integral do preprint tem, nos apêndices, as tabelas por domínio e por nível de partida. Sobre outros estudos de tutoria com IA, o preprint cita o de Kestin e colaboradores, um ensaio aleatorizado em física que compara um tutor de IA estruturado com aulas de aprendizagem ativa, e o de LearnLM e Eedi, feito em turmas do Reino Unido com supervisão de tutores humanos. Para a discussão em português sobre políticas de uso de IA na escola, vale a pena reler o balanço do primeiro ano de IA nas escolas estónias.

Deixe um comentário