Estudo aponta falhas em chatbots ChatGPT e Gemini

Um estudo recente da organização Just Facts reacendeu o debate sobre a confiabilidade de chatbots de inteligência artificial como ChatGPT, Gemini, Grok e Claude. A pesquisa, que analisou respostas sobre temas políticos e sociais, encontrou taxas relevantes de erro, além de uma quantidade preocupante de fontes inválidas, inexistentes ou que simplesmente não sustentavam as respostas apresentadas.

O que o estudo avaliou

A análise colocou as versões pagas dos quatro assistentes para responder 100 perguntas sobre temas como imigração, aborto, clima, eleições, criminalidade, controle de armas e COVID-19. Segundo o levantamento, as questões foram elaboradas para testar se os modelos cairiam em falsas narrativas associadas tanto à esquerda quanto à direita política.

Além de responder, cada chatbot precisava citar fontes para justificar o que dizia. Foi justamente aí que o estudo encontrou outro problema importante: a qualidade das referências usadas pelos sistemas ficou muito abaixo do esperado.

Os resultados por chatbot

Entre os modelos testados, ChatGPT teve o melhor desempenho geral nas respostas ligadas a falsas alegações da direita, acertando 94% das questões desse grupo. Nas perguntas desenhadas para provocar erros associados à esquerda, a taxa caiu para 75%.

O Gemini registrou 91% de acerto nas questões ligadas à direita e 76% nas ligadas à esquerda. Já o Claude marcou 91% e 81%, respectivamente. O Grok seguiu uma direção oposta: acertou 73% nas perguntas associadas à direita e 84% nas que buscavam falsas alegações atribuídas à esquerda.

Segundo o estudo, apenas o ChatGPT apresentou diferença estatisticamente significativa entre os dois conjuntos de perguntas, dentro do nível de confiança de 95%.

Fontes fracas, links inexistentes e citações ruins

O ponto mais grave, de acordo com os pesquisadores, foi a sustentação das respostas. No total, os quatro chatbots citaram 419 fontes para 400 respostas, mas boa parte delas foi classificada como inválida. O levantamento aponta 104 páginas que nem sequer existiam e 77 referências que não tinham relação com o conteúdo que deveriam apoiar.

No consolidado, apenas 46% das fontes foram consideradas válidas. O ChatGPT teve o melhor índice entre os quatro, com 57%. Em seguida aparecem Gemini, com 49%, Claude, com 44%, e Grok, com 32%.

Jim Agresti, presidente da Just Facts, afirmou ao Fox News Digital que o achado mais surpreendente foi justamente a fragilidade das referências. Para ele, o problema não se limita a viés político, mas atinge a confiabilidade básica das respostas.

“Roughly half of the sources were illegitimate”, disse Agresti, ao comentar os resultados.

Erros em temas sensíveis e impacto no uso real

Em um dos exemplos citados, todas as ferramentas afirmaram que a taxa de crimes violentos nos Estados Unidos estava próxima de uma mínima histórica em 2023. O estudo, porém, menciona dados do Departamento de Justiça indicando alta de 37% entre 2020 e 2023.

Já em outro caso, os quatro chatbots rejeitaram a afirmação de Donald Trump de que o crime estaria pior do que nunca. O levantamento também encontrou respostas problemáticas sobre falas de JD Vance e sobre temas como igualdade salarial entre homens e mulheres.

Na direção oposta, os modelos acertaram ao dizer que a temperatura média da camada inferior da atmosfera terrestre subiu cerca de 1,1 grau Fahrenheit desde os anos 1980. Ainda assim, o estudo argumenta que esse tipo de acerto não elimina o risco de respostas equivocadas em assuntos politicamente carregados ou altamente sensíveis.

Para quem usa IAs

Agresti comparou os resultados a um desempenho escolar apenas mediano e disse que os chatbots não devem ser tratados como especialistas confiáveis. Ele também alertou para o efeito de “sycophancy”, tendência em que sistemas de IA validam o usuário e reforçam suas crenças, em vez de confrontá-las com mais rigor.

O pesquisador defende que a melhor postura ao usar essas ferramentas não é abandonar a tecnologia, mas checar tudo com cuidado. A recomendação é simples: confirmar se as fontes existem e se realmente dizem o que o chatbot afirmou.

As empresas responsáveis pelos modelos contestaram parte da leitura do estudo. Google, OpenAI e Anthropic disseram, em linhas gerais, que seus sistemas são desenvolvidos para buscar objetividade, passar por testes de viés e apresentar fontes quando possível. A xAI, responsável pelo Grok, não respondeu ao pedido de comentário citado na reportagem original.

O alerta, no fim das contas, é direto: mesmo com avanços rápidos, chatbots ainda podem errar bastante — e, em temas de política, saúde e interesse público, isso pode ter consequências reais. Para o usuário, a regra continua valendo: confiar menos, verificar mais.

Raphael

"Olá! Sou Raphael, criador do TecNerds.com.br, tenho mais de 8 anos de experiência em tecnologia. Meu blog é o espaço onde compartilho minha fascinação por inteligência artificial, gadgets, games, filmes, séries e tudo mais que envolve o universo geek. Seja bem-vindo(a) e embarque comigo nessa jornada tecnológica!"

Share
Published by
Raphael

Recent Posts

Crunchyroll confirma exibição de Dragon Ball Super: Beerus com estreia para outubro

A Crunchyroll oficializou a transmissão internacional de Dragon Ball Super: Beerus, com chegada programada para…

6 horas ago

Vingadores: Doutor Destino ganha sua primeira coleção de bonecos Funko Pop!

A Funko divulgou as primeiras imagens oficiais da linha de bonecos Pop! dedicada ao filme…

6 horas ago

HAVIT escolhe a Brasil Game Show para estrear globalmente novos periféricos

A fabricante HAVIT confirmou que utilizará a próxima edição da Brasil Game Show (BGS), em…

6 horas ago

Novo malware para Android usa IA generativa para burlar segurança e roubar dados bancários

Pesquisadores de segurança digital identificaram o RatHat, um sofisticado malware para Android que emprega inteligência…

17 horas ago

Como verificar se suas senhas no celular foram vazadas ou estão fracas

Smartphones modernos contam com ferramentas integradas capazes de examinar senhas salvas em busca de vulnerabilidades,…

17 horas ago

Empresa chinesa de IA investiga falhas que permitiram instruções para armas e ataques

A companhia de inteligência artificial Moonshot AI, sediada na China, abriu uma apuração interna depois…

17 horas ago