← Todos os textos

A pesquisa na internet piorou

Nesta página

O AI Overview da Google disse recentemente aos utilizadores que os astronautas conheceram gatos na Lua1. Sugeriu pôr cola na pizza para o queijo não escorregar2. Durante um período curto no início de 2025, afirmou que ainda estávamos em 20243. Não são casos isolados. São sintomas de um problema muito maior, que está a desmantelar os alicerces económicos da internet.

Enquanto as tecnológicas correm a enfiar resumos feitos por LLMs em todo o lado, os editores estão a perder tráfego e receitas a jorros. As contas são brutais, as alucinações preocupam e as receitas de publicidade, que deviam manter os editores à tona, estão a descer.

2 mil milhões de dólares perdidos, e a contar

Os números são assombrosos. Entre maio de 2024 e maio de 2025, os 500 editores mais visitados do mundo perderam mais de 600 milhões de visitas, passando de 2,3 mil milhões para 1,7 mil milhões4. São 64 milhões de visitas perdidas por mês em média, o que dá uma perda estimada de 2 mil milhões de dólares em receitas de publicidade5.

As quedas de tráfego são constantes e severas. A CNN perdeu 30%. A Business Insider e o HuffPost perderam 40% cada.4 Mas o caso mais dramático é o do The Planet D, um blogue de viagens que fechou depois de perder 90% do tráfego a seguir à chegada dos AI Overviews, embora a perda de tráfego provavelmente não tenha sido o único fator do encerramento6.

Isto não é um período de ajustamento temporário. É uma mudança estrutural. As pesquisas sem cliques subiram de 56% para 69% num só ano7. Quando a Google mostra um AI Overview, os utilizadores chegam aos sites dos editores 8% das vezes em vez de 15%, uma redução de 46,7% na taxa de cliques8.

A investigação da IAB Tech Lab di-lo sem rodeios: os editores sofrem uma “20-60% traffic reduction (up to 90% for niche sites).”5 Para a maioria dos editores, é a diferença entre ser sustentável e ser insolvente.

A publicidade não repõe o que os LLMs levam

É aqui que a economia fica verdadeiramente perversa. Digamos que o ChatGPT avança com os planos de publicidade. Segundo a análise da Incrmntal, “ChatGPT could increase revenues by 16.5x to 24.8x, potentially reaching $26 billion annually”, se adotar um modelo financiado por anúncios comparável ao da Meta ou da Google9.

Parece brilhante, até percebermos que os criadores do conteúdo original não recebem rigorosamente nada.

As contas dos crawlers contam a história. A análise da Cloudflare mostra que o rácio entre rastreios e visitas encaminhadas da Anthropic é de 50 000:1. Por cada vez que o Claude envia tráfego a um editor, o ClaudeBot já o rastreou 50 000 vezes. A OpenAI está melhor, com 887:1, e a Perplexity consegue 118:1, mas continuam a ser relações extrativas disfarçadas de simbióticas10.

E piora. O tráfego de treino representa 80% do rastreio dos bots de IA.10 Estes bots nem fingem devolver tráfego. Limitam-se a aspirar conteúdo para construir modelos que vão reduzir ainda mais a necessidade de os utilizadores visitarem as fontes originais.

Mesmo que o ChatGPT chegue aos 26 mil milhões de dólares de receitas, os editores continuam com o mesmo problema: o conteúdo deles gera receitas noutro sítio, enquanto o tráfego próprio, e por isso a publicidade própria, continua a colapsar. O ARPU atual do ChatGPT é de 0,67 dólares, contra 5,12 da Google e 3,38 da Meta. Sam Altman admitiu abertamente que “OpenAI is losing money on the $200-per-month subscription tier.”9

O modelo de negócio de base é a extração, não a parceria.

Nem sequer recebes informação certa

A ironia é que, enquanto os LLMs destroem a receita dos editores, nem sequer dão informação rigorosa em troca.

Os melhores modelos de 2025 (o Gemini-2.0-Flash da Google, o GPT-4o, o Claude 3.5) têm taxas de alucinação entre 0,7% e 2% em testes controlados11. Parece aceitável, até os pores a funcionar à escala de milhares de milhões de pesquisas.

E estes são os bons modelos. O Falcon-7B-Instruct regista uma taxa de alucinação de 29,9%, quase uma resposta em cada três está errada com toda a confiança. O desempenho por domínio varia muito: a informação jurídica tem uma taxa de alucinação de 6,4%, enquanto o conhecimento geral fica nos 0,8%11.

A investigação do SEI sobre a precisão dos resumos feitos por LLMs diz que “Accuracy generally measures how closely hallucinations output by the LLM” se aproximam do material de origem, e que a diferença é muitas vezes significativa12.

Os AI Overviews da Google tornaram-se um caso de estudo de erro com confiança. Além dos gatos na Lua e da cola na pizza, estes resumos aparecem em 69% das pesquisas e são, muitas vezes, a única informação que o utilizador vê. Quando erras 1 a 2% das vezes em milhares de milhões de consultas, estás a poluir o ecossistema da informação de forma sistemática.

A BBC já aprendeu isto à sua custa, quando os resumos de notificações gerados por LLMs começaram a produzir disparates. 77% das empresas dizem-se preocupadas com as alucinações da IA, segundo inquéritos recentes, e têm razão para isso11.

Estamos numa situação bizarra: factos e alucinações misturados num formato com ar de autoridade, servidos a utilizadores sem maneira de os distinguir, enquanto os verificadores de factos e os jornalistas originais perdem as receitas de que precisam para produzir conteúdo rigoroso.

Criar conteúdo está a deixar de compensar

Isto cria um círculo vicioso. Editores que perdem 25 a 40% do tráfego4 não conseguem manter o mesmo nível de investimento em jornalismo de qualidade. Menos receita quer dizer verificação de factos menos rigorosa, menos repórteres especializados, mais conteúdo barato.

Esse conteúdo mais barato passa a ser os dados de treino da próxima geração de LLMs, que produzem ainda mais alucinações, que reduzem ainda mais a necessidade de visitar os sites dos editores, que reduz ainda mais as receitas. É uma espiral de morte para a informação de qualidade.

As contas são implacáveis. 64 milhões de visitas perdidas por mês, multiplicadas pela receita média de publicidade por visita, significam milhões de receitas que os editores não conseguem substituir. Quando a Condé Nast, o The New York Times, a Gannett e o Reddit apoiam a nova iniciativa da Cloudflare de controlo de crawlers, é porque veem onde isto acaba13.

Os pequenos editores já estão a fechar. Os médios estão a cortar pessoal. Os grandes tentam desesperadamente negociar acordos de treino de IA só para recuperar uma fração do que perdem em tráfego. Nada disto é sustentável.

A IAB Tech Lab observou um aumento de 117% no tráfego de bots, que sobrecarrega a infraestrutura dos editores sem dar nada em troca5. Os editores pagam largura de banda e servidores para alimentar bots que minam diretamente o seu modelo de negócio.

A solução que se propõe

A intervenção da Cloudflare é um começo. O sistema Pay Per Crawl, que bloqueou os crawlers de IA por defeito a partir de 1 de julho de 2025, já atraiu mais de um milhão de clientes. O CEO Matthew Prince foi direto: “If the Internet is going to survive the age of AI, we need to give publishers the control they deserve.”13

Roger Lynch, da Condé Nast, acrescentou que a “permission-based approach makes way for new business model.”13 É isto que faz falta: permissão a sério, compensação a sério, sustentabilidade a sério.

O quadro da IAB Tech Lab propõe várias soluções: preços por rastreio, monetização por API de consulta e integração com o Model Context Protocol. São pontos de partida sensatos, mas exigem que as empresas de IA participem de boa-fé.

Neste momento, os incentivos estão todos errados. As empresas de IA podem extrair conteúdo à vontade, treinar modelos com o conteúdo dos editores, servir resumos que impedem os utilizadores de clicar e depois talvez, talvez, partilhar uma fração minúscula das receitas de publicidade, que nem de perto repõe o que os editores perderam.

Não é diferente de copiar o conteúdo de obras literárias ou a transcrição de um filme. Ainda assim, a posição da Cloudflare nisto também pode ser vista como um esforço para proteger os interesses do próprio negócio.

Mais desconforto

O modelo de negócio da internet nunca foi perfeito. Os banners e a manipulação de SEO criaram os seus próprios problemas. Mas, pelo menos, havia uma troca de valor que funcionava: os editores criavam conteúdo, os utilizadores visitavam os sites, os anunciantes pagavam pela atenção e o ciclo continuava.

Os LLMs quebraram esse ciclo. Extraem conteúdo em massa (lembra-te do rácio de 50 000:1), sintetizam-no em resumos de rigor variável e servem esses resumos no lugar das fontes originais. Os criadores originais recebem uma redução de 46,7% no tráfego e uma sugestão educada para agradecerem as migalhas que sobram.

Isto não é sustentável. Não podes destruir o modelo de receitas que financia o jornalismo de qualidade e esperar que o jornalismo de qualidade continue a existir. Não podes treinar modelos com conteúdo dos editores e, ao mesmo tempo, eliminar o modelo de negócio que paga a criação desse conteúdo.

Olha para o The Sun ou para o Daily Mail, outrora gigantes do jornalismo britânico, hoje sombras do que foram… mas provavelmente não por causa da IA.

Ou as empresas de IA passam a compensar os editores pelos dados de treino e pela atribuição, ou acabamos com uma internet onde só se cria o conteúdo que sobrevive sem tráfego e sem receitas. É uma corrida para o fundo que acaba com LLMs treinados em conteúdo cada vez pior, a produzir resultados cada vez menos fiáveis, para servir utilizadores que já não conseguem encontrar informação rigorosa em lado nenhum.

As 600 milhões de visitas perdidas não voltam. A questão é se vamos construir um sistema que compense quem cria o conteúdo, ou se vamos ver o ecossistema inteiro colapsar enquanto as empresas de IA celebram o crescimento das receitas de publicidade.

Sei em que resultado apostaria, e não é o otimista.

References

Footnotes

  1. WION News, Google’s AI search under fire for falsely claiming Obama is Muslim, astronauts played with cats on Moon, May 2024 ↩

  2. NBC News, Glue on pizza? Google’s AI faces social media mockery, May 2024 ↩

  3. TechCrunch, Google fixes bug that led AI Overviews to say it’s now 2024, May 2025 ↩

  4. Infactory, The Numbers Don’t Lie: Publishers Are Losing 25% of Their Traffic to AI Platforms, 2025 ↩ ↩2 ↩3

  5. IAB Tech Lab, LLM Framework, 2025 ↩ ↩2 ↩3

  6. IAB Tech Lab, Dude, AI ate my traffic, 2025 ↩

  7. StanVentures, Similarweb: Zero-Click Searches Surge to 69% Since Google AI Overviews Launched, 2025 ↩

  8. Pew Research Center, Google users are less likely to click on links when an AI summary appears in the results, July 2025 ↩

  9. Incrmntal, LLM Advertising, 2025 ↩ ↩2

  10. Cloudflare, AI crawler traffic by purpose and industry, 2025 ↩ ↩2

  11. Multiple sources including web search data on LLM hallucination rates, 2025 ↩ ↩2 ↩3

  12. Carnegie Mellon University Software Engineering Institute, Evaluating LLMs for Text Summarisation: Introduction, 2025 ↩

  13. Cloudflare, Cloudflare just changed how AI crawlers scrape the internet at large, 2025 ↩ ↩2 ↩3