Skip to main content

Imagens na busca com IA: o novo trabalho das fotos no SEO

Imagens passaram a ter uma segunda audiência: os motores de resposta com IA. Segundo o Search Engine Land, um mecanismo de resposta consegue olhar para a sua foto, decompô-la em tokens matemáticos e interpretar o que vê, o que significa que a imagem precisa comunicar claramente não só para o humano, mas também para a máquina. O sinal mais recente dessa mudança é uma patente do Google protocolada em 2023 e publicada em abril de 2026, que descreve um fluxo de resposta em que a fonte citada é escolhida primeiro pela correspondência de imagem e só depois o texto ao redor entra para montar a resposta.

Da ilustração de catálogo ao token: a imagem ganhou uma segunda audiência

Há mais de um século, imagens ajudam pessoas a decidir o que comprar sem ver o produto pessoalmente, segundo o Search Engine Land. Em 1897, a Sears dizia aos compradores que as ilustrações do catálogo permitiriam fazer pedidos com inteligência, "tão bem quanto se você estivesse em nossa loja escolhendo os produtos no estoque" (tradução do original em inglês). Em 1916, essa estratégia visual já estava escalada para 50 milhões de catálogos por ano.

Décadas depois, o catálogo da Delia’s confirmou a mesma regra em outra escala. No auge, a marca fazia 55 milhões de remessas por ano, e o produtor de fotografia Jim Trzaska observou que as adolescentes usavam o próprio catálogo como ferramenta de venda para convencer os pais sobre a roupa mostrando uma foto, conforme relatado pelo Search Engine Land. As redes sociais depois escalaram o mesmo truque para um feed de estranhos.

Agora a audiência mudou. Um motor de resposta com IA examina a foto, quebra a imagem em tokens matemáticos e interpreta o que vê. Na prática, a imagem precisa deixar claro o que está no enquadramento, o que aquilo significa e se a página ao redor sustenta esse significado. O Search Engine Land resume o efeito: muda o trabalho do SEO de imagens, porque passa a ser necessário verificar se a máquina consegue ler a imagem e interpretar a mensagem que você quer enviar.

A busca visual já é mainstream: 20 bilhões de consultas no Lens por mês

Segundo dados do blog do Google de outubro de 2024 citados pelo Search Engine Land, os usuários fazem cerca de 20 bilhões de buscas visuais por mês pelo Google Lens. A barra de busca, portanto, é ao mesmo tempo uma caixa de texto e uma câmera.

No Pinterest, a busca visual responde por 30% de todas as buscas e converte 62% melhor do que a busca por texto, segundo os dados reunidos pelo Search Engine Land, porque a câmera encontra o objeto exato mais rápido do que as palavras conseguem descrever. Só o Pinterest Lens processa 1,5 bilhão de buscas visuais por mês.

Na China, o shopping camera-first do Alibaba superou 10 milhões de buscas visuais por dia ao longo de anos, ainda conforme o Search Engine Land. O caminho câmera-carrinho está construído, monetizado e incorporado ao cotidiano.

O Google tem uma patente protocolada em 2023 e publicada em abril de 2026 que descreve um fluxo de resposta no qual a fonte citada é escolhida primeiro pela correspondência de imagem e, em seguida, o texto ao redor é puxado para construir a resposta.

Andy Chadwick, que identificou a patente, destaca que se trata de um pedido de patente e não de um comportamento de produção confirmado. O Google registra milhares de pedidos desse tipo e muitos nunca chegam ao ar como descritos. Ainda assim, segundo Chadwick, é o sinal público mais claro até agora de que a imagem, e não o parágrafo, é o que puxa a sua página para dentro da resposta.

O que muda na prática na home e na página de produto

O Search Engine Land aponta que o produto passou a funcionar como a própria landing page. Um encanador, por exemplo, pode mostrar fotos de torneiras vazando no site ao lado do texto que explica qual é o problema e como o serviço pode ajudar.

Na homepage, a função tradicional das imagens é causar a primeira impressão e sustentar a identidade de marca, o que costuma ser feito com fotos originais e de alta qualidade. No contexto de GEO multimodal, a orientação é dar ao motor de resposta uma imagem original, e não de banco de imagens, que ele consiga casar com a consulta.

Nas páginas de produto, o uso tradicional de várias imagens em alta resolução e de ângulos diferentes serve a carrosséis, visões 360 e close-ups. Para a busca com IA, a recomendação do Search Engine Land é tornar a embalagem e o texto do produto legíveis por OCR, para que a IA leia os atributos corretos.

O deslocamento descrito pelo Search Engine Land é direto: a imagem deixou de ser apenas um recurso de conversão para o olho humano e passou a ser um ponto de entrada pelo qual a página pode ser recuperada e citada. Como a patente publicada em abril de 2026 ainda é um pedido, e não um comportamento confirmado, o que resta às marcas é trabalhar o que já está sob controle: imagens originais, atributos legíveis por máquina e uma página que confirme a história que a foto conta.

Estratégias de marketing baseadas em dados, toda semana

Cases reais, frameworks aplicáveis e análises do mercado brasileiro.