PDFs e e-mails viram porta de entrada para ataques de injeção de prompt contra IAs

PDFs, contratos, faturas e e-mails usados por sistemas de inteligência artificial podem carregar instruções ocultas capazes de interferir no comportamento de agentes de IA. Esse tipo de ameaça, conhecido como injeção indireta de prompt, amplia os riscos para empresas que utilizam modelos de linguagem e agentes com acesso a ferramentas, APIs e sistemas internos.

Ao contrário de ataques tradicionais, a técnica não depende necessariamente de malware nem exige interação direta do criminoso com o sistema de IA. As instruções podem ser inseridas em documentos ou páginas que posteriormente serão processados pelo modelo. Quando o conteúdo é lido pela IA, essas orientações podem ser interpretadas como parte das instruções legítimas da tarefa.

Um exemplo seria o uso de uma fatura aparentemente comum. Enquanto o usuário solicita à IA apenas um resumo do documento, o arquivo pode conter uma instrução invisível determinando que o agente procure informações em outro sistema, acione uma ferramenta ou envie determinados dados para um destino externo. O impacto potencial aumenta quando o agente possui permissões para executar ações de forma autônoma.

A ameaça explora uma diferença importante entre aquilo que uma pessoa vê na tela e o conteúdo efetivamente extraído pelo sistema de inteligência artificial. Um PDF pode aparentar normalidade durante a leitura convencional, mas conter textos invisíveis, camadas ocultas ou caracteres manipulados que serão interpretados pelo software responsável por processar o documento.

Entre as técnicas que podem ser utilizadas estão caracteres de largura zero, homóglifos, símbolos visualmente semelhantes a outros caracteres, mistura de alfabetos e controles bidirecionais de texto. Esses mecanismos podem dificultar a identificação das instruções maliciosas por usuários e por ferramentas de segurança baseadas apenas na análise visual do arquivo.

Dados do Relatório de Segurança em IA 2026 da Check Point apontam aumento nesse tipo de ameaça. Segundo a empresa, as detecções de cargas maliciosas mais extensas de prompt cresceram cerca de cinco vezes entre março e maio de 2026 e chegaram perto de 1% dos prompts analisados em maio.

O avanço dos chamados agentes de IA torna o problema mais sensível. Diferentemente de sistemas usados apenas para gerar textos ou responder perguntas, agentes podem receber permissões para consultar bancos de dados, acessar aplicações, executar comandos ou interagir com serviços externos. Nesse cenário, uma instrução escondida em um documento pode tentar alterar a sequência de ações definida originalmente pelo usuário.

Os mecanismos tradicionais de proteção de sistemas de inteligência artificial incluem inspeção dos prompts e das respostas, controle de acesso, monitoramento das ações realizadas pelos agentes e validação antes da execução de operações consideradas sensíveis. O problema é que, em muitos fluxos, o conteúdo dos documentos passa por etapas anteriores de extração, fragmentação e armazenamento antes de chegar ao modelo.

Isso significa que uma instrução maliciosa pode ser incorporada ao contexto utilizado pelo sistema antes mesmo de os mecanismos de proteção analisarem a solicitação final. A discussão sobre segurança de IA, portanto, passa a incluir também a inspeção dos arquivos utilizados como fonte de informação.

A Check Point desenvolveu um mecanismo chamado PromptGuardX para identificar esse tipo de conteúdo em arquivos PDF antes que o texto seja enviado a modelos de linguagem ou agentes de IA. A ferramenta foi integrada ao sistema Threat Emulation da empresa e procura localizar instruções que tentem alterar o comportamento dos modelos.

O processo inclui a extração e normalização do texto existente no documento, inclusive conteúdos escondidos por formatação, posicionamento ou pela própria estrutura do arquivo. Também são analisadas formas de ofuscação baseadas em Unicode.

Depois dessa etapa, o sistema procura elementos que possam indicar tentativas de simular instruções de sistema ou de desenvolvedor, redefinir funções atribuídas ao modelo, ordenar que instruções anteriores sejam ignoradas ou esconder determinadas ações dentro do documento.

A análise não depende apenas da presença de determinadas palavras. O conteúdo é dividido em partes sobrepostas para preservar o contexto entre diferentes trechos, enquanto um classificador busca diferenciar textos que apenas discutem comandos e segurança de IA daqueles que efetivamente tentam fornecer novas instruções ao sistema.

Quando um conteúdo é considerado suspeito, são indicados os trechos responsáveis pela classificação e uma pontuação associada à análise. A proposta é adicionar a detecção de injeção de prompt às verificações que já procuram malware, endereços maliciosos e comportamentos considerados suspeitos em documentos.

O surgimento desse tipo de ataque mostra que arquivos corporativos utilizados por ferramentas de inteligência artificial passam a exigir uma análise diferente daquela aplicada apenas à segurança tradicional. Mesmo sem código malicioso, um documento pode conter informações criadas especificamente para modificar o comportamento de um modelo ou de um agente, transformando o próprio conteúdo processado pela IA em uma possível superfície de ataque.