Elasticsearch: Recuperar o documento com o conteúdo do anexo

Esta documentação faz parte do guia Plugin de Ingestão de Anexos. Consulte o guia completo aqui: Como extrair dados de ficheiros PPT, XLS e PDF para Elasticsearch.

👋 Bem-vindo à documentação da Stackhero

A Stackhero disponibiliza um serviço Elasticsearch cloud totalmente gerido, concebido para profissionais que necessitam de pesquisa, análise e registo fiáveis em grande escala.

  • Desempenho consistente e segurança reforçada com uma infraestrutura privada e dedicada.
  • Configuração simples de um domínio personalizado protegido por HTTPS.

Comece rapidamente e foque-se no seu trabalho: pode ter um ambiente de Elasticsearch cloud hosting pronto para produção em cerca de 5 minutos, com a manutenção e segurança rotineiras asseguradas por si.

Para visualizar o documento processado, recupere-o usando o seu ID:

GET my_index/_doc/my_id

A resposta deverá ser semelhante ao seguinte:

{
  "_index" : "my_index",
  "_type" : "_doc",
  "_id" : "my_id",
  "_version" : 1,
  "found" : true,
  "_source" : {
    "data" : "e1xydGYxXGFuc2kKVGhpcyBpcyB0aGUgY29udGVudCBvZiBhIFJURiBmaWxlClxwYXIgfQ==",
    "attachment" : {
      "content_type" : "application/rtf",
      "language" : "en",
      "content" : "This is the content of a RTF file",
      "content_length" : 35
    }
  }
}

Note que o campo _source agora inclui tanto os dados originais em Base64 como os detalhes do anexo extraído, como o tipo de ficheiro e o conteúdo.