Documentos
O módulo de Documentos permite gerenciar documentos clínicos com upload, indexação e busca.
O que faz
- Upload: PDFs, imagens, documentos Office
- Indexação: extração de texto e metadados automaticamente
- Busca: busca híbrida (BM25 + vetorial) no corpus de documentos
- Organização: documentos associados a pacientes e grupos
Como funciona
1. Upload
- Arraste e solte ou selecione arquivos
- Formatos suportados: PDF, imagens (JPG, PNG), Office (DOCX, XLSX)
- Processamento automático com OCR para documentos escaneados
2. Indexação
Os documentos são processados pelo pipeline de ingestão:
- PaddleOCR 3.x: OCR com detecção de layout (padrão para PDFs escaneados e imagens)
- pdfplumber: extração estruturada com bounding boxes (PDFs born-digital)
- pypdf: último recurso para texto simples
3. Busca
- Busca por palavras-chave (BM25)
- Busca semântica (vetorial)
- Filtros por paciente, grupo, data, tipo de documento
Integração com RAG
Documentos indexados fazem parte do corpus de evidências usado pelo Clinical Research Agent. Quando o agente pesquisa evidências, ele busca tanto em fontes externas (PubMed, etc.) quanto no corpus local de documentos.
Privacidade
- Documentos são escopados por tenant (isolamento via RLS)
- PHI scanning antes de indexação
- Hash de identificadores em logs de acesso