Infraestrutura de busca flexível
O pipeline de recuperação pode combinar corpus local e bases bibliográficas gratuitas sem depender de uma API paga de busca. Isso não significa que toda a plataforma opera sem serviços externos: inferência, embeddings ou recursos opcionais podem usar provedores configurados.
Fontes de recuperação
| Camada | Exemplos | Papel |
|---|---|---|
| Local | Corpus institucional, documentos e guidelines indexados | Primeira opção quando o conteúdo relevante está disponível. |
| Bibliográfica | PubMed, Europe PMC, OpenAlex e Lens | Pesquisa biomédica com consultas redigidas. |
| Web governada | SearXNG ou provedores habilitados | Fallback condicionado à política, ao tipo de consulta e ao orçamento. |
Separar busca de inferência
Uma busca gratuita pode alimentar um modelo remoto pago. Um modelo local pode consultar uma fonte externa. Por isso, custo e compartilhamento de dados precisam ser avaliados por etapa, não por um rótulo único de infraestrutura.
Documentos e RAG
Documentos podem passar por extração, chunking, indexação BM25 e indexação vetorial. A disponibilidade de OCR, Qdrant, modelos de embedding e re-ranking depende da configuração do ambiente.
Análise de implantação
Antes de um piloto, confirme:
- quais fontes estão ativas;
- quais componentes são locais ou remotos;
- quais dados cada provedor recebe;
- quais custos e limites se aplicam;
- como o sistema se comporta quando um provedor falha.