A production-style AI system for uploading documents, extracting text, and performing semantic search and question answering using Retrieval-Augmented Generation (RAG).
- π Multi-format document support (PDF, DOCX, TXT, Images)
- π Text extraction (OCR + parser-based)
- π§ Semantic search using FAISS + Sentence Transformers
- π¬ Question answering over documents (RAG-based)
- π§© Chunking + embedding pipeline
- π§ AI fallback summarization (works without API key)
- β‘ FastAPI backend (production-ready structure)
It supports:
π Multi-format document ingestion (PDF, DOCX, TXT, images via OCR) π§ RAG-based semantic search using vector embeddings π¬ Chat-with-document interface (Ask questions directly on uploaded files) π Intelligent text chunking and retrieval system π Automatic document insights (keywords, summaries, complexity analysis) β‘ Hybrid AI pipeline (OpenAI + fallback local logic) π§± Modular architecture designed for scalability and production deployment
The system is designed as a foundation for enterprise-level document AI systems, combining information retrieval and generative AI.
Upload File β Text Extraction β Chunking β Embedding (SentenceTransformer) β Vector Store (FAISS) β Semantic Search β Answer Generation (RAG)