|
Some checks are pending
CI / ruff (push) Waiting to run
CI / mypy (push) Waiting to run
CI / pytest (push) Waiting to run
CI / package (push) Waiting to run
CI / Install smoke (${{ matrix.label }}) (linux, ubuntu-latest) (push) Blocked by required conditions
CI / Install smoke (${{ matrix.label }}) (macos-arm64, macos-14) (push) Blocked by required conditions
|
||
|---|---|---|
| .. | ||
| _chunks.jsonl | ||
| _dynamic.jsonl | ||
| _index.npz | ||
| 01_faq_producto.md | ||
| 02_politicas_internas.md | ||
| README.md | ||
Base de Conocimiento - Knowledge Base (Scaffold de ejemplo)
Coloca aquí tus documentos en formato Markdown (.md) o Texto plano (.txt). Se prefieres pre-chunkizar, puedes usar archivos JSONL (una línea por chunk):
{"text": "Texto del chunk 1...", "source": "manual_usuario.pdf", "chunk_index": 0, "metadata": {"pagina": 12}}
{"text": "Texto del chunk 2...", "source": "manual_usuario.pdf", "chunk_index": 1, "metadata": {"pagina": 13}}
Primera ejecución
- Añade tus documentos a esta carpeta (subcarpetas permitidas).
- Arranca la pipeline con la flag
--rag_enabled. - Se generarán automáticamente:
_index.npz→ matriz embeddings (numpy, persistente)_chunks.jsonl→ lista chunks con metadata
Para reindexar después de añadir documentos nuevos: usa --rag_force_rebuild o borra manualmente _index.npz y _chunks.jsonl.