DataDolphinV2/README.md at main · CSerratoDev/DataDolphinV2 · GitHub
https://github.com/CSerratoDev/DataDolphinV2/blob/main/README.md • 289 KB fetched Open original page
DataDolphinV2/README.md at main · CSerratoDev/DataDolphinV2 · GitHub
Skip to content
Navigation Menu
Sign in Appearance settings
* Platform
* AI CODE CREATION
* GitHub Copilot Write better code with AI
* GitHub Copilot app Direct agents from issue to merge
* MCP Registry Integrate external tools
* DEVELOPER WORKFLOWS
* Actions Automate any workflow
* Codespaces Instant dev environments
* Issues Plan and track work
* Code Review Manage code changes
* Code Quality Enforce quality at merge
* APPLICATION SECURITY
* GitHub Advanced Security Find and fix vulnerabilities
* Code security Secure your code as you build
* Secret protection Stop leaks before they start
* EXPLORE
* Why GitHub
* Documentation
* Blog
* Changelog
* Marketplace
View all features
* Solutions
* BY COMPANY SIZE
* Enterprises
* Small and medium teams
* Startups
* Nonprofits
* BY USE CASE
* App Modernization
* DevSecOps
* DevOps
* CI/CD
* View all use cases
* BY INDUSTRY
* Healthcare
* Financial services
* Manufacturing
* Government
* View all industries
View all solutions
* Resources
* EXPLORE BY TOPIC
* AI
* Software Development
* DevOps
* Security
* View all topics
* EXPLORE BY TYPE
* Customer stories
* Events & webinars
* Ebooks & reports
* Business insights
* GitHub Skills
* SUPPORT & SERVICES
* Documentation
* Customer support
* Community forum
* Trust center
* Partners
View all resources
* Open Source
* COMMUNITY
* GitHub Sponsors Fund open source developers
* PROGRAMS
* Security Lab
* Maintainer Community
* GitHub Stars
* Archive Program
* REPOSITORIES
* Topics
* Trending
* Collections
* Enterprise
* ENTERPRISE SOLUTIONS
* Enterprise platform AI-powered developer platform
* AVAILABLE ADD-ONS
* GitHub Advanced Security Enterprise-grade security features
* Copilot for Business Enterprise-grade AI features
* Premium Support Enterprise-grade 24/7 support
* Pricing
Search /
Sign in
Sign up Appearance settings
You signed in with another tab or window. Reload to refresh your session.
You signed out in another tab or window. Reload to refresh your session.
You switched accounts on another tab or window. Reload to refresh your session.
Dismiss alert
CSerratoDev
/
DataDolphinV2
Public
*
Notifications
You must be signed in to change notification settings
*
Fork
0
*
Star
0
*
Code
*
Issues
0
*
Pull requests
0
*
Actions
*
Projects
*
Security and quality
0
*
Insights
Additional navigation options
*
Code
*
Issues
*
Pull requests
*
Actions
*
Projects
*
Security and quality
*
Insights
Files Expand file tree
main
Breadcrumbs
* DataDolphinV2
/ README.md
Copy path
Blame
More file actions
Blame
More file actions
Latest commit
History
History
History
151 lines (86 loc) · 7.15 KB
main
Breadcrumbs
* DataDolphinV2
/ README.md
Copy path
Top
File metadata and controls
* Preview
* Code
* Blame
151 lines (86 loc) · 7.15 KB
Raw
Copy raw file
Download raw file
Outline Edit and raw actions
Badges
Authors
* @cserratodev
Document Augmentation Engine.
This project is an advanced document orchestration system designed to transform physical or digital administrative processes into highly efficient paperless workflows. The agent leverages multimodal AI to reverse-engineer $n$ -page documents, identifying missing fields and automating the data injection process.
Data Classification & Taxonomy
The core of the system is a Data Taxonomy that classifies variables into over 100 distinct types, covering the following domains:
*
Fiscal & Financial.
*
Governmental & Legal.
*
Corporate & Labor.
*
University & Academic.
*
International & Logistics.
Agent Operation
The agent operates based on configuration files (agent.yaml) and skill definitions (SKILL.md):
*
Capability Loading:
Upon startup, it verifies installed libraries (e.g., PyMuPDF). If a critical dependency for coordinate handling is missing, the system throws a preemptive error.
*
Cross-Referencing:
In the inspeccion_clausulas node, the agent explicitly references Section 1 of SKILL.md to use the 100 data types as semantic classification labels.
*
Asynchronous State:
It utilizes require_human_approval_for_injection within LangGraph to create breakpoints. The process pauses until the administrator validates or completes the captured data.
Motor de Ingesta y Aumento de Documentos
Este proyecto es un sistema avanzado de orquestación de documentos diseñado para transformar procesos administrativos físicos o digitales en flujos paperless altamente eficientes. El agente utiliza IA multimodal para realizar ingeniería inversa de documentos de n páginas, identificando campos faltantes y automatizando su llenado.
Clasificación y Taxonomía de Datos
El núcleo del sistema es una Taxonomía de Datos que clasifica variables en más de 100 tipos distintos, abarcando dominios:
*
Fiscal y Financiero.
*
Gubernamental y Legal.
*
Empresarial y Laboral.
*
Universitario y Académico.
*
Internacional y Logística.
Operación del Agente
El agente opera basándose en archivos de configuración (agent.yaml) y habilidades (SKILL.md):
*
Carga de Capacidades:
Al iniciar, verifica las librerías instaladas (ej. PyMuPDF). Si falta alguna dependencia crítica para el manejo de coordenadas, el sistema emite un error preventivo.
*
Referencia Cruzada:
En el nodo inspeccion_clausulas, el agente consulta la Sección 1 de SKILL.md para usar los 100 tipos de datos como etiquetas de clasificación semántica.
*
Estado Asíncrono:
Utiliza require_human_approval_for_injection en LangGraph para crear puntos de interrupción (breakpoints). El proceso se pausa hasta que el administrador valida o completa los datos capturados.
Libraries
PyMuPDF (import fitz)
The "Scalpel and Eyes" of the agent. It is the fastest library for PDF manipulation, reading geometry, and finding exact $(x, y)$ coordinates of underscores (_______) to stamp text.
El "Escalpelos y Ojos" del agente. Es la librería más rápida para manipular PDFs, leer su geometría y encontrar coordenadas exactas $(x, y)$ de líneas de puntos (_______) para estampar texto.
Motor / PyMongo
The "Nervous System and Memory." An asynchronous driver for MongoDB that stores document "Templates" and mapping for the 100 data types to avoid re-analyzing documents.
El "Sistema Nervioso y Memoria". Driver asíncrono para MongoDB que guarda los "Templates" y mapas de los 100 tipos de datos para evitar re-analizar documentos.
LangChain / LangGraph
The "Brain and Orchestrator." Manages the workflow with state memory and cycles, allowing asynchronous pauses for human intervention.
El "Cerebro y Orquestador". Maneja el flujo con memoria de estado y ciclos, permitiendo pausas asíncronas para la intervención humana.
Google Generative AI (Gemini)
Provides native visual reasoning for PDFs, structured JSON extraction, and dynamic generation of data capture forms.
Proporciona razonamiento visual nativo para PDFs, extracción estructurada en JSON y generación dinámica de formularios de captura.
Vision Models for Document Processing / Modelos de Visión para Procesamiento de Documentos
DataDolphin V2 leverages multimodal AI models through OpenRouter API for advanced document recognition and data extraction. The system automatically cycles through the following models in order of availability:
DataDolphin V2 aprovecha modelos de IA multimodal a través de la API de OpenRouter para reconocimiento avanzado de documentos y extracción de datos. El sistema cicla automáticamente a través de los siguientes modelos en orden de disponibilidad:
Provider / Proveedor
Model / Modelo
Capability / Capacidad
Anthropic
Claude 3.5 Sonnet
🥇 Premier vision model for document understanding / Modelo de visión Premier para comprensión de documentos
OpenAI
GPT-4o Mini
Fast & accurate document extraction / Extracción de documentos rápida y precisa
Google
Gemini 2.0 Flash
High-speed multimodal reasoning / Razonamiento multimodal de alta velocidad
XAI
Grok 2 Vision
Real-time visual analysis / Análisis visual en tiempo real
Nvidia
Nemotron Nano 12B
Lightweight & efficient fallback / Fallback ligero y eficiente
Fallback Strategy / Estrategia de Fallback:
If a model is unavailable or saturated, the system automatically attempts the next model in the list. This ensures 99%+ uptime for document processing.
Si un modelo no está disponible o está saturado, el sistema intenta automáticamente el siguiente modelo en la lista. Esto garantiza 99%+ de disponibilidad para el procesamiento de documentos.
Tech Stack & Dependencias / Dependencies
Library / Librería
Purpose / Propósito
Role / Rol
PyMuPDF fitz
Visión de Documento
Coordenadas e inyección de texto / Coords & text injection.
Motor / PyMongo
Persistencia Async
Gestión de MongoDB Atlas / MongoDB Atlas management.
LangGraph
Orquestación
Ciclos y estados asíncronos / Async states and cycles.
Google GenAI
IA Multimodal
Clasificación con Gemini 1.5 / Classification w/ Gemini 1.5.
LangChain Google
Interface LLM
Integración de modelo / Model integration.
OpenRouter API
Multimodal Vision
Claude, GPT-4o, Gemini, Grok, Nemotron / Document AI
Python Dotenv
Seguridad
Variables de entorno / Environment variables.
Instalación / Installation
Install dependencies
pip install pymupdf motor pymongo langchain-google-genai langgraph google-generativeai python-dotenv
or
pip install -r requirements.txt
Footer
(c) 2026 GitHub, Inc.
Footer navigation
*
Terms
*
Privacy
*
Security
*
Status
*
Community
*
Docs
*
Contact
*
Manage cookies
*
Do not share my personal information
You can’t perform that action at this time.
Links found on this page
- Skip to content [direct]
- Sign in [direct]
- GitHub Copilot Write better code with AI [direct]
- GitHub Copilot app Direct agents from issue to merge [direct]
- MCP Registry Integrate external tools [direct]
- Actions Automate any workflow [direct]
- Codespaces Instant dev environments [direct]
- Issues Plan and track work [direct]
- Code Review Manage code changes [direct]
- Code Quality Enforce quality at merge [direct]
- GitHub Advanced Security Find and fix vulnerabilities [direct]
- Code security Secure your code as you build [direct]
- Secret protection Stop leaks before they start [direct]
- Why GitHub [direct]
- Documentation [direct]
- Blog [direct]
- Changelog [direct]
- Marketplace [direct]
- View all features [direct]
- Enterprises [direct]
- Small and medium teams [direct]
- Startups [direct]
- Nonprofits [direct]
- App Modernization [direct]
- DevSecOps [direct]
- DevOps [direct]
- CI/CD [direct]
- View all use cases [direct]
- Healthcare [direct]
- Financial services [direct]
- Manufacturing [direct]
- Government [direct]
- View all industries [direct]
- View all solutions [direct]
- AI [direct]
- Software Development [direct]
- DevOps [direct]
- Security [direct]
- View all topics [direct]
- Customer stories [direct]
- Events & webinars [direct]
- Ebooks & reports [direct]
- Business insights [direct]
- GitHub Skills [direct]
- Customer support [direct]
- Community forum [direct]
- Trust center [direct]
- Partners [direct]
- View all resources [direct]
- GitHub Sponsors Fund open source developers [direct]
- Security Lab [direct]
- Maintainer Community [direct]
- GitHub Stars [direct]
- Archive Program [direct]
- Topics [direct]
- Trending [direct]
- Collections [direct]
- Copilot for Business Enterprise-grade AI features [direct]
- Premium Support Enterprise-grade 24/7 support [direct]
- Pricing [direct]
- Sign up [direct]
- CSerratoDev [direct]
- DataDolphinV2 [direct]
- Notifications [direct]
- Issues
0 [direct]
- Pull requests
0 [direct]
- Actions [direct]
- Projects [direct]
- Security and quality
0 [direct]
- Insights [direct]
- DataDolphinV2 [direct]
- History [direct]
- Raw [direct]
- Terms [direct]
- Privacy [direct]
- Security [direct]
- Status [direct]
- Community [direct]
- Contact [direct]
|
|