Agente de soporte con retrieval-augmented
Un agente LLM que redacta respuestas a partir de los documentos internos de la empresa y entrega a un humano cuando no está seguro.
- Rol
- Ingeniero de sistemas de IA (demo)
- Cronograma
- Prototipo de 6 semanas (demo)
- Stack
- TypeScript · Next.js · Postgres + pgvector · Drizzle · Pesos abiertos / Ollama · Linux

Estudio de caso demo — cifras ilustrativas; cliente omitido.
Qué estaba roto
Un equipo logístico de 40 personas pasaba horas cada día respondiendo las mismas preguntas operativas en Slack y correo. El conocimiento vivía en PDFs y wikis dispersos.
Cómo se resolvió
Fragmenté e incrusté la documentación en un almacén Postgres + pgvector, y luego conecté un agente que recupera los pasajes relevantes, redacta una respuesta con citas y escala a un humano cuando la confianza es baja. Añadí un arnés de evaluación ligero para poder calificar las respuestas antes de enviar cambios a producción.
Restricciones
- Mantener los documentos operativos privados dentro de un despliegue de código abierto primero.
- Mostrar los pasajes de soporte y escalar en lugar de inventar una respuesta.
- Medir los cambios de retrieval antes de exponerlos al equipo de soporte.
Herramientas del sistema
- TypeScript
- Next.js
- Postgres + pgvector
- Drizzle
- Pesos abiertos / Ollama
- Linux
Qué cambió
Redujo materialmente el tiempo de redacción de la primera respuesta y le dio al equipo un bucle de feedback para mejorar la cobertura semana a semana. (Cifras ilustrativas — estudio de caso demo.)
Lo que se queda
- 01Los umbrales de confianza importan más que una interfaz de chat pulida: las respuestas inciertas deben detenerse y entregar.
- 02La calidad del retrieval mejora más rápido cuando las preguntas fallidas se convierten en casos de evaluación, no en feedback anecdótico.
- 03Las citas son parte del contrato de producto: cada afirmación redactada necesita una fuente que el operador pueda inspeccionar.
Estudios de caso relacionados
Todo el trabajo- IA y Agentes · 2026Plataforma de inferencia GPU autoalojada — MoE de 36B, voz IA y un farm de 70 GPUsUn stack de IA completamente autoalojado: un modelo MoE de 36B servido de forma concurrente con embeddings, ASR y TTS en una sola GPU de 24 GB — escalado después a un farm de 70 GPUs en 10 nodos que un estado de reloj VBIOS defectuoso casi tumba.
- IA y Agentes · 2026Analizador OCR de documentos — captura de boletas de básculaUn sistema con visión-LLM que lee ~50 boletas de báscula al día enviadas por WhatsApp y sustituye la captura manual por extracción validada y exportación en un clic.