Notas de construcción · Arquitectura de IA y Marco de Madurez
Madurez de IA Pragmática en Klaros: Marco Situacional de Agentes para WhatsApp CRM
El debate reciente sobre la arquitectura de agentes de IA —destacado en eventos como el YC Harness Club— se centra en enjambres multiagente autónomos y arneses de optimización continua (DSPy). Aunque estos marcos son efectivos para benchmarks de código, aplicar enjambres sin restricciones a la mensajería comercial de WhatsApp CRM es un antipatrón peligroso.
La versión corta
- Reglas Primero: Klaros evalúa los mensajes mediante un árbol de 8 niveles de prioridad en
agent-decision.mjs. La actividad del personal humano activa una pausa de IA de 24 horas. - Caché de Cero Tokens: En
learned-answer.mjs, las respuestas verificadas se envían mediante similitud de Jaccard en la Etapa 8000 antes del modelo LLM en la Etapa 9000, garantizando costo $0 y latencia <10ms. - Resiliencia de Modelos Locales:
json-repair.mjsnormalizes bloques de código, comas finales y saltos de línea no escapados en modelos locales (Ollama/Qwen) en <0.5ms antes de validar el JSON.
1. El Paradigma del Arnés: Realidad Comercial en WhatsApp vs. Enjambres
En el YC Harness Club, los investigadores demostraron cómo la estructura alrededor del modelo (memoria, herramientas REPL, coordinación) aumenta el rendimiento en ARC-AGI del 30% al 95-100%. Sin embargo, la mensajería comercial de WhatsApp en Klaros opera bajo restricciones strictly del mundo real:
- Límites de la Ventana de Servicio de WhatsApp: Meta exige mensajes de plantilla pagados fuera de la ventana de 24 horas. Los mensajes fallidos o malformados provocan bloqueos de spam en los números del comercio.
- Compromisos Comerciales Irreversibles: Cotizar un precio incorrecto o prometer funciones no disponibles daña permanentemente la confianza del cliente.
- Presupuesto de Latencia Menor a 2 Segundos: Los usuarios en WhatsApp esperan respuestas rápidas. Los bucles de pensamiento multiagente que tardan 40 segundos destruyen la experiencia del usuario y queman margen.
2. El Marco de Madurez Situacional de IA de 5 Niveles en Klaros
Klaros evalúa cada capacidad de IA según una escala de madurez situacional. Adoptamos complejidad de agentes solo cuando el negocio lo exige Y las salvaguardas fail-closed están implementadas:
- Nivel 0 (Implementado): Árbol de decisión de prioridad fail-closed (pausa de 24h al detectar personal humano).
- Nivel 1 (Implementado): Caché de respuestas con cero tokens basado en Jaccard (Etapa 8000 = $0).
- Nivel 2 (Implementado): RAG delimitado por hechos y motor de reparación de JSON antes de validación.
- Nivel 3 (Q4 2026): Ejecución de objetivos multiturno delimitados (recolector de datos en 3 turnos para reservas 24/7).
- Nivel 4 (H1 2027): Arreglo autorregulable en bucle cerrado (de la cola de revisión a la optimización de prompts).
- Nivel 5 (2027+): Enjambres multiagente y RLMs (restringidos a tareas administrativas complejas de ERP).
Prueba el motor de IA de Klaros en vivo en WhatsApp
¿Quieres experimentar el caché de cero tokens y respuestas en tiempo real sin alucinaciones?
3. Capacidades Implementadas: Árboles de Prioridad, Caché $0 y Reparación JSON
En agent-decision.mjs, la Prioridad 1 evalúa detectOfflineConversation(). Si un agente humano interactuó en las últimas 8 horas, la automatización de IA se detiene durante 24 horas.
Calcula el ahorro exacto en tu factura utilizando nuestra Calculadora de Ahorro de Costos en WhatsApp.
Código: Motor de reparación en src/shared/json-repair.mjs
export function repairJsonString(raw) {
if (typeof raw !== 'string') return '';
let str = raw.trim();
str = str.replace(/^```(?:json)?\s*/i, '').replace(/\s*```$/i, '').trim();
const start = str.indexOf('{'), end = str.lastIndexOf('}');
if (start !== -1 && end > start) str = str.slice(start, end + 1);
str = str.replace(/,\s*([\}])\}/g, '$1');
return str;
}
4. Próximas Capacidades: Objetivos Multiturno y Optimización en Bucle Cerrado
Klaros implementará el recolector de datos multiturno de Nivel 3 (Q4 2026) para evitar la pérdida de clientes fuera de horario, seguido de la optimización en bucle cerrado de Nivel 4 (H1 2027) para ajustar los prompts a partir de correcciones humanas.
5. Comparación de Klaros con los Proyectos del YC Harness Club
Comparación de Klaros con proyectos del YC Harness Club:
- Prime Agent / RLM (Seth Karten): ~10% de Sincronización. Evitado en chat directo para mantener la latencia <2s.
- OpenJarvis (Jon Saad-Falcon): ~80% de Sincronización. Klaros Desktop ejecuta Ollama/Qwen localmente;
json-repair.mjscorrige errores de modelos pequeños. - QM @ YC (Josh France & Regan Bell): ~85% de Sincronización. El estado reside en D1/Durable Objects; el árbol de decisión cede el turno al personal humano.
6. Mapa de Arquitectura del Código de Klaros
Archivos clave en la arquitectura de IA de Klaros:
agent-decision.mjs— Árbol de prioridad de 8 niveles y pausado por interacción humana.uni-cloud/src/services/inbound/learned-answer.mjs— Caché de Jaccard con cero tokens en la Etapa 8000.uni-cloud/src/services/ai-auto-reply.mjs— Verificación obligatoria de citas de hechos.src/shared/json-repair.mjs— Normalización de JSON de LLMs locales en <0.5ms.
Recibe la próxima nota de desarrollo en WhatsApp
Envía NOTAS a nuestra línea para recibir la nota de ingeniería directamente en tu conversación.
Enviar NOTAS por WhatsAppExperimenta el motor de IA de Klaros en vivo
Envía precios o ai-demo a nuestra línea para probar el catálogo interactivo y respuestas en tiempo real.
WhatsApp: +91 97893 77634 · Consentimiento limpio · Cero recargo
Escrito el 8 de septiembre de 2026. Actualizamos cuando los hechos cambian. Related: Arquitectura de IA actual de Klaros, Arquitectura futura de agente de IA en Klaros, todas las notas de construcción.