164 fuentes 164 feeds activos 6214 piezas curadas

El resumen del día

Agentes que devoran presupuestos: detectar fallos silenciosos y hacer evals útiles en 2026

Desgranamos cómo los agentes de IA pueden fallar sin lanzar errores y arruinar facturas, por qué muchas funciones que funcionan en demo se rompen en producción, y qué prácticas de evaluación y diseño (loops persistentes, grafos o 'segundo cerebro') realmente ayudan a construir sistemas más fiables y económicos.

¡He hecho un holograma!

Un nuevo tipo de fallo: todo funciona y, aun así, se evapora el presupuesto

Hemos visto casos en los que un agente consume semanas de presupuesto en un fin de semana sin mostrar errores: cada llamada devuelve 200, la latencia está dentro del SLO y los gráficos de CPU parecen tranquilos, pero la factura explota. El problema no es un crash, sino la ausencia de progreso. Según Towards AI, los patrones habituales son bucles, deriva y recursión que repiten herramientas con casi los mismos argumentos miles de veces. Eso exige replantear la monitorización: además de uptime, latencia y tasa de error, necesitamos métricas que reflejen avance funcional y consumo por flujo de trabajo.

Qué medir para que no desaparezca el dinero

  • Progreso lógico por sesión: contar pasos efectivos del flujo, no solo respuestas HTTP.
  • Límites y señales de parada: reglas que detecten repeticiones de llamadas y estados idénticos persistentes.
  • Cost-awareness: alertas basadas en consumo acumulado por agente/herramienta, no solo por servicio.

Evaluaciones que funcionan: del observability al eval-driven vibe coding

No basta con observar: la encuesta de LangChain citada por Towards AI muestra que el 89% de equipos tienen observabilidad, pero menos de la mitad hacen evals offline. Proponemos eval-driven vibe coding: desplegar rápido, registrar fallos reales, convertir cada caso en un "golden case" que no pueda volver a fallar y mantener al juez LLM binario sin que bloquee CI. Empezar con 20–50 casos reales y medir coste por ejecución —según el artículo, un suite de producto puede costar ~€0.56 por corrida— ofrece una relación coste/beneficio clara frente a benchmarks de investigación caros.

La función que funciona en la demo y se rompe en producción

Vendedores ofrecen soluciones para esa brecha demo/producción. Tras 833 pruebas en seis modelos, el resultado fue mayormente decepcionante: muchas supuestas correcciones no resuelven los problemas raíz. Integrar evals reales y tests contra el comportamiento en producción es la única forma de evitar regresiones que no aparecen en tests mockeados. Más detalles en Towards AI.

De bucles de sesión a grafos persistentes: construir un Segundo Cerebro acumulativo

La transición de sesiones efímeras a grafos persistentes (OKF) y agentes compuestos permite que el conocimiento se acumule en lugar de perderse. Esto reduce repetición, mejora la trazabilidad y facilita la evaluación continua del comportamiento del agente. Para equipos que buscan que sus sistemas de IA actúen como una memoria compuesta, la pieza en Towards AI aporta ideas prácticas sobre cómo pasar de loops de sesión a grafos acumulativos.

Dónde la IA acelera (y dónde no)

Import AI aporta una mirada amplia: la IA está acelerando áreas como la ciberseguridad de forma notable, afecta a las matemáticas en menor grado y su impacto en investigación de IA es heterogéneo. Ese diagnóstico ayuda a priorizar esfuerzos de producto y contratación: invertir en seguridad y en pipelines reproducibles suele dar retornos más rápidos que perseguir avances teóricos que tardan en materializarse. Más contexto en Import AI.

Un guiño lúdico: hologramas caseros y lo que nos recuerdan

Para no perder perspectiva humana, una experiencia con kits de hologramas domésticos recuerda que las tecnologías ópticas siguen sorprendiendo y que la experimentación directa alimenta la curiosidad técnica. La anécdota en AI Weirdness es un recordatorio útil de por qué conviene equilibrar métricas con observación manual y prototipos.

Qué nos llevamos

Los mensajes clave son claros: los agentes pueden fallar sin errores visibles y devorar presupuesto; la observabilidad debe complementarse con evals basadas en casos reales; y pasar de sesiones a grafos persistentes mejora memoria y control. Integrar métricas de progreso, límites de coste y suites de evaluación prácticas reduce riesgos y hace que la automatización aporte negocio en lugar de dolores de factura.

Analizado hoy...