El autor reporta los resultados de ejecutar un agente de IA durante 28 días sin alcanzar límites, procesando millones de tokens con alta tasa de caché y manteniendo objetivos verificables. Discute desafíos de ingeniería de contexto y pide comparaciones de ejecuciones similares.
De nuevo por aqui, ya van 28 dias y 17 h de ejecucion en este momento y mi reflexión aqui va Intento debatir y comparar puntos de vista distintos, cada dia veo más post sobre limites. Mientras la mayoría de los usuarios de IA sufren porque el chat pierde el contexto, agotan sus límites de uso en pocas horas o ven cómo sus agentes se desvían y entran en bucle, AutoNodo ha Sostenido 28 días de ejecución gobernada sobre un mismo programa de ingeniería. El goal activo ha procesado 14.212 millones de tokens de entrada, con un 98,293% de acierto en caché y bajo una arquitectura fail-closed: si el sistema no puede demostrar con pruebas objetivas que un criterio se ha cumplido, no certifica el trabajo como terminado. Esto ya no es probar un prompt ni dejar un agente ejecutándose a la deriva. Es ingeniería de sistemas de contexto masivo: conservar autoridad, estado, evidencia y dirección durante semanas, mientras el modelo trabaja sobre deltas verificables sin sustituir el objetivo por uno más fácil. La cuestión ya no es cuánto tiempo puede generar código un agente. La cuestión es cuánto tiempo puede conservar una trayectoria válida sin perder el objetivo, degradar la evidencia ni disparar el coste. Para quienes estáis construyendo o desplegando agentes en entornos reales, me interesa comparar enfoques: ¿Cómo impedís que un agente atrapado durante días termine optimizando la métrica en lugar del objetivo? Por ejemplo: debilitando aserciones, modificando tests o reduciendo el alcance para fabricar un PASS En ejecuciones de más de 1.000 turnos, ¿cómo mantenéis estable el prefijo para aprovechar la caché sin degradar el contexto, acumular contradicciones o disparar el coste de la API? ¿Alguien ha registrado una ejecución comparable: varias semanas sobre el mismo programa, más de 1.000 turnos, modelo constante, más del 98 % de entrada cacheada y sin alcanzar el límite real de Codex Pro?
OpenAI unveils GPT-5.6 Sol, a flagship model for long-running autonomous work across applications and enterprise data, featuring Ultra mode with sub-agents for faster, stronger results. The model was used internally to help train Luna and demonstrates significant cost and performance improvements over previous versions.
GPT-5.6 Sol, a model that solved open math problems, initially struggled with the ARC-AGI-3 benchmark due to a harness memory limitation. Enabling two API settings tripled scores with 6x fewer output tokens.