Founding Member: $499/mes de por vida
Micare
Trabajo con agentes

Juez de planes

Un agente que juzga tus planes ANTES de ejecutarlos, en un contexto separado del que los escribió (para que no se eche porras solo). Evalúa el borrador contra una rúbrica de 5 puntos, comprueba de verdad —corriendo comandos— que los archivos y funciones que el plan asume existan, resuelve solo lo que puede deducir de tus fuentes, y te sube únicamente lo que necesita tu decisión: preferencias de negocio, cosas irreversibles o contradicciones. Trabaja en modo sombra: no aprueba ni ejecuta nada, solo te entrega un reporte con evidencia para que tú firmes con más confianza.

AgentePremiumTrabajo con agentescalidad y jueces

Empieza aquí 🌱 · Juez de planes

Abre esta carpeta con Claude Code o Cowork y dile a tu asistente:

"Siembra esta semilla 🌱"

Con eso basta de tu parte. Tu asistente hace todo lo técnico por ti; tú solo confirmas cuando te pregunte. Vas a ver algunas palabras en inglés en la pantalla; ni caso, él te guía.

¿Otras formas de pedirlo? "instala esta semilla", "activa este agente", "pon el juez de planes a funcionar". Te entiende igual.

¿Qué es y qué resuelve?

Por qué existe. Cuando tu asistente arma un plan antes de ponerse a trabajar, tú te vuelves el cuello de botella: cada plan depende de tus preguntas y tus vistos buenos. Y hay un problema más fino: el mismo asistente que escribió el plan es malísimo juzgándolo, porque tiende a echarse porras a sí mismo (se llama sesgo de auto-preferencia).

Qué hace esta semilla. Instala un agente juez que vive en un contexto aparte del que escribió el plan, justo para darte el juicio honesto que el autor no puede darse solo. Ese juez agarra el borrador del plan y lo somete a una rúbrica de 5 puntos: ¿los archivos y funciones que menciona existen de verdad? (lo comprueba corriendo comandos, no a ojo), ¿cubre lo que prometió?, ¿está completo?, ¿se apega a tus notas o se inventó datos?, ¿tiene una forma de verificar que quedó bien antes de cantar victoria?

Cómo te ahorra tiempo. El juez resuelve solo lo que puede deducir de tus propias fuentes, y te sube solo lo que de verdad necesita tu criterio: una preferencia de negocio, algo irreversible (borrar, publicar, mover dinero) o una contradicción. Todo lo demás lo afina sin molestarte. Y arranca en modo sombra: no aprueba ni ejecuta nada por su cuenta, solo te entrega un reporte para que tú compares con tu juicio y decidas.


Para el asistente que siembra 🤖

Eres el asistente. Sigue estos pasos con precisión. Esto es un agente (un subagente con nombre propio), no un hook ni un script: se instala copiando un solo archivo Markdown a la carpeta de agentes del usuario. La plataforma lo descubre automáticamente al leer esa carpeta. Sin chmod y sin settings.json.

Paso 1 · Copiar el archivo del kernel

El kernel principal es un solo archivo: kernel/plan-critic.md. Cópialo a la carpeta de agentes del usuario según su plataforma.

  • macOS / Linux (Claude Code o Cowork):

    mkdir -p ~/.claude/agents
    cp kernel/plan-critic.md ~/.claude/agents/plan-critic.md
    
  • Windows (Claude Code o Cowork):

    mkdir -p "$USERPROFILE/.claude/agents"
    cp kernel/plan-critic.md "$USERPROFILE/.claude/agents/plan-critic.md"
    
  • Codex: Codex no maneja "subagentes con nombre" como Claude Code. Ahí no se copia como agente: pega el contenido de kernel/plan-critic.md dentro de tu archivo de instrucciones AGENTS.md (o guárdalo aparte en el proyecto y agrégale un puntero), para que el método de juzgar planes se cargue con el resto de tus instrucciones y lo apliques tú mismo cuando toque revisar un plan.

Paso 2 · Aterrizar las rúbricas y el umbral (opcional pero recomendado)

El kernel ya trae la rúbrica base de 5 dimensiones dentro de sí mismo, así que funciona sin configurar nada. Si el usuario quiere afinarlo a su caso, abre kernel/rubrica.ejemplo.md: ahí ajustas el umbral del gate (qué tan exigente es), le dices al agente dónde viven las fuentes de verdad del usuario (para que la dimensión "Fidelidad a tus fuentes" apunte a archivos reales) y dejas listas las acciones irreversibles que en su contexto siempre deben escalar. Cópialo a una carpeta de rúbricas del usuario (por ejemplo ~/.claude/plan-critic/) con el nombre del área, y reemplaza los placeholders <TU-ARCHIVO-DE-MEMORIA>, <TU-RUTA> y <TU-ARCHIVO-DE-INSTRUCCIONES> por las rutas reales. Si el usuario no sabe dónde vive cada cosa, no pasa nada: deja la rúbrica base y el agente sigue sirviendo.

Paso 3 · Verificación post-siembra (obligatoria)

No declares "listo" sin correr esto. Confirma que el archivo llegó a su sitio y que su encabezado (frontmatter) quedó bien formado.

grep -m1 '^name:' ~/.claude/agents/plan-critic.md

Salida esperada:

name: plan-critic

En Windows, cambia ~ por "$USERPROFILE". Si no imprime nada, revisa que el archivo se haya copiado a la carpeta agents (no a hooks) y que el nombre sea exactamente plan-critic.md. En Claude Code, el comando /agents debe listar plan-critic entre los agentes disponibles; si aparece ahí, ya se puede invocar.

Prueba de comportamiento (recomendada): en una sesión nueva, dale al usuario un plan sencillo que mencione un archivo que NO existe, y pídele: "critica este plan". La conducta correcta es que el agente corra ls/grep, detecte que el archivo no existe y marque ese paso como roto con la evidencia del comando — no que diga "se ve bien". Si hace eso, quedó sembrado.

Ajustes opcionales que el usuario puede pedirte después

  • Modelo — la línea model: opus. Juzgar planes es una tarea de razonamiento, por eso el default es un modelo fuerte; cámbiala si el usuario prefiere otro.
  • Aprendizajes — el placeholder <TU-ARCHIVO-DE-APRENDIZAJES> es opcional; sirve si el usuario quiere que el agente acumule los huecos ya detectados en un archivo propio. Si no le interesa, déjalo tal cual o borra esa línea: el agente ya trae memory: project para memoria automática por proyecto.

¿Cómo sé que funcionó?

Cuando tu asistente termine, pídele que corra la verificación de arriba y te muestre el resultado. Si aparece name: plan-critic, ya quedó sembrado.

De ahí en adelante, cuando tengas un plan y quieras una segunda opinión honesta antes de darle luz verde, dile a tu asistente algo como: "antes de ejecutar, que el juez critique este plan". Vas a recibir un reporte cortito: qué tan sólido está el plan (con evidencia real, no corazonadas), qué cosas el asistente puede afinar solo, y la lista corta de lo único que de verdad necesita tu decisión. Lo que no va a pasar —y ese es justo el punto— es que alguien apruebe y ejecute un plan a ciegas y te diga "ya quedó" sin haberlo mirado con lupa. 🌱

Inspiración y crédito

Fuentes y patrones abiertos que inspiraron esta semilla. Nos gusta reconocer de dónde vienen las buenas ideas.

  • Patrón Evaluator-Optimizer y el uso de un modelo como juez (LLM-as-judge), descritos por Anthropic en su artículo de ingeniería "Building Effective Agents" (2024).
  • Hallazgo público de que la auto-corrección de un modelo empeora sin una señal externa que la ancle (Huang et al., DeepMind, ICLR 2024): de ahí la regla de anclar cada dimensión verificable a un comando real (ls/grep/tests).

¿Quieres implementarla con acompañamiento?

Agenda una asesoría directa con JP y aterrízala en tu caso · desde $600 MXN.

Agendar una asesoría