Cómo trabajo con agentes — SinergIA

SinergIA · La Paredita · 24–25 julio 2026

Cómo trabajo con agentes.

Un ecosistema local-first en un Mac Studio: agentes especializados, un mission control que los vigila, una sola puerta a los modelos y una sola memoria. Todo desde el móvil — o con el mando del Mac entero en el iPad.

Capa 1 · Entrada

Un humano. Sus canales y su trabajo.

El sistema viene a donde ya estoy. Y no solo por mis canales: Thio también lee mis sesiones de código en cmux para saber en qué ando — sin que se lo pida.

Telegram

canal principal

Teléfono

llamadas reales, in y out

WhatsApp

bridge al mismo cerebro

Email

Gmail + Resend

cmux

lee tus sesiones de código

Foco

ve tus pantallas de cmux e infiere en qué andas

Fireflies

transcribe tus reuniones

Slack

mensajes de equipo

Calendar

agenda y eventos

Drive

documentos y archivos

lo mantienen al día

Capa 2 · El hub

Thio. La visión de todo.

Mi asistente personal, con su propia personalidad. Centraliza todo lo que hago: 60+ herramientas, memoria de cada conversación y contexto de cada proyecto. Los demás agentes son especialistas; Thio es quien tiene el mapa.

🎩

Thio

asistente personal · 60+ tools · Telegram

coordina y delega en

Capa 3 · Especialistas

Un agente por dominio.

Procesos independientes con su repo y su misión. Se hablan por APIs, nunca por imports.

Yarbis

voz · ElevenLabs + SIP

Elena

turismo rural · La Paredita

CMO Agent

marketing gaming

Inner Coach

hábitos y foco

Fin. Advisor

fiscalidad canaria · MCP

orquestados y vigilados por

Capa 4 · Orquestación

PMC. Mission control.

Puntúa proyectos, despacha trabajo autónomo, audita las normas y reinicia lo que se cae. Con cmux, varios agentes Claude corren en paralelo en sesiones aisladas — y se programan a sí mismos.

PMC autopilot

detecta y despacha trabajo

Claude Code

el motor de self-coding

cmux

varios agentes en paralelo, aislados

Auditorías

cada 12 h · normas LLM y memoria

Watchdogs

caído → restart + aviso

toda inferencia pasa por

Capa 5 · LLM Gateway

LiteLLM. Una sola puerta.

Proxy local. Ningún agente llama a un proveedor directo: failover automático, prompt caching (~90 % de ahorro), presupuesto mensual y una única API key. Cada llamada queda trazada en Langfuse — veo el coste y el rastro de cada agente.

Claude

Anthropic · primario

Gemini

Google · fallback

OpenAI

+ OpenRouter · fallback

Ollama

modelos locales · último recurso

leen y escriben en

Capa 6 · Memoria

Obsidian. Una sola memoria.

Lo que un agente aprende, lo ven todos. Markdown plano que yo también leo y edito: la memoria no es una base de datos opaca, es mi vault.

Thio/

contexto curado · solo lectura

Agents/

inbox y outputs · aquí escriben

Personal/

acceso con propósito · zonas vetadas

SQLite + STATE.md

estado operacional por repo

sobre una base de

Base · Fundamentos

La fontanería que no se ve.

1Password

único gestor de secretos

pm2

pm2

24 procesos supervisados

Cloudflare

webhooks sin abrir puertos

GitHub + CI

typecheck · tests · guardianes

restic

backup cifrado de la memoria

Tailscale

VPN privada · malla de dispositivos

Screens

control del Mac desde iPad/iPhone

En directo

Mira una petición viajar por Thio.

Elige un escenario y dale a reproducir.


Tres reglas de oro.

01

Todo LLM pasa por el proxy.

Prohibido llamar a un proveedor directo. Un cron lo audita cada 12 horas y avisa si alguien se salta la norma.

02

Toda memoria vive en Obsidian.

Cero memorias paralelas en JSON o SQLite para cosas que un humano querría leer.

03

Todo secreto vive en 1Password.

Los .env solo contienen referencias op:// que se resuelven al arrancar.

¿Y por qué no Hermes, LangChain o CrewAI?

Los agentes están hechos a mano sobre el SDK de Anthropic. Sin framework de agentes. A propósito.

El loop es una función

  • ~1 archivoprefetch → llamada → tools → respuesta. Se lee entero en 10 minutos.
  • Cero magiasi algo falla a las 3 AM, es mi código — no 12 capas de librería.

El SDK ya trae el 90 %

  • Tool use nativoel loop de herramientas viene en la API
  • Streaming + cachingbreakpoints de caché a mano: ~90 % de ahorro real
  • MCPel estándar sí lo adopto — integrar sin acoplarse

Los frameworks cobran peaje

  • Abstracciónesconden prompt, caché y errores — justo lo que necesito ver
  • ChurnAPIs que rompen cada trimestre; el SDK es estable
  • Lo transversal, en paquetesrouting, tagging y caching en 2 paquetes propios, no en un framework

Donde sí uso bases ajenas

  • Hermes / openclawshell de prototipado — stage 1 del pipeline
  • Claude Codeel harness de self-coding no lo reinvento
  • LiteLLMel proxy multi-proveedor tampoco

Piezas destacables.

Lo que más rendimiento da del stack, por categoría.

MCP servers

  • GitHubPRs, issues y code search desde el agente
  • Google WorkspaceSheets · Gmail · Drive · Calendar
  • Playwrightel agente navega la web de verdad
  • Context7docs de librerías siempre al día
  • Firefliestranscripciones de reuniones
  • Magnificgeneración de imagen y vídeo

CLI

  • claudeClaude Code — motor de self-coding
  • ghGitHub sin salir de la terminal
  • opsecretos bajo demanda (1Password)
  • pm2supervisión de procesos
  • wranglerdeploy a Cloudflare en segundos

Skills

  • /shiptypecheck → verify → commit → push
  • /improveel agente elige tarea y la ejecuta
  • /prior-artbuscar lo resuelto antes de codear
  • /learnsesiones → habilidades reutilizables

Convenciones

  • STATE.mdcada repo informa al siguiente agente
  • verifyCommandninguna tarea sin comprobación
  • 3 strikestres fallos → parar y preguntar
  • Confirmaciónlo destructivo pide OK humano

Observabilidad

  • Langfusetraza y coste de cada llamada, por agente
  • Health monitorping a LiteLLM · auto-heal de ABI
  • Budget guardtope mensual · alerta al 80 %

Fiabilidad

Lo difícil no es la IA. Es que no falle a las 3 de la madrugada.

La IA es la parte fácil. Lo que separa un demo de algo que uso a diario es la ingeniería clásica de fiabilidad a su alrededor.

Sentinel

Once sondas sintéticas recorren el camino crítico cada seis horas, ejercitando el sistema real. Detectan lo que deja de pasar, no solo los errores.

11 sondas · verde ahora mismo

Registro de eventos

Un diario que solo crece anota cada hecho —llamadas, herramientas, sondas— con su hora. Línea temporal para depurar y para detectar ausencias.

cada llamada · cada tool

Evals

Escenarios de referencia puntúan al agente de voz antes de tocar producción. Cada cambio de modelo o de prompt se mide; no se adivina.

5 escenarios · 11/11 checks

Runbook + simulacros

Cada incidente real se convierte en receta. Un simulacro trimestral reinicia la máquina y cronometra qué revive solo.

síntoma → receta

Un webhook estuvo dos meses caído en silencio — nadie lo supo porque el fallo era ausencia, no error. Hoy una sonda sintética lo detecta el mismo día. Esa es la diferencia entre un sistema que se enseña y uno que se usa.

11
sondas del golden path
3.331
tests automáticos
4
proveedores en failover
0
secretos en el código

Caso real · esta misma semana

Una llamada de teléfono que trabaja sola.

01

Le pido a Thio por Telegram que llame a alguien con un objetivo.

02

Yarbis marca desde un número español real y conversa con voz expresiva.

03

En mitad de la llamada consulta mi calendario, crea recordatorios y me avisa por Telegram.

04

Al colgar: transcript, audio y análisis en Telegram — y el agente decide próximas acciones.