Llevo un año operando 13 servicios en producción 24/7 con dos servidores físicos en casa y un VPS en Oracle Cloud free tier. Coste mensual: 0€. Coste emocional: medio-bajo. Coste de oportunidades: alto (he aprendido más SysAdmin en 12 meses que en 4 años de carrera).

El hardware

Un AMD con 32GB RAM y un Intel con 16GB. Proxmox en los dos, ZFS para resiliencia, KVM para VMs críticas, LXC para servicios ligeros. La regla que sigo: si un servicio se rompe el disco, debe poder volver en menos de 1 hora con backup automatizado.

Spoiler: esa regla me la salté una vez. Volvió a las 6 horas.

Los servicios que opero

Home Assistant, NAS virtual, NPM, Frigate, Pi-hole (2x), AdGuard, Palomino AI, JARVIS, Miniverse, Homarr, Mealie, Jellyfin. Cero unplanned downtime en 1 año.

Pero con un asterisco: a las 11 meses se rompió un disco del NAS Synology y mi RAID1 cayó a degraded con un solo disco. Llevo 6 semanas con esa situación. Los datos están a salvo (un disco solo en RAID1 sigue funcionando) pero la redundancia es cero. Estoy esperando comprar el reemplazo en agosto.

Lo que aprendí rompiendo cosas

Mes 3: certificado SSL expirado en pleno domingo

ACME configurado mal, cron de renovación caído. Cert expirado → portfolio inaccesible 8 horas hasta que lo vi. Aprendí: monitoring de certificados, no solo de servicios.

Mes 7: ZFS ARC consumió toda la RAM

El host tenía 32GB, le di 16GB al ZFS ARC. La VM Home Assistant se quedó sin memoria y empezó a matar sus propios procesos. Tardé 4 horas en diagnosticar. Aprendí: ARC tiene que tener límite duro (zfs set zfs_arc_max=8G).

Mes 11: el disco del NAS

ata5/ata6 errors en dmesg. Los vi, los ignoré. Una semana después, sda desapareció del array. Perdí redundancia. Aprendí: los warnings de SMART no son opcionales.

Lo que me hizo mejor SysAdmin

No es la tecnología. Es escribir runbooks después de cada incidente. Tengo 23 runbooks ahora. Cuando algo se rompe, abro el runbook correspondiente y me guío paso a paso. La primera vez que lo hice (mes 3 con el cert SSL) tardé 8 horas. La siguiente vez que pasó algo parecido (mes 7 con ZFS ARC) tardé 45 minutos.

El stack hoy

  • Proxmox VE en los dos servidores, ZFS mirrored
  • Pi-hole como DHCP + filtro DNS + servidor recursivo (3 usos en uno)
  • Synology DSM en VM con GPU passthrough (GTX 1650 SUPER)
  • Oracle Cloud free tier para lo público (portfolio + APIs + VPS)
  • Tailscale como mesh VPN
  • Ollama Cloud para embeddings (no quiero modelos locales pesados)

Todo documentado en el vault que comparto con Lia y Palomino.

Lo que no volvería a hacer

  • RAID1 mecánico. Compré el segundo disco mecánico porque era barato. SSD o nada para RAID1. La latencia del mecánico me costó 30% de rendimiento en NAS.
  • DIY ZFS ARC sin documentar. Si hubiera escrito el tuning, habría tardado 30 minutos en vez de 4 horas.
  • Ignorar dmesg. Los warnings son gratis de leer. 5 segundos al día.

Lo que haría igual

  • Homelab propio. Aprender en producción real > cursos.
  • VPS público separado. Si tu infra de casa se cae, lo público sigue.
  • 3 agentes IA con roles claros. Me han ahorrado 200 horas este año.

¿Tienes homelab también? Cuéntame qué rompiste este año. Las historias de incidentes son las que más enseñan.