Blog

Notas desde producción.

Artículos sobre sistemas LLM, agentes y el trabajo poco lucido que los hace fiables.

  1. Recuperar no es el problema. Ordenar sí.

    Cómo funciona la recuperación del Oráculo de mi wiki de D&D: tres vías de búsqueda que se fusionan por rango, un reranker que solo mejora las cosas si nunca ve el texto crudo, y los huecos que sobran para lo que no cupo.

    12 min de lectura
    • rag
    • llm-local
    • ollama
    • chromadb
    • reranking
  2. Conservar el arnés, cambiar el modelo

    Lo que hace falta para ejecutar Claude Code contra NVIDIA NIM y modelos locales de Ollama cuando se agota la cuota de la suscripción, y por qué el modelo que mejor puntúa en los benchmarks no es el que funciona.

    9 min de lectura
    • claude-code
    • litellm
    • local-llm
    • tooling