Dejé de pagar ChatGPT y construí mi propio sistema de IA.

Últimamente me he metido mucho en la ejecución de modelos de lenguaje grandes (LLM) localmente y, después de ver todos Cosas interesantes que puedes hacer con las herramientas MCPMe di cuenta de que era hora de actualizar un poco mi propia configuración.

Dejé de pagar ChatGPT y construí mi propio sistema de IA.

Al principio, me subí al carro de la moda cuando se lanzó DeepSeek R1, pero desde entonces han surgido muchos modelos nuevos. Con la rapidez con la que todo cambia, pensé que también tenía sentido optimizar mi flujo de trabajo.

LM Studio es la mejor aplicación LLM local que he usado (hasta ahora).

Ollama es bueno, pero prefiero esto.

Comencé a experimentar con modelos de lenguaje local grande (LLM) el año pasado usando OllamaFuncionó bastante bien, pero mi pobre MacBook Air, con solo 8 GB de RAM, no estaba diseñada para soportar esa carga de trabajo. Aun así, quería probar algo diferente, en parte por curiosidad y en parte para ver si podía sacarle aún más rendimiento.

Por eso decidí probar LM Studio. Es una aplicación que permite descargar y ejecutar Modelos de Lenguaje Grandes (LLM) localmente en el equipo, y además tiene una interfaz de usuario clara. Como uso una Mac, la compatibilidad con MLX fue crucial para mí. Si no lo conoces, MLX es el framework de aprendizaje automático de Apple, diseñado específicamente para Apple Silicon.

Básicamente, permite que los modelos se ejecuten de forma más eficiente utilizando la unidad de procesamiento gráfico (GPU). Sin embargo, quería expresarlo con cifras, así que comparé Ollama con LMStudio directamente, utilizando el mismo modelo.

Tokens por segundo de LM Studio vs Ollama

Con LM Studio obtenía una mayor cantidad de símbolos por segundo, pero la diferencia era tan pequeña que no alteraba la experiencia general. Sin embargo, aprovecharía cualquier mejora de rendimiento.

Sin embargo, no creo que haya mucha diferencia si eliges Ollama o LM Studio, especialmente porque ambos se basan en marcos básicos similares para ejecutar modelos localmente.

Mi principal queja al principio era la falta de compatibilidad multimedia. Pero eso ya no es un problema real. Tanto Ollama como LM Studio ahora admiten plantillas multimedia, y hay algunas opciones potentes que gestionan bien texto e imágenes en dispositivos locales.

Elegir el modelo adecuado puede ser un poco difícil

Puede ser un pasatiempo caro.

Lista de búsqueda de plantillas de LM Studio

Al instalar LM Studio por primera vez, lo primero que deberá hacer es elegir una plantilla. Esto puede resultar un poco confuso si es nuevo en esto, ya que no hay una respuesta única y directa para "usar esta plantilla". La elección correcta depende realmente de su hardware.

Si abres el menú de Búsqueda de Modelos en LM Studio, verás una lista de los modelos más populares. Una forma sencilla de entender la demanda de un modelo es fijarte en el número que precede a la letra "B" en su nombre.

La "B" representa miles de millones de parámetros. Generalmente, cuanto mayor sea este número, más potente será el modelo. Esto también significa que requerirá más recursos. En una Mac con 8 GB de VRAM, creo que entre 3 y 4 mil millones de parámetros es un buen rango. En una PC, la situación puede ser un poco más compleja. En lugar de la RAM habitual del sistema, lo que más importa es la cantidad de VRAM.

Si tienes 8 GB de VRAM, puedes experimentar cómodamente con modelos que usan parámetros de 7B, especialmente en configuraciones cuánticas más ligeras. En mi experiencia, lo mejor es empezar con un modelo más pequeño e ir aumentando gradualmente hasta encontrar el adecuado.

Personalmente, me atrajo más el modelo Gemma 3 4B, que se basa en la misma base que los modelos Gemini de Google. Sin embargo, también recomiendo probar los modelos Qwen. Dependiendo de lo que estés haciendo, podría ser mucho más adecuado para ti.

Incluso puedes agregar la búsqueda web a tu LLM local

DuckDuckGo llega al rescate

Página del complemento DuckDuckGo en LM Studio

Una de las mayores quejas que he visto sobre los Modelos de Lenguaje Grande (LLM) nativos es lo limitados que son en comparación con los modelos basados ​​en la nube como ChatGPT en cuanto a la búsqueda web. No es muy útil preguntar sobre el último iPhone y que el LLM empiece a hablar del iPhone 14. Este es un aspecto en el que los modelos basados ​​en la nube han sido superiores.

LM Studio cuenta con un sistema de complementos integrado, y añadir la búsqueda web es increíblemente sencillo. Solo tienes que ir a Página del complemento DuckDuckGoY especifique Ejecutar en LM Studio.

Una vez habilitado, al ejecutar un formulario, verá una opción debajo del cuadro de chat que le preguntará si desea invocar DuckDuckGo para su consulta. Si la activa, LM Studio obtendrá los resultados de búsqueda en tiempo real y los incluirá en el formulario antes de generar una respuesta.

LM Studio busca en la web a través de DuckDuckGo

Eso no es todo lo que puedes hacer con los plugins. El equipo de LM Studio también ha creado algunos muy útiles. Por ejemplo, tienen un plugin para Wikipedia que permite que tu modelo de lenguaje completo lea y busque artículos de Wikipedia (por supuesto).

También existe el plugin JavaScript Sandbox, que puede ser muy útil si te interesa la programación con vibe y quieres hacerte una idea rápida de lo que se ha creado. Sin embargo, no creo que valga la pena el esfuerzo para crear algo listo para producción.

Deshazte de las grandes empresas

Puedes configurar LM Studio para acceder a tu gran modelo de lenguaje desde tu teléfono, pero si deseas transferir toda la inferencia directamente a tu teléfono, eso también es posible. Ejecución de modelos de idiomas más pequeños y más grandes en un teléfono AndroidAunque no será tan potente como lo que obtendrás en una Mac.

La mejora de estos modelos ligeros continúa a un ritmo rápido e impresionante. Dado que se prevé un aumento en los precios del hardware, no me sorprendería que empresas como OpenAI o Google aumentaran sus precios de suscripción. Es tranquilizador tener una configuración que no se ve afectada por nada de esto.

Ir al botón superior