Noticias techJun 2026 · 3 min de lectura

LLMs de pesos abiertos en 2026: la brecha con la frontera se mide en meses

Los modelos abiertos tuvieron un gran año y la distancia con la frontera cerrada se redujo a unos meses, hasta que miras los benchmarks agénticos difíciles, donde se vuelve a abrir.

Raudin Moreno
Raudin MorenoIngeniero de Software

Los modelos de pesos abiertos tuvieron un 2026 muy bueno. Los laboratorios chinos, DeepSeek, Alibaba Qwen, Moonshot Kimi y Zhipu GLM, ahora lideran la frontera abierta, y OpenAI publicó gpt-oss bajo Apache 2.0, sus primeros pesos abiertos desde GPT-2. Para mucho trabajo cotidiano ya no necesitas una API cerrada.

La ilusión de paridad

En SWE-bench Verified los mejores modelos abiertos rondan el 80 por ciento, cerca de la frontera cerrada. Pero en pruebas agénticas más duras como SWE-bench Pro se quedan atrás, más o menos mitad de los cincuenta para los abiertos frente a mitad de los sesenta para un líder cerrado. La paridad en generación de código no es lo mismo que la paridad agéntica, y las afirmaciones de "abierto igual a cerrado" casi siempre citan el benchmark más fácil.

Aun con esa salvedad, la brecha compuesta se estrechó a algo así como tres a seis meses. Qwen3-Coder se publica bajo Apache 2.0 y marca cerca de 70 por ciento en SWE-bench Verified, y su variante con menos parámetros activos corre cómoda en Apple Silicon.

Correrlos tú mismo

El tooling local se asentó en tres herramientas con roles claros: Ollama para desarrollo local de un comando, llama.cpp para máximo control y Apple Silicon o CPU, y vLLM para servir en producción con alta concurrencia. La cuantización como Q4_K_M recorta la memoria hasta en tres cuartos, y varios modelos nuevos ya vienen en INT4 nativo, lo que evita la pérdida de calidad de cuantizar después.

# Desarrollo local, un comando ollama run qwen3-coder:30b # Servir en producción, API compatible con OpenAI vllm serve Qwen/Qwen3-Coder-30B-A3B --quantization awq

El fine-tuning también está al alcance. Un fine-tune QLoRA de un modelo de 7 a 8 mil millones de parámetros cabe en una GPU de consumo de 12GB por unos pocos dólares de cómputo, y vLLM puede intercambiar en caliente muchos adaptadores sobre un mismo modelo base, lo que abarata servir varias variantes personalizadas.

Un matiz que conviene interiorizar: la mayoría de los modelos "abiertos" de frontera son de pesos abiertos, no de código abierto. Las licencias Apache y MIT, usadas por Qwen, gpt-oss y DeepSeek V4 Flash, son la capa amigable para adquisiciones. Otras traen topes de uso o cláusulas que restringen entrenar modelos competidores. Lee la licencia antes de construir sobre ella.

Volver al blog© 2026 Raudin Moreno