GPT Diffusion

Archivo

Archivo editorial

Todo el contenido largo de GPT Diffusion. Si buscas una puerta de entrada mejor, empieza por los hubs: están pensados por problema, no por fecha.

Modelos 53 piezas Agentes 34 piezas Herramientas 21 piezas Tutoriales 13 piezas Radar 7 piezas

Piezas pilar

Todos los artículos

D-RAC: chunking de RAG 4 veces más barato planificando por IDs

2026-09-27 · Modelos Análisis

El chunking agéntico de RAG paga porque el LLM reescribe el documento entero; D-RAC solo emite listas de IDs: −95,7% de tokens de salida y −77,8%/−85,6% de coste de chunking con la misma calidad de retrieval según sus autores. Analizamos el paper de Yellow.ai y qué transfieres mañana a tu pipeline.

#llm#tokens#costes#optimizacion#benchmark

Qwen-Image-2.1: RGBA nativo (con trampa: licencia research-only)

2026-09-27 · Modelos Análisis

Qwen-Image-2.1 trae generación de imágenes con transparencia nativa (VAE RGBA de 64 canales) y edición con hasta 10 referencias. Analizamos qué es verificado y qué es claim del vendor, y la trampa que el titular no cuenta: la v1 era Apache-2.0 y la 2.1 baja a una licencia research-only que exige acuerdo comercial aparte.

#qwen#open-weights#modelos#optimizacion#analisis

Ternary-Bonsai-2-27B: cuantización ternaria real a 1.72 bits — un 27B en ~6 GB (con trampa: fork obligatorio de llama.cpp)

2026-09-26 · Modelos Análisis

PrismML recuantiza Qwen3.8-27B a pesos ternarios de 1.72 bits/peso: 5.95 GB con el 98.2% de la media FP16, según el vendor. Analizamos qué es verificado y qué es claim, y la trampa que el titular no cuenta: estos ficheros no corren en llama.cpp stock — el fork es obligatorio o te comes salida inservible sin ningún error.

#modelos#qwen#open-weights#benchmark#optimizacion

Nemotron-Labs-Diffusion: cuando tu modelo elige cómo decodificar — AR, difusión o self-speculation

2026-09-24 · Modelos Análisis

NVIDIA unifica AR, difusión y self-speculation en una sola arquitectura de pesos abiertos: cambias el patrón de atención y eliges latencia, throughput o una vía media verificada por AR. Analizamos los números con letra pequeña y la ola paralela de decodificación especulativa con difusión de julio a septiembre de 2026.

#modelos#llm#arquitectura#benchmark#tokens

RSI de agentes: qué es real en la auto-mejora recursiva (AIDE², Darwin Gödel Machine y SICA)

2026-09-23 · Agentes Análisis

AIDE², Darwin Gödel Machine y SICA reescriben el código de sus propios agentes con los modelos congelados: 20→50% en SWE-bench por ~$22.000, 17→53% por ~$7.000, 7 mejoras aceptadas en 8 días. Lo que está medido, lo que no lo está (la ignición), y qué técnicas de esos loops puedes copiar a tu harness hoy sin ningún bucle que se reescriba a sí mismo.

#agentes#coding-agents#evaluacion#benchmark#arquitectura

El código de GitHub como memoria de agentes: Code2Skill y su millón de skills verificadas por reconstrucción ciega

2026-09-22 · Agentes Análisis

Ant International ha minado 1.006.822 skills de 19.769 repos de GitHub y las ha verificado pidiendo a un LLM que reconstruya el código a ciegas. Análisis de qué rinde (SWE-bench 9/9, +11,7% relativo), qué no (AgentBench 5/9, reasoning en BigCodeBench), y qué significa para el patrón SKILL.md.

#agentes#memoria#coding-agents#context-engineering#benchmark

¿Puedes confiar en la memoria de tu agente IA? Envenenamiento distribuido en RAG y privacidad reconstruible

2026-09-21 · Agentes Análisis

Cuatro papers publicados el 18 de septiembre de 2026 dibujan la superficie de ataque de la memoria de agentes IA: envenenamiento que evade la revisión por documento, memorias en conflicto que amplifican alucinaciones y privacidad reconstruible desde fuera. Con los CVEs concretos que parchear y un checklist de higiene.

#agentes#memoria#rag#seguridad#arquitectura

Nex-N2.5: agentes de computer-use gratis en OpenRouter y el mayor post-training trillion-scale en pesos abiertos (sobre DeepSeek)

2026-09-21 · Modelos Análisis

Nex-N2.5 llega en tres variantes —mini 35B, Pro 397B, Max 1,6T— con free tier agéntico en OpenRouter y el primer post-training trillion-scale en pesos abiertos, hecho por un tercero sobre la base DeepSeek-V4-Pro. Qué puedes evaluar gratis de verdad, qué dice el config.json de Max y cómo medir un free tier de computer-use antes de meterlo en producción.

#modelos#open-weights#agentes#openrouter#deepseek

GPT-6 Astra: precios y contexto de 1M — qué permite de verdad

2026-09-12 · Modelos Análisis

Astra empata técnicamente al frente del Intelligence Index de Artificial Analysis y trae una novedad de precio que cambia la cuenta: el contexto largo se cobra aparte. Calculamos escenarios reales con 1M de tokens y explicamos por qué comparar scores entre semanas es inválido.

#openai#llm#pricing#tokens#benchmark

Pi + modelos locales: cuando el harness pesa más que el modelo

2026-08-21 · Agentes Análisis

Un hilo en r/ClaudeCode con 1.162 puntos asegura que modelos locales de 22GB corriendo en Pi ya superan a Claude Code con Opus 5 High en tareas reales posteriores al cutoff de entrenamiento. La parte verificable de la afirmación es más interesante que el titular: el benchmark interno de Databricks y el experimento de oh-my-pi sugieren que el diseño del harness decide más que los pesos del modelo.

#agentes#coding-agents#open-source#llm

El Qwen3.8 de 35B que nunca existió: anatomía de un fantasma en los repositorios oficiales

2026-08-19 · Modelos Análisis

Durante casi 48 horas, el framework oficial de entrenamiento de Alibaba listaba un Qwen3.8-35B-A3B que nadie había visto. Un commit del 16 de agosto lo borró silenciosamente y puso un 27B en su lugar. Qué dice la cadena de commits, por qué la comunidad tiene razón en desconfiar y cómo se filtran los modelos antes de anunciarse.

#qwen#open-weights#open-source#modelos

Qwen3.8-27B | Análisis Completo: Benchmarks, Hardware Local y Licencia

2026-08-16 · Modelos Análisis

Qwen publicó Qwen3.8-27B el 14 de agosto: 27.780M de parámetros densos, multimodal, contexto nativo de 262K y Apache 2.0. Los números de coding agentic son un salto real sobre Qwen3.6-27B, pero todo viene de la propia Qwen y el salto de hardware para explotarlo es más grande de lo que sugieren los titulares.

#llm#modelos#open-weights#qwen#benchmark

Qué cambió en las herramientas de coding AI — finales de julio 2026

2026-08-09 · Agentes Análisis

Claude Opus 5 aterriza en Claude Code, Cursor lanza Router, plan India e iPad bajo la sombra de la compra de SpaceX, Windsurf desaparece como marca (ahora Devin Desktop) y OpenAI recorta precios de GPT-5.6 Terra y Luna. Repaso verificado de lo que cambió en cada herramienta entre el 17 de julio y el 9 de agosto de 2026.

#coding-agents#claude#openai#agentes#benchmark

La memoria de agentes es el nuevo cuello de botella: por qué el patrón prompt-summary está matando tus agentes

2026-08-03 · Agentes Análisis

Doce hilos en 24 horas describen los mismos cuatro fallos de memoria en agentes: resúmenes obsoletos, reconstrucción de contexto, race conditions y relectura de repos. Tres servidores MCP open source salieron esta semana con enfoques opuestos. Análisis de qué falla, por qué, y qué arquitectura resuelve cada modo.

#agentes#memoria#mcp#context-engineering#coding-agents

Cloudflare bloqueará agentes IA por defecto: qué significa para devs desde el 15 de septiembre

2026-07-05 · Herramientas Análisis

Cloudflare cambiará sus defaults el 15 de septiembre de 2026: bloqueará bots de Training y Agent en páginas con anuncios. Los mixed-purpose crawlers también se bloquearán. Esto afecta a ~20% de la web y redefine cómo los agentes de IA acceden al contenido. En este análisis explicamos el impacto y qué deben hacer los desarrolladores.

#cloudflare#agentes#ia#infraestructura#web-scraping

SpaceX IPO: la mayor salida a bolsa de la historia y qué significa para devs

2026-07-01 · Radar Análisis

SpaceX salió a bolsa el 12 de junio de 2026 con una valoración de más de 2 billones de dólares — la mayor IPO de la historia. Más allá del evento financiero, importa por lo que significa para infraestructura de IA, conectividad de devs remotos y el precio del cómputo.

#costes#agentes#arquitectura#radar#comparativa

GPT-6 Spud — Tracker Completo de Lanzamiento (2026)

2026-06-15 · Modelos Análisis

Análisis exhaustivo de lo que sabemos (y no sabemos) sobre GPT-6. Timeline, especificaciones rumoreadas, credibilidad de fuentes y estrategia para desarrolladores.

#gpt-6#openai#frontier-models#benchmark#modelos

WWDC 2026: lo que realmente anunció Apple y qué cambia para devs

2026-06-11 · Herramientas Análisis

Apple confirmó iOS 27, macOS 27 Golden Gate, Siri AI con Gemini, el protocolo LanguageModel para swap de proveedores, Core AI, deprecación de SiriKit y Xcode 27 con agentes. Repaso de lo que pasó, qué es real y qué implica para devs que construyen con IA en el ecosistema Apple.

#apple#gemini#on-device#agentes#sdk

GPT-5.5-Cyber vs Claude Mythos: dos filosofías opuestas para la seguridad en IA

2026-06-08 · Modelos Comparativa

OpenAI apuesta por acceso controlado a miles de defenders con GPT-5.5-Cyber y el programa Trusted Access for Cyber. Anthropic cierra el grifo con Claude Mythos y Project Glasswing para 40 organizaciones. Mismas capacidades, estrategias opuestas. Aquí está el desglose técnico y qué significa para los devs.

#openai#claude#seguridad#frontier-models#open-weights

Gemma 4 vs Llama 4 — Comparativa actualizada agosto 2026

2026-05-26 · Modelos Comparativa

Comparativa Gemma 4 vs Llama 4 actualizada a agosto 2026: Gemma 4 12B Unified trae multimodalidad encoder-free a laptops de 16GB, Muse Spark cierra la era open de Meta, Scout cae en síntesis de contexto. Specs, benchmarks, pricing y veredicto.

#gemma#llama#open-weights#comparativa#benchmark

Recortar costes de coding agents un 50% sin perder calidad

2026-05-22 · Tutoriales Tutorial

Guía práctica para reducir el gasto en Claude Code, Cursor, Copilot y Codex sin sacrificar output. Model routing, context management, prompt caching y patrones reales con números antes/después.

#costes#coding-agents#optimizacion#cursor#claude-code

Telegram Bots con IA sin Código — Guía 2026

2026-05-22 · Tutoriales Tutorial

Crea un bot de Telegram con IA en 30 minutos sin escribir código. Comparamos Coze, Botpress, Flowise y n8n con costes reales, límites y cuándo conviene cada uno.

#telegram#bots#no-code#automatizacion#herramientas

Cursor SDK — Agentes programáticos con TypeScript

2026-05-21 · Agentes Tutorial

Guía práctica para construir coding agents con el Cursor SDK: desde la instalación hasta despliegue en cloud, comparación con Claude Code y OpenAI Agents SDK, y análisis de costes reales.

#cursor#sdk#typescript#agentes#coding-agents

SEO con IA: resultados reales en 3 semanas (con datos de GSC)

2026-05-21 · Herramientas Caso real

Datos reales de Google Search Console demuestran que el contenido optimizado con estrategias de GEO y generado con IA puede producir impresiones y clics medibles en solo 3 semanas. Analizamos el caso y extraemos un framework replicable.

#seo#geo#caso-real#guia#chatgpt

Google invierte 40.000M$ en Anthropic: qué cambia para desarrolladores

2026-05-20 · Modelos Análisis

Google ha anunciado una inversión de hasta 40.000M$ en Anthropic. Pero el 75% está condicionado a hitos, y la parte que importa de verdad es el compute: 5 GW de TPU durante 5 años. Qué significa esto para los devs que usan Claude, la API, y el ecosistema LLM.

#anthropic#claude#openai#costes#pricing

Radar IA mayo 2026: lo que importó esta semana (semana 4)

2026-05-16 · Radar Radar

Anthropic domina el Arena Text con 4 modelos en el top 5, GLM 5.1 y ERNIE 5.1 entran al top 20, Grok 4.20 aterriza con tres variantes, y los coding agents se mueven a la vez. DeepSeek V4-Pro en promoción hasta fin de mes.

#radar#llm#benchmark#arena#coding-agents

Montar un agente con MCP y herramientas locales

2026-05-04 · Tutoriales Tutorial Pilar

Guía paso a paso para construir un agente funcional usando MCP, herramientas locales, y OpenClaw como orquestador. Sin APIs externas, todo en tu máquina.

#agentes#mcp#openclaw#herramientas#typescript

Arquitectura de agentes IA en producción

2026-05-02 · Agentes Análisis Pilar

Patrones de arquitectura reales para agents en producción: single-loop, multi-agent, MCP, memory, evaluación y lo que funciona vs lo que es marketing.

#agentes#multi-agent#arquitectura#orquestacion#mcp

Guía de modelos LLM para devs en 2026

2026-04-20 · Modelos Análisis Pilar

Todos los modelos que importan en 2026, clasificados por caso de uso, con datos reales de benchmarks, precios y disponibilidad.

#llm#modelos#open-weights#frontier-models#benchmark

La brecha cerrado vs abierto se cierra (abril 2026)

2026-04-14 · Modelos Análisis Pilar

Los modelos open-weight están a 3 puntos de Elo de la frontera. La guerra de precios ha empezado. Y el local first es viable. Qué significa todo esto.

#open-weights#frontier-models#benchmark#llm#costes

7 alternativas a OpenClaw en 2026: cuál elegir y cuál no

2026-04-13 · Herramientas Comparativa

Siete alternativas open-source a OpenClaw verificadas en agosto de 2026: Hermes Agent, ZeroClaw, nanoclaw, nullclaw, nanobot, TinyClaw y clisbot — actividad real de cada repo y para quién sirve cada una.

#agentes#openclaw#open-source#seguridad#comparativa

Multi-agent systems con OpenClaw: arquitectura real

2026-04-12 · Agentes Caso real

Cómo funciona un sistema multi-agente real con OpenClaw: routing jerárquico, memoria por agente, skills compartidas y lo que aprendimos deployando uno en

#agentes#multi-agent#openclaw#orquestacion#arquitectura