<script type="application/ld+json">{"@context":"https://schema.org","@graph":[{"@type":"Article","headline":"QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi...","description":"El modelo de la arquitectura Qwen4 ya está publicado en abierto y los datos son oficiales: 125B parámetros con solo 6B activos por token, más 51B de embeddings ","datePublished":"2026-08-26T00:00:00.000Z","dateModified":"2026-08-26T00:00:00.000Z","author":{"@type":"Person","name":"Nicolás Ramos","url":"https://nramos.dev"},"publisher":{"@type":"Organization","name":"NRamosDev","logo":{"type":"ImageObject","url":"https://nramos.dev/favicon.svg"}},"mainEntityOfPage":"https://nramos.dev/blog/qwen-3-8-flash-next-ya-esta-aqui-125b-moe-con-6b-activos-que/","keywords":"youtube, nramosdev, ia, análisis","inLanguage":"es"},{"@type":"VideoObject","name":"QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi...","description":"El modelo de la arquitectura Qwen4 ya está publicado en abierto y los datos son oficiales: 125B parámetros con solo 6B activos por token, más 51B de embeddings ","thumbnailUrl":"https://i.ytimg.com/vi/oiTiVTk9Ex4/hqdefault.jpg","uploadDate":"2026-08-26T00:00:00.000Z","embedUrl":"https://www.youtube.com/embed/oiTiVTk9Ex4","contentUrl":"https://www.youtube.com/watch?v=oiTiVTk9Ex4"}]}</script>
NRamosDev · Blog

QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi...

#youtube#nramosdev#ia#análisis

TL;DR

QWEN 3.8 FLASH-NEXT YA ESTÁ AQUÍ: 125B MoE con 6B activos que arrasa en código y agéntica — análi…

El modelo de la arquitectura Qwen4 ya está publicado en abierto y los datos son oficiales: 125B parámetros con solo 6B activos por token, más 51B de embeddings N-gram y contexto de 262K extensible a 1M. Analizamos la ficha real, la nueva atención QSA, los benchmarks que lo colocan en el #1 de agéntica y código frente a Claude Opus y DeepSeek, y si de verdad puedes correrlo en local.

Capítulos del vídeo

  • 0:00 — Introducción — el modelo ya está publicado
  • 0:26 — Ficha oficial — 125B, 6B activos, 51B N-gram, 262K de contexto
  • 1:00 — Arquitectura Qwen4 — QSA, Gated Residual, N-gram y receta de entrenamiento
  • 1:40 — Benchmarks de código — DeepSWE 58.7, SWE-bench Pro 62.5
  • 2:12 — Agéntico y multimodal — CoWorkBench, JobBench, AndroidWorld
  • 2:46 — Datos generales — GPQA 91.7, LiveCodeBench 91.9
  • 3:20 — En local — la verdad del tamaño (≈180B totales)
  • 3:52 — Licencia y cierre — Qwen Community 1.0, SGLang, vLLM, TokenSpeed

El contexto

DATOS CLAVE

Análisis

  • 125B parámetros totales en MoE, con solo 6B activados por token

  • +51B de embeddings N-gram y +4B MTP (predictor multi-token)

  • Contexto nativo de 262.144 tokens, extensible a 1.000.000 (YaRN)

Puntos clave

Fuentes

Conclusión

  • 512 expertos, 10 enrutados + 1 compartido, arquitectura Qwen4

Artículo generado automáticamente desde el vídeo publicado en nramosdev. Cada número citado proviene de la investigación verificada del pipeline.

([nr])

¿Te ha gustado? Suscríbete al canal para más análisis de IA en español.

Ver en YouTube

Artículos relacionados