<script type="application/ld+json">{"@context":"https://schema.org","@graph":[{"@type":"Article","headline":"Meta Muse Glimmer 30B: el agente IA de Meta que corre 100% local","description":"¿Agentes de IA locales, siempre activos y sin pagar por token? Analizamos Muse Glimmer 30B de Meta: arquitectura, benchmarks y si de verdad corre en tu máquin","datePublished":"2026-08-14T00:00:00.000Z","dateModified":"2026-08-14T00:00:00.000Z","author":{"@type":"Person","name":"Nicolás Ramos","url":"https://nramos.dev"},"publisher":{"@type":"Organization","name":"NRamosDev","logo":{"type":"ImageObject","url":"https://nramos.dev/favicon.svg"}},"mainEntityOfPage":"https://nramos.dev/blog/meta-muse-glimmer-30b-el-agente-ia-de-meta-que-corre-100-loc/","keywords":"youtube, nramosdev, ia, análisis","inLanguage":"es"},{"@type":"VideoObject","name":"Meta Muse Glimmer 30B: el agente IA de Meta que corre 100% local","description":"¿Agentes de IA locales, siempre activos y sin pagar por token? Analizamos Muse Glimmer 30B de Meta: arquitectura, benchmarks y si de verdad corre en tu máquin","thumbnailUrl":"https://i.ytimg.com/vi/QUwORJ1pTyI/hqdefault.jpg","uploadDate":"2026-08-14T00:00:00.000Z","embedUrl":"https://www.youtube.com/embed/QUwORJ1pTyI","contentUrl":"https://www.youtube.com/watch?v=QUwORJ1pTyI"}]}</script>
NRamosDev · Blog

Meta Muse Glimmer 30B: el agente IA de Meta que corre 100% local

#youtube#nramosdev#ia#análisis

TL;DR

Meta Muse Glimmer 30B: el agente IA de Meta que corre 100% local

¿Agentes de IA locales, siempre activos y sin pagar por token? Analizamos Muse Glimmer 30B de Meta: arquitectura, benchmarks y si de verdad corre en tu máquina.

Este artículo amplía el vídeo del canal nramosdev con el estudio completo y las fuentes verificadas.

El contexto

Arquitectura (verificado en model card HF)

  • Total de parámetros: ~29.6B (incluye encoder de visión)
  • Arquitectura: Dense Causal Transformer con Perception Encoder
  • Layers: 52 · hidden dim 6656 · FFN SwiGLU (19,968)
  • Atención: [Local, Local, Local, Global] repetido, sliding window 2048, GQA 32/2 (ratio 16:1)
  • Encoder de visión: ViT-G/14 (~1.8B params, 50 layers, patch 14) — hasta 4.096 tokens visuales por imagen
  • Contexto: 131.072+ (128K+)
  • Vocabulario: 202.048 tokens (200K BPE + 2.048 especiales)
  • Modalities: entrada texto + imagen; salida SOLO texto (no genera audio ni vídeo)
  • Knowledge cutoff: 4 enero 2026
  • Idiomas: entrenado con datos de 100+ idiomas (válido para es-ES)

Propósito: agente local always-on

  • Tool calling fiable con schemas precisos en flujos largos
  • Razonamiento multi-paso con recuperación de fallos (si una tool falla, diagnostica y reintenta)
  • Memoria persistente y continuidad entre reinicios
  • Multimodal: interpreta capturas, gráficos, documentos junto al texto
  • Compatible con scaffolds: OpenClaw, Hermes Agent, y otros patrones agénticos
  • Ya corremos Muse-Glimmer-30B-4bit en los Ultra (aliases u1-/u2-muse-glimmer-30b) — experiencia local real del canal

Hardware y velocidad (verificado)

  • Cuantización ~4-bit: modelo bajo 20GB → K-Quant-17GB en 24GB VRAM (degradación 1.0%), K-Quant-Dynamic en 32GB (0.2%), full precision en 64GB
  • Speculative decoding DFlash: drafter de 5 capas, bloques de 16 tokens
  • Velocidades medias (HF model card):
  • Nvidia RTX 5090: 74.9 → 233.4 tok/s con DFlash (3.1x)
  • Apple M4 Max: 23.7 → 37.8 tok/s (1.5x, ExecuTorch)
  • Apple M5 Max: 26.6 → 50.2 tok/s (1.8x)
  • AMD (blog oficial, llama.cpp Vulkan + dFlash):
  • Ryzen AI Max+ 395: hasta 24 tok/s
  • Radeon AI PRO R9700: hasta 53 tok/s
  • Runtimes: Transformers, vLLM (OpenAI-compatible), SGLang, llama.cpp, ExecuTorch, LM Studio, Lemonade (binario embebible ~4MB), Docker Model Runner, NVIDIA NIM

Benchmarks (tabla oficial Meta — comparativa con Gemma4-31B y Qwen3.6-27B)

Lectura honesta: gana en agentes (MCP Atlas 75.5, DeepSearch 74.6, SWE-Bench Pro 51.2) y razonamiento (AIME 94.7); Qwen3.6-27B le gana en OSWorld (75.6), TerminalBench (60.7) y SWE-Bench Verified (77.2); Gemma4 gana solo GPQA (85.7).

Modelos de vídeo de Meta (contexto — no open weights)

  • Muse Video / Muse Image viven en Meta AI app / Instagram — sin API pública ni pesos abiertos
  • Movie Gen (2024): 30B text-to-video + 13B video-to-audio, sigue siendo research cerrado
  • Meta no publica pesos abiertos de ningún modelo de vídeo → el vídeo del canal se produce con el pipeline Remotion (motion graphics), no con el modelo

¿Se puede correr en local? (sí — y nosotros ya lo hacemos)

  • ✅ 1 GPU consumer o Mac (24/32GB VRAM con cuantización)
  • ✅ Runtimes open source (vLLM, llama.cpp, LM Studio, ExecuTorch)
  • ✅ Ya corriendo en la infra del canal: Muse-Glimmer-30B-4bit en los Mac Ultra (u1-/u2-muse-glimmer-30b)
  • Coste: 0 €/token (local), vs API en la nube

Datos comparativos

Categoría Benchmark Muse Glimmer-30B Gemma4-31B Qwen3.6-27B
Agéntico general MCP Atlas 75.5 54.2 62.5
DeepSearch QA 74.6 61.7 71.1
τ³-Banking 23.5 15.1 16.7
GAIA2 43.3 36.4 40.0
OSWorld-Verified 65.9 58.5 75.6
Coding agéntico SWE-Bench Pro 51.2 36.9 50.2
SWE-Bench Verified 76.0 66.6 77.2
TerminalBench 2.1 51.7 43.4 60.7
Multimodal Charxiv Reasoning 78.8 77.7 78.4
OmniDocBench v1.5 75.8 72.5 77.8
MMMU Pro 74 73 75
General/razonamiento AIME 2026 94.7 89.2 94.1
GPQA Diamond 83.5 85.7 84.2
IFBench 77.0 76.0 70.8
Beam128K 65.1 58.2 63.0

Puntos clave

Fuentes


Artículo generado desde el estudio completo del pipeline de vídeo de nramosdev. Todos los datos provienen de la investigación verificada del canal.

([nr])

¿Te ha gustado? Suscríbete al canal para más análisis de IA en español.

Ver en YouTube

Artículos relacionados