3-bit VLM base + 4-bit MTP drafter. Pair both for accelerated instruct decode. reasoning_effort baked to low.
Jorge Leon
leonsarmiento
AI & ML interests
AI for Environment
Recent Activity
liked a model about 4 hours ago
openbmb/MiniCPM5-2B-GGUF updated a model about 18 hours ago
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx updated a model 3 days ago
leonsarmiento/Orion-26B-A4B-v1-6bit-XL-mlxOrganizations
Notable, Niche or just weird
One-off MLX quantizations that didn't fit into a model-family collection.
-
leonsarmiento/Aella-Qwen3-14B-8bit-mlx
Text Generation • 15B • Updated • 17 -
leonsarmiento/Assistant_Pepe_8B-8bit-mlx
Text Generation • 8B • Updated • 20 -
leonsarmiento/Domyn-Small-v1.0-8bit-mlx
Text Generation • 10B • Updated • 30 -
leonsarmiento/Llama-3.3-8B-Instruct-128K_Abliterated-8bit-mlx
Text Generation • 8B • Updated • 45
Agents-A1 MLX Quantizations
MLX quantizations of Agents-A1 (Qwen3.5 MoE, ~3B active). BaseQuant_XL variants.
Qwen3.6-35B-A3B MLX Quantizations
Qwen3.6-35B-A3B MoE (35B/~3B active). Vanilla + Huihui-abliterated + heretic. BaseQuant_XL recommended.
Nex-N2-mini MLX Quantizations
MLX quantizations based on Nex-N2-mini (35B MoE, ~3B active, Qwen3.5). Includes vanilla and Huihui-abliterated variants. BaseQuant_XL recommended.
GLM-4.7-Flash MLX Quantizations
MLX quantizations of zai-org/GLM-4.7-Flash (31B MoE, ~3B active). BaseQuant_XL recommended over standard variants.
Local SOTA for 48GB Macs
Best local MLX-quantized LLMs fitting 48GB unified memory. 6-bit XL variants are data-agnostic honest kings; oQ4e-XL for RAM-desperate coders.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 238 • 3 -
leonsarmiento/Qwen3.6-35B-A3B-6bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 106 -
leonsarmiento/Qwen3.6-35B-A3B-oQ4e-mtp-XL-mlx
Image-Text-to-Text • 36B • Updated • 276 • 1 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 89
Ornith-Agents-A1-merge
DARE-TIES merge of Ornith-1.0-35B and Agents-A1 (Qwen3.5-35B-A3B MoE) — BaseQuant_XL MLX quantizations
Qwen3.6-27B MLX Quantizations
MLX quantizations based on Qwen3.6-27B dense architecture. Includes vanilla and uncensored-heretic variants.
Ornith-35B-A3B
Ornith-1.0-35B MoE (35B/~3B active). Vanilla + uncensored-heretic. BaseQuant_XL recommended.
-
leonsarmiento/Ornith-1.0-35B-5bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 474 • 11 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 89 -
leonsarmiento/Ornith-1.0-35B-5bit-mlx
Image-Text-to-Text • 35B • Updated • 200 • 6 -
leonsarmiento/Ornith-1.0-35B-uncensored-heretic-5bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 890 • 3
Gemma 4 26B A4B MLX Quantizations
Gemma-4-26B-A4B QAT MoE (25.2B/3.8B active). Vanilla + Huihui-abliterated. BaseQuant_XL recommended.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 238 • 3 -
leonsarmiento/gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 66 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 125 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 152
Qwen3.8-27B MLX Quantizations
3-bit VLM base + 4-bit MTP drafter. Pair both for accelerated instruct decode. reasoning_effort baked to low.
Local SOTA for 48GB Macs
Best local MLX-quantized LLMs fitting 48GB unified memory. 6-bit XL variants are data-agnostic honest kings; oQ4e-XL for RAM-desperate coders.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 238 • 3 -
leonsarmiento/Qwen3.6-35B-A3B-6bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 106 -
leonsarmiento/Qwen3.6-35B-A3B-oQ4e-mtp-XL-mlx
Image-Text-to-Text • 36B • Updated • 276 • 1 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 89
Notable, Niche or just weird
One-off MLX quantizations that didn't fit into a model-family collection.
-
leonsarmiento/Aella-Qwen3-14B-8bit-mlx
Text Generation • 15B • Updated • 17 -
leonsarmiento/Assistant_Pepe_8B-8bit-mlx
Text Generation • 8B • Updated • 20 -
leonsarmiento/Domyn-Small-v1.0-8bit-mlx
Text Generation • 10B • Updated • 30 -
leonsarmiento/Llama-3.3-8B-Instruct-128K_Abliterated-8bit-mlx
Text Generation • 8B • Updated • 45
Ornith-Agents-A1-merge
DARE-TIES merge of Ornith-1.0-35B and Agents-A1 (Qwen3.5-35B-A3B MoE) — BaseQuant_XL MLX quantizations
Agents-A1 MLX Quantizations
MLX quantizations of Agents-A1 (Qwen3.5 MoE, ~3B active). BaseQuant_XL variants.
Qwen3.6-27B MLX Quantizations
MLX quantizations based on Qwen3.6-27B dense architecture. Includes vanilla and uncensored-heretic variants.
Qwen3.6-35B-A3B MLX Quantizations
Qwen3.6-35B-A3B MoE (35B/~3B active). Vanilla + Huihui-abliterated + heretic. BaseQuant_XL recommended.
Ornith-35B-A3B
Ornith-1.0-35B MoE (35B/~3B active). Vanilla + uncensored-heretic. BaseQuant_XL recommended.
-
leonsarmiento/Ornith-1.0-35B-5bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 474 • 11 -
leonsarmiento/Ornith-1.0-35B-6bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 89 -
leonsarmiento/Ornith-1.0-35B-5bit-mlx
Image-Text-to-Text • 35B • Updated • 200 • 6 -
leonsarmiento/Ornith-1.0-35B-uncensored-heretic-5bit-XL-mlx
Image-Text-to-Text • 35B • Updated • 890 • 3
Nex-N2-mini MLX Quantizations
MLX quantizations based on Nex-N2-mini (35B MoE, ~3B active, Qwen3.5). Includes vanilla and Huihui-abliterated variants. BaseQuant_XL recommended.
Gemma 4 26B A4B MLX Quantizations
Gemma-4-26B-A4B QAT MoE (25.2B/3.8B active). Vanilla + Huihui-abliterated. BaseQuant_XL recommended.
-
leonsarmiento/gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 238 • 3 -
leonsarmiento/gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 66 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-6bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 125 -
leonsarmiento/Huihui-gemma-4-26B-A4B-it-8bit-XL-mlx
Image-Text-to-Text • 26B • Updated • 152
GLM-4.7-Flash MLX Quantizations
MLX quantizations of zai-org/GLM-4.7-Flash (31B MoE, ~3B active). BaseQuant_XL recommended over standard variants.