🔬 Qwen3.6: MoE vs Dense — Полное исследование

Дата исследования: 12 июня 2026  |  GPU: 4× Tesla V100 32GB (128 GB VRAM)  |  Текущая модель: Qwen3.6-35B-A3B (MoE)

1. Архитектура моделей

🧩 Qwen3.6-35B-A3B (MoE)

Тип архитектурыMixture-of-Experts
Общее число параметров35B
Активные параметры~3B (0.22%)
VRAM (FP16)~70 GB
Загрузка GPU~55% от 128 GB

📦 Qwen3.6-27B (Dense)

Тип архитектурыDense (плотная)
Общее число параметров27B
Активные параметры27B (100%)
VRAM (FP16)~54 GB
Загрузка GPU~42% от 128 GB

Ключевое различие

Dense-модели лучше рассуждают при равных активных параметрах. MoE обеспечивают более эффективный инференс (низкие затраты при хорошем качестве), но уступают в качестве сложных рассуждений.

2. Бенчмарки: прямое сравнение

Бенчмарк Qwen3.6-27B (Dense) Qwen3.6-35B-A3B (MoE) Разница
SWE-bench Verified 77.2% ~76.2% +1.0
SWE-bench Pro 53.5% ~50.9% +2.6
Terminal-Bench 2.0 59.3% ~52.5% +6.8
SkillsBench 48.2% Н/Д —
Agentic (provisional) 59.3 ~51.5 +7.8
BenchLM Aggregate 72% ~66% +6

Сравнение бенчмарков

3. Мнения комьюнити

🔴 r/LocalLLaMA — Qwen3.6-27B vs 35B (май 2026)

Голосование: Пользователи выбирают 35B-A3B, несмотря на то, что большинство постит про 27B.

Ключевая цитата: "Dense models in general better (27B is indeed more smart, the difference might be 0-15% depending on the task. Not 9x smarter."

Вывод: 27B dense умнее на 0-15% в зависимости от задачи.

🔴 r/LocalLLaMA — Why MoE for coding? (апрель 2026)

Dense модели лучше для one-shot code generation. MoE модели могут достигать того же или лучшего результата через step-by-step промптинг.

🔵 r/Qwen_AI — Сравнение для coding primitives (апрель 2026)

186 голосов, 37 комментариев. Сравнение на MacBook Pro M5Max 64GB. 27B dense показывает стабильно лучшие результаты на coding-задачах.

4. Научные исследования: MoE vs Dense

Источник Вывод Дата
ArXiv
"Can MoE Surpass Dense Under Equal Conditions"
MoE превосходит dense при равных total params, compute и данных Июнь 2025
Epoch AI
"MoE vs Dense Models Inference"
MoE эффективнее при инференсе той же размерности, но менее чем dense той же размерности active params Декабрь 2024
Sebastian Raschka
"The Big LLM Architecture Comparison"
Dense слои до MoE улучшают стабильность и итоговое качество Июль 2025
Signal65
"Economics of AI Inference"
Сдвиг от dense transformers к MoE меняет экономику инференса Декабрь 2025

Вывод по научным исследованиям

Dense модели демонстрируют лучшее качество рассуждений при равных активных параметрах. MoE обеспечивают более эффективный инференс (низкие затраты при хорошем качестве). Для задач где важна скорость и cost-efficiency — MoE предпочтительнее. Для сложных рассуждений — Dense лучше.

5. VRAM требования и подбор под 4×V100

Математика VRAM

Формула VRAM на 1B параметров
FP162 bytes = 2 GB
INT81 byte = 1 GB
INT4 (GPTQ)0.5 bytes = 0.5 GB
KV cache~0.1-0.2 GB на 1K контекста

VRAM по моделям

Модель FP16 INT8 INT4 (GPTQ)
Qwen3.6-35B-A3B (MoE) ~70 GB ~35 GB ~17.5 GB
Qwen3.6-27B (Dense) ~54 GB ~27 GB ~13.5 GB
Llama 4 70B (Dense) ~140 GB ❌ ~70 GB ✅ ~35 GB ✅
Gemma 4 27B (Dense) ~54 GB ~27 GB ~13.5 GB
DeepSeek V3.2 (MoE, 671B) ~1342 GB ❌ ~671 GB ❌ ~335 GB ❌

VRAM требования по моделям (FP16)

Загрузка GPU 4×V100 по моделям (из 128 GB)

6. Рекомендации для 4×V100

🏆 Рекомендация #1: Qwen3.6-27B (Dense, FP16)

VRAM:~54 GB (FP16) — отлично помещается
Загрузка GPU:~42% от 128 GB — много запаса
Качество:Превосходит флагман 397B MoE
Скорость:Высокая, низкая нагрузка на GPU

🥈 Рекомендация #2: Llama 4 70B (INT4)

VRAM:~35 GB (INT4 GPTQ) — помещается с запасом
Загрузка GPU:~27% от 128 GB — большой запас для KV cache
Качество:Один из лучших open-weight dense 70B
Мультиязычность:Лучше (включая русский)

⚠️ Альтернатива #3: Qwen3.6-35B-A3B (MoE, текущая)

VRAM:~70 GB (FP16) — помещается но без запаса
Загрузка GPU:~55% от 128 GB — приемлемо
Качество:Уступает Dense 27B на ключевых бенчмарках

7. Итоговый вывод

Главный вывод

Qwen3.6-27B (Dense) превосходит Qwen3.6-35B-A3B (MoE) на ключевых бенчмарках:

Fallback-архитектура

Роль Модель Статус
Primary Qwen3.6-27B Dense (FP16) РЕКОМЕНДОВАНО
Fallback Llama 4 70B (INT4) РЕКОМЕНДОВАНО
Emergency Qwen3.6-35B-A3B (MoE) FALLBACK

8. Источники

  1. Qwen Blog — Qwen3.6-27B
  2. Qwen Blog — Qwen3.6-35B-A3B
  3. BenchLM — Сравнение моделей
  4. Artificial Analysis — Сравнение моделей
  5. Reddit r/LocalLLaMA — Обсуждение
  6. Reddit r/Qwen_AI — Обсуждение
  7. ArXiv — MoE vs Dense Research
  8. Epoch AI — MoE vs Inference
  9. Sebastian Raschka — Architecture Comparison
  10. Labellerr — Qwen3.6-35B-A3B Review
  11. Signal65 — MoE Economics
  12. Kaggle — Benchmark Wars 2026
  13. Fireworks AI — Best Open Source LLMs
  14. SitePoint — VRAM Requirements
  15. Fluence Network — Best GPUs for LLM