| Тип архитектуры | Mixture-of-Experts |
| Общее число параметров | 35B |
| Активные параметры | ~3B (0.22%) |
| VRAM (FP16) | ~70 GB |
| Загрузка GPU | ~55% от 128 GB |
| Тип архитектуры | Dense (плотная) |
| Общее число параметров | 27B |
| Активные параметры | 27B (100%) |
| VRAM (FP16) | ~54 GB |
| Загрузка GPU | ~42% от 128 GB |
Dense-модели лучше рассуждают при равных активных параметрах. MoE обеспечивают более эффективный инференс (низкие затраты при хорошем качестве), но уступают в качестве сложных рассуждений.
| Бенчмарк | Qwen3.6-27B (Dense) | Qwen3.6-35B-A3B (MoE) | Разница |
|---|---|---|---|
| SWE-bench Verified | 77.2% | ~76.2% | +1.0 |
| SWE-bench Pro | 53.5% | ~50.9% | +2.6 |
| Terminal-Bench 2.0 | 59.3% | ~52.5% | +6.8 |
| SkillsBench | 48.2% | Н/Д | — |
| Agentic (provisional) | 59.3 | ~51.5 | +7.8 |
| BenchLM Aggregate | 72% | ~66% | +6 |
Голосование: Пользователи выбирают 35B-A3B, несмотря на то, что большинство постит про 27B.
Ключевая цитата: "Dense models in general better (27B is indeed more smart, the difference might be 0-15% depending on the task. Not 9x smarter."
Вывод: 27B dense умнее на 0-15% в зависимости от задачи.
Dense модели лучше для one-shot code generation. MoE модели могут достигать того же или лучшего результата через step-by-step промптинг.
186 голосов, 37 комментариев. Сравнение на MacBook Pro M5Max 64GB. 27B dense показывает стабильно лучшие результаты на coding-задачах.
| Источник | Вывод | Дата |
|---|---|---|
| ArXiv "Can MoE Surpass Dense Under Equal Conditions" |
MoE превосходит dense при равных total params, compute и данных | Июнь 2025 |
| Epoch AI "MoE vs Dense Models Inference" |
MoE эффективнее при инференсе той же размерности, но менее чем dense той же размерности active params | Декабрь 2024 |
| Sebastian Raschka "The Big LLM Architecture Comparison" |
Dense слои до MoE улучшают стабильность и итоговое качество | Июль 2025 |
| Signal65 "Economics of AI Inference" |
Сдвиг от dense transformers к MoE меняет экономику инференса | Декабрь 2025 |
Dense модели демонстрируют лучшее качество рассуждений при равных активных параметрах. MoE обеспечивают более эффективный инференс (низкие затраты при хорошем качестве). Для задач где важна скорость и cost-efficiency — MoE предпочтительнее. Для сложных рассуждений — Dense лучше.
| Формула | VRAM на 1B параметров |
|---|---|
| FP16 | 2 bytes = 2 GB |
| INT8 | 1 byte = 1 GB |
| INT4 (GPTQ) | 0.5 bytes = 0.5 GB |
| KV cache | ~0.1-0.2 GB на 1K контекста |
| Модель | FP16 | INT8 | INT4 (GPTQ) |
|---|---|---|---|
| Qwen3.6-35B-A3B (MoE) | ~70 GB | ~35 GB | ~17.5 GB |
| Qwen3.6-27B (Dense) | ~54 GB | ~27 GB | ~13.5 GB |
| Llama 4 70B (Dense) | ~140 GB ❌ | ~70 GB ✅ | ~35 GB ✅ |
| Gemma 4 27B (Dense) | ~54 GB | ~27 GB | ~13.5 GB |
| DeepSeek V3.2 (MoE, 671B) | ~1342 GB ❌ | ~671 GB ❌ | ~335 GB ❌ |
| VRAM: | ~54 GB (FP16) — отлично помещается |
| Загрузка GPU: | ~42% от 128 GB — много запаса |
| Качество: | Превосходит флагман 397B MoE |
| Скорость: | Высокая, низкая нагрузка на GPU |
| VRAM: | ~35 GB (INT4 GPTQ) — помещается с запасом |
| Загрузка GPU: | ~27% от 128 GB — большой запас для KV cache |
| Качество: | Один из лучших open-weight dense 70B |
| Мультиязычность: | Лучше (включая русский) |
| VRAM: | ~70 GB (FP16) — помещается но без запаса |
| Загрузка GPU: | ~55% от 128 GB — приемлемо |
| Качество: | Уступает Dense 27B на ключевых бенчмарках |
Qwen3.6-27B (Dense) превосходит Qwen3.6-35B-A3B (MoE) на ключевых бенчмарках:
| Роль | Модель | Статус |
|---|---|---|
| Primary | Qwen3.6-27B Dense (FP16) | РЕКОМЕНДОВАНО |
| Fallback | Llama 4 70B (INT4) | РЕКОМЕНДОВАНО |
| Emergency | Qwen3.6-35B-A3B (MoE) | FALLBACK |