Как 17B активных бьют 70B плотных: анатомия Mixture-of-Experts (MoE)
<img src="https://habrastorage.org/getpro/habr/upload_files/cd2/a94/d8b/cd2a94d8b4f45f4bda4057aa0750d491.jpg" /><p>Если вдруг вы моргнули на моменте, когда разработчики нейросетей мерились, у кого больше цифра рядом с названием модели, а выморгнув, обнаружили, что теперь модно флексить скромными размерами активных параметров, эта статья для вас. Сегодня объясняю, как же так произошло, что все флагманы опенсорса внезапно стали MoE, почему Qwen3.5 на 397 миллиардов параметров строчит токены, как будто ей 17 и почему никто не разорился на видеокартах.</p><p>Ну и для тех, кому «только спросить» откроем тайну: в каком же кабинете живет эксперт по медицине.</p> <a href="https://habr.com/ru/articles/1069008/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1069008#habracut">Читать далее</a>
Read full article →