Сравнение Алисы (Яндекс) и Гигачат (Сбер) по 5 бенчмаркам: τ³, ПРАКТ-120, MultiChallenge, WildBench и Arena-Hard
Всем привет! Я обещал написать эту статью и я наконец-то закончил тесты и готов поделиться с вами результатами. Я потратил МНОГО времени на то, чтобы прогнать эти бенчмарки. Много времени на сетапы, много времени на ожидание тестов. Все вместе заняло около двух недель работы - модели обрывались, где-то нужно было костылять заплатки чтобы они отвечали, где-то просто ждать по несколько дней на прохождение теста (даже в многопоточном тестировании). Наконец-то я получил ответы, которые мне интересны - и, надеюсь, будут интересны и вам, и создателям Алисы и Гигачата. Почему они сами не проходят такие бенчмарки я догадываюсь, но на месте руководства этими проектами я бы наоборот, поставил бы прохождение бенчмарков в цикл. Потому что только так можно понять где твоя модель, а где мировые лидеры. Я хотел сделать обзор и Маракуйи ИИ, но ребята ушли в глубокий рефакторинг и обещают скоро вернуться с совсем новым продуктом - отечественной кодовой средой, аналогом Cursor, Claude Code, Codex, но без VPN, иностранных карт и вообще суверенное решение. Поэтому в этой статье я поделюсь результатами только трех моделей: Алиса, Гигачат Ультра, Гигачат Макс. Алиса тестировалась через веб-коннектор - именно так, как с ней взаимодействуют пользователи. В 90% случаев она в процессе оправдывалась: "Сейчас повышенная нагрузка, поэтому я включаю модель попроще". Но тест на то и есть тест: именно так с ней и взаимодействуют пользователи и именно такой результат они и получают. Гигачат - тестировался по АПИ. Бесплатных токенов, которые дают при регистрации, не хватило - поэтому я тестировал с трех аккаунтов: двух своих и с аккаунта жены. Этого хватило. Скорее читать о результатах эксперимента!
Read full article →