Три модели с точностью 95%. Почему их цепочка может дать только 85%?
<img src="https://habrastorage.org/getpro/habr/upload_files/9bb/776/962/9bb776962a031b556be02af3fa1a62ba.png" /><p>Например, один участник выбирает ветку кошек, другой - собак. <strong>Система может сохранить обе ветви, запросить более качественное изображение или передать случай человеку.</strong> Для этого в архитектуре заранее нужны доступ к исходному объекту, возможность пересмотра маршрута и ограничение числа дополнительных попыток.</p><p>Если такой возможности нет, обнаруженное несогласие останется красивой записью в журнале.</p><p><strong>Согласие тоже не даёт гарантии. Все участники могут уверенно повторить одну ошибку.</strong> Поэтому проверять нужно конкретный вопрос: <strong>помогает ли несогласие выделять ошибки лучше, чем более дешёвый сигнал от одной модели, при сопоставимом бюджете?</strong></p><p>Работы по <a href="https://arxiv.org/abs/1612.01474" rel="noopener nofollow">deep ensembles</a> дают основания исследовать ансамбли как способ оценки неопределённости. Но в них полезное разнообразие возникает и при обучении сетей одной архитектуры. Отдельно авторы <a href="https://arxiv.org/abs/2502.00674" rel="noopener nofollow">Rethinking Mixture-of-Agents</a> показывают, что объединение ответов разных LLM не всегда выигрывает у объединения нескольких ответов одной сильной модели.</p> <a href="https://habr.com/ru/articles/1081670/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1081670#habracut">Читать далее</a>
Read full article →