Небольшая ИИ-модель почти удвоила точность в математике, когда ее научили перепроверять собственные решения
Исследователи из Университета Оклахомы, Стэнфорда и еще двух вузов предложили простой способ сделать языковые модели ощутимо умнее без переобучения и увеличения общего размера данных.
Идея напоминает поведение внимательного школьника на контрольной – вместо того чтобы переписывать решение заново раз за разом, нужно перечитать уже написанное, найти ошибку и исправить именно ее.
Чтобы понять, зачем это нужно, стоит разобраться в контексте. Долгое время ИИ улучшали в основном за счет размера – больше параметров, больше данных, больше вычислений при обучении. Сейчас все активнее используется другой подход – дать уже готовой модели "подумать подольше" в момент ответа, потратив дополнительные вычисления на поиск и проверку решения.
Самый распространенный вариант такого "раздумья" прост. Модель решает задачу несколько раз независимо, а затем выбирается ответ, который встречается чаще всего, либо лучший вариант определяет отдельная модель-экзаменатор, которая оценивает решения.
У обоих способов есть слабые места. Исследователи заметили, что при увеличении числа попыток модель в основном ходит по одним и тем же тропинкам и повторяет одни и те же ошибки. В тесте AIME-24 число по-настоящему разных подходов к решению выросло лишь примерно с 1,2 при двух попытках до 2,5 при 32 – то есть в 16 раз больше попыток дали всего вдвое больше идей. При этом модель-экзаменатор сама может ошибаться в оценках и подводить весь процесс.
Новый метод сочетает "ширину" и "глубину". Сначала модель пишет несколько независимых решений, а затем каждое проходит несколько кругов доработки – модель продолжает рассуждение, после чего выступает в роли строгого критика и ищет в нем логические, вычислительные или структурные ошибки, после чего переписывает решение с учетом найденных замечаний. Все три роли исполняет одна и та же модель, которой просто дают разные инструкции, а финальный ответ определяется обычным голосованием большинством.
Ключевое преимущество – отсутствие дополнительных компонентов. Методу не нужны внешний проверяющий, отдельная модель для оценки шагов, дополнительное обучение или специальная логика остановки, так что его можно применить практически к любой модели. Если критик не находит ошибок, он прямо подтверждает решение, и оно остается без изменений.
Важная деталь – речь идет не о флагманских ИИ вроде ChatGPT или Claude, а о небольших открытых моделях. Тестирование проводилось на Qwen2.5-Math-7B, Qwen2.5-1.5B, Ministral-8B и LLaMA-3.1-8B, а все эксперименты запускались на одной видеокарте NVIDIA H100. Такие модели можно запустить на собственном сервере, а не обращаться к облаку крупной компании.
Самый впечатляющий результат показала самая маленькая модель с 1,5 млрд параметров. В MATH500 ее точность выросла с 29,6% при лучшем из стандартных методов до 58%, то есть модель стала правильно решать почти вдвое больше задач. В AMC результат поднялся с 25% до 32,5%.
У более сильных моделей прирост скромнее. Специализированная математическая Qwen2.5-Math-7B и так решала MATH500 на 81%, и метод добавил ей лишь доли процента. Исследователи объясняют это тем, что перепроверка полезнее всего там, где у модели есть скрытые способности к рассуждению, которые плохо проявляются с первой попытки.
Отдельный эксперимент показал, что этап критики работает не впустую. Если убрать его и просто попросить модель переписать решение, маленькая Qwen набирает в MATH500 55,6% вместо 58%. Значит, явное указание на ошибку помогает модели больше, чем просто лишняя попытка.
У работы есть и ограничения – каждое решение проходит несколько кругов доработки, а это заметно больше вычислений, чем одна попытка. Сами исследователи признают, что сравнивали методы при одинаковом числе решений, а не при одинаковом объеме потраченных вычислений.
- Moonshot AI выпустила веса Kimi-K3 и бросила вызов OpenAI и Anthropic – модель работает почти как топовые, но в 2-3 раза дешевле
- Исследователь ИИ собрал браузерную версию StarCraft на движке OpenBW
- Kimi K3 переворачивает рынок ИИ – 2,8 триллиона параметров и цены втрое ниже западных аналогов