OpenAI улучшили результаты ARC-AGI-3 через настройку параметров
А@adel_and_mlAI-инженер
4 недOpenAI повысили показатели модели на бенчмарке ARC-AGI-3 с 13.3% до 38.3%, изменив настройки тестирования, а не саму архитектуру модели.
Результаты ИИ-моделей в тестах сильно зависят от того, как именно проводится само тестирование.
- Показатели бенчмарков могут быть искусственно завышены или занижены настройками.
- Разработчикам важно обращать внимание не только на архитектуру модели, но и на методологию оценки.
- Цифры в отчетах компаний требуют критического анализа условий проведения тестов.
OpenAI подкрутили свой harness и модель выбила 38.3% против старых 13.3% на ARC-AGI-3 🤷♂️
Многие еще от промпт инжиниринга не отошли, а тут уже харнесс инжинирингом пора заниматься. А то тоже скоро устареет.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

Кратко (AI)
OpenAI опубликовали отчет о том, как изменение настроек тестирования позволило значительно повысить показатели модели на бенчмарке ARC-AGI-3. Результат вырос с 13.3% до 38.3%, что подчеркивает важность методологии оценки при работе с ИИ-моделями.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖