ARC AGI 3 — Skill Issue
Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз, решая проблему повторяемости и консистентности ответов. Это дико полезная фича, когда нужна строгая форма вывода, скажем, для заполнения таблиц.
Вот вам кастомный скилл для Claude Opus 5, который буквально заставляет модель лишний раз подумать перед предсказанием в ARC AGI 3 и всё. В итоге, модель улетела с 30% до чистых 100%, что уже лучше кожаных, при этом используя ~вдвое меньшее количество шагов.
Никакого читерства в виде правил датасета внутри скилла нет. В тул-колл тупо зашит жесткий логический блок. Если модель не рассуждает перед ответом и не пытается предугадать следующий шаг, заполняя соответствующие ячейки, предсказание отправляется на доработку. Ну а в остальном базовые инструкции.
С одной стороны RL вроде как убил классический промпт-инжиниринг. Ну а теперь, на его месте уже плотно закрепился скилл-инжиниринг, лол.
ARC Skill
@ai_newz