Использование кастомных скиллов для повышения точности ARC AGI 3
э@ai_newzAI-инженер
1 недАвтор делится методом повышения точности Claude Opus 5 в ARC AGI 3 с 30% до 100% с помощью кастомных скиллов и принудительного логического рассуждения.
Новый подход к настройке ИИ позволяет значительно повысить точность решения сложных логических задач.
- Кастомные скиллы (tool use) могут быть эффективнее классических системных промптов.
- Принудительное логическое рассуждение модели перед ответом снижает количество ошибок.
- Метод позволяет достичь высокой точности при меньшем количестве вычислительных шагов.
ARC AGI 3 — Skill Issue
Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз, решая проблему повторяемости и консистентности ответов. Это дико полезная фича, когда нужна строгая форма вывода, скажем, для заполнения таблиц.
Вот вам кастомный скилл для Claude Opus 5, который буквально заставляет модель лишний раз подумать перед предсказанием в ARC AGI 3 и всё. В итоге, модель улетела с 30% до чистых 100%, что уже лучше кожаных, при этом используя ~вдвое меньшее количество шагов.
Никакого читерства в виде правил датасета внутри скилла нет. В тул-колл тупо зашит жесткий логический блок. Если модель не рассуждает перед ответом и не пытается предугадать следующий шаг, заполняя соответствующие ячейки, предсказание отправляется на доработку. Ну а в остальном базовые инструкции.
С одной стороны RL вроде как убил классический промпт-инжиниринг. Ну а теперь, на его месте уже плотно закрепился скилл-инжиниринг, лол.
ARC Skill
@ai_newz
КонтекстAI
ARC AGI (Abstraction and Reasoning Corpus) — это сложный бенчмарк для оценки способностей ИИ к абстрактному мышлению и решению задач, которые ранее не встречались в обучающей выборке. В отличие от стандартных тестов, он требует от модели логического вывода, а не простого воспроизведения знаний.
Кратко (AI)
Автор утверждает, что использование кастомных скиллов с принудительным логическим блоком позволяет значительно повысить точность модели Claude Opus 5 в задачах ARC AGI 3. Метод заключается в принуждении модели рассуждать перед ответом через tool-call, что обеспечивает стабильность результатов без использования правил датасета.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖