← к ленте

Сравнение Claude и Codex в решении Cayley головоломок 666

D@datastorieslanguagesAI-инженер
6 дн

Автор сравнивает эффективность моделей Claude и Codex при решении сложных математических головоломок Cayley 666, где Codex показал неожиданный результат.

Демонстрация того, как специализированные агентные системы могут справляться с задачами, недоступными для стандартных LLM.

  • Codex показал способность к автономному решению сложных комбинаторных задач через итеративный процесс.
  • Результат подчеркивает разницу в подходах к агентному решению задач между моделями Claude и Codex.
  • Подтверждается эффективность использования агентов для автоматизации поиска решений в математических головоломках.
​​Cayley puzzles: 666 on claude vs codex Я уже рассказывал, что занимаюсь решением cayley головоломок. В этот раз я пошёл штурмовать головоломки 555 и 666. Почему они сложнее предыдущих? Дело в том, что с каждым увеличением пространства решений и диаметра нам всё сложнее решать задачу. Во-первых, модели у нас двигаются к решению итеративно - каждый дополнительный шаг увеличивает ошибку. Во-вторых, чем длиннее пути, тем сложнее собрать корректные лейблы для путей; плюс random walks чаще будут путаться и/или не достигать дальние точки. Я начал решать 555 теми же подходами, что и прошлые головоломки - первичная тренировка модели, потом шлифовка и beam search. Трансфомер пришлось отложить - он бы работал слишком медленно. После нескольких дней тренировки на A100 мне удалось получить прилично работающую модель. Она решает головоломки не всегда, но всё-таки стабильно выдаёт хорошие решения. Результат - второе место; на первом месте - участник команды 16-го места с Santa 2015. Дальше я попробовал сделать тоже самое для 666... и ну не работает оно. Модель учится плохо и головоломки совсем не решает - лейблы собирать тяжело, пути длинные, в общем сложно всё. От безысходности я решил обратиться к агентам. Взял claude code + opus 5.0 max и codex + 5.6 Sol Extra High. Обоим отправил один и тот же промпт - мол вот головоломка, вот как мы решали подобное раньше, давайте попробуем её решить классическими способами. Потом подбадривал модели, чтобы они её решили. Клод после пары итераций ответил, что решить невозможно, ваще. Решил 0 головоломок и сдался. Кодекс подумал, сделал мелкую итерацию и остановился. Я ему поставил goal - достичь скор 180к или меньше (это суммарная длина найденных путей решенных головоломок). Он подумал, запустил процесс... и через почти 7 часов выдал топовое решение. Я попросил его пояснить, но в ответ получил сложное описание процесса решения из 7 этапов. Я впечатлён. #ai

Кратко (AI)

Автор тестирует возможности моделей Claude и Codex в решении сложных математических головоломок Cayley 666. В то время как Claude отказался от задачи, Codex смог найти оптимальное решение за 7 часов работы, продемонстрировав высокую эффективность в агентном режиме.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖