← к ленте

Сравнение производительности AI-моделей в инженерных симуляциях

С@sergiobulaevAI-инженер
4 нед

Анализ эффективности моделей Fable, GPT-5.6 и Sol в решении сложных инженерных задач и важность внешних систем верификации (харнессов).

Надежность AI в сложных расчетах зависит не только от модели, но и от внешнего контроля.

  • Модели склонны к ошибкам при самопроверке, подгоняя результаты под неверные данные.
  • Внешние системы верификации (харнессы) критически важны для инженерных задач.
  • Использование жестких хуков и автоматических проверок кода снижает риск критических ошибок.
Ребята дали четырём передовым моделям (Fable vs новые GPT) немного поработать: собрать симуляцию полёта NASA HL-20 — шесть степеней свободы, аэродинамика из 170 таблиц продувок — плюс четыре задачи от уравнений состояния до релятивистской динамики. Сверка относитльно независимого эталона. Claude выиграл - доля правильно произведенных расчётов - 89% против 0.73% у худшего GPT-5.6. Промах в конечной точке траектории: 0.4 метра у Fable, 19, 400 и примерно 500 у остальных. Цена победы $9.60 за прогон; GPT-5.6-Sol взял 81,5% за $1.74. Все провалы похожи: модель проверяет сама себя. Sol перепутал две похожие скорости из условия задачи и точно подогнал расчёт под неверную — все его проверки сошлись, потому что сверяли ответ с его же ошибкой, а не с условием. Terra молча сократила время симуляции с 5 до 3 секунд и себя проверяла на том же укороченном отрезке — накопивгшуюся ошибку никто не увидел. Fable нарочно пытался ломать собственные формулы, чтобы убедиться, что его тесты работают. Похоже поэтому и выиграл. Второй эксперимент: та же модель в их харнессе Dyad с принудительной верификацией набрала 0.899, в стоковом coding-агенте — 0.533 и ноль на релятивистской задаче. Формула авторов: модель — переменная, харнесс — множитель. Авторы исселодвания продают харнесс Dyad, так что мотив формулы очевиден. Тут я с ними не согласен Следить за рынком харнессов для меня сейчас — трата времени: универсальные агенты обмениваются фичами с лагом в недели, кто-то новый временами начинает побеждать, остальные догоняют. Кто сегодня лучший? Знаю, многие пытаются сделать свои варианты. Вместо того что бы работать. Когда появятся новые герои — мы этого не пропустим. Так было сначала с Cursor, потом с Claude Code и наконец то в тулсете закрепился и Codex (мы пользуемся обоими - всмысле обоими одновременно). Dyad в этот раз выиграл зашитой проверкой, которую агент физически не может пропустить. Это вправильный кейс. Мы умеем такое с клодом: у Claude Code есть хуки — скрипты, которые блокируют действие агента, если проверка не прошла. Плюс гит-хуки, которые не дают закоммитить сломанный файл. Работает. Модели меняем постоянно. Проверки, которые агент не может обойти, собираем каждый день. Сергей Булаев AI 🤖 - об AI и не только
Сравнение производительности AI-моделей в инженерных симуляциях

Кратко (AI)

Автор анализирует результаты тестирования различных AI-моделей в сложных инженерных задачах, таких как симуляция полета NASA HL-20. Выяснилось, что модели часто ошибаются при самопроверке, поэтому использование внешних систем верификации (харнессов) критически важно для точности. Автор подчеркивает, что инструменты вроде Claude Code с жесткими хуками проверки эффективнее, чем полагаться только на способности самой модели.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖