Сравнение производительности AI-моделей в инженерных симуляциях
С@sergiobulaevAI-инженер
4 недАнализ эффективности моделей Fable, GPT-5.6 и Sol в решении сложных инженерных задач и важность внешних систем верификации (харнессов).
Надежность AI в сложных расчетах зависит не только от модели, но и от внешнего контроля.
- Модели склонны к ошибкам при самопроверке, подгоняя результаты под неверные данные.
- Внешние системы верификации (харнессы) критически важны для инженерных задач.
- Использование жестких хуков и автоматических проверок кода снижает риск критических ошибок.
Ребята дали четырём передовым моделям (Fable vs новые GPT) немного поработать: собрать симуляцию полёта NASA HL-20 — шесть степеней свободы, аэродинамика из 170 таблиц продувок — плюс четыре задачи от уравнений состояния до релятивистской динамики. Сверка относитльно независимого эталона.
Claude выиграл - доля правильно произведенных расчётов - 89% против 0.73% у худшего GPT-5.6. Промах в конечной точке траектории: 0.4 метра у Fable, 19, 400 и примерно 500 у остальных. Цена победы $9.60 за прогон; GPT-5.6-Sol взял 81,5% за $1.74.
Все провалы похожи: модель проверяет сама себя. Sol перепутал две похожие скорости из условия задачи и точно подогнал расчёт под неверную — все его проверки сошлись, потому что сверяли ответ с его же ошибкой, а не с условием.
Terra молча сократила время симуляции с 5 до 3 секунд и себя проверяла на том же укороченном отрезке — накопивгшуюся ошибку никто не увидел. Fable нарочно пытался ломать собственные формулы, чтобы убедиться, что его тесты работают. Похоже поэтому и выиграл.
Второй эксперимент: та же модель в их харнессе Dyad с принудительной верификацией набрала 0.899, в стоковом coding-агенте — 0.533 и ноль на релятивистской задаче. Формула авторов: модель — переменная, харнесс — множитель. Авторы исселодвания продают харнесс Dyad, так что мотив формулы очевиден.
Тут я с ними не согласен
Следить за рынком харнессов для меня сейчас — трата времени: универсальные агенты обмениваются фичами с лагом в недели, кто-то новый временами начинает побеждать, остальные догоняют. Кто сегодня лучший? Знаю, многие пытаются сделать свои варианты. Вместо того что бы работать.
Когда появятся новые герои — мы этого не пропустим. Так было сначала с Cursor, потом с Claude Code и наконец то в тулсете закрепился и Codex (мы пользуемся обоими - всмысле обоими одновременно).
Dyad в этот раз выиграл зашитой проверкой, которую агент физически не может пропустить. Это вправильный кейс.
Мы умеем такое с клодом: у Claude Code есть хуки — скрипты, которые блокируют действие агента, если проверка не прошла. Плюс гит-хуки, которые не дают закоммитить сломанный файл. Работает.
Модели меняем постоянно. Проверки, которые агент не может обойти, собираем каждый день.
Сергей Булаев AI 🤖 - об AI и не только

Кратко (AI)
Автор анализирует результаты тестирования различных AI-моделей в сложных инженерных задачах, таких как симуляция полета NASA HL-20. Выяснилось, что модели часто ошибаются при самопроверке, поэтому использование внешних систем верификации (харнессов) критически важно для точности. Автор подчеркивает, что инструменты вроде Claude Code с жесткими хуками проверки эффективнее, чем полагаться только на способности самой модели.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖