Просто дружеское напоминание что сейчас лучше всего учить своих агентов строить себе harness'ы:
Подтверждение этому маленький стартап
Poetiq (кстати основан бывшими исследователями Google DeepMind)
Нашли новый способ который делает Opus 4.8 / GPT-5.5 умнее чем Fable / GPT 5.6 Sol во всех бенчмарках.
Сразу скажу что есть такой закон Гудхарта и риск бенчмаксинга, когда модель заточена на то чтобы бить конкретный бенч, и тогда реальную пользу по нему не понять.
А работает это так: их система это петля (RSI) которая автоматически конструирует целые харнессы (код, промпты, инструменты и стратегии поиска) для любого бенчмарка, с которым сталкивается.
Сама пишет всю инфраструктуру решения, прогоняет, смотрит на результат, переписывает, и так по кругу, пока не выжмет максимум.
А модель внутри петли это просто расходный материал, которую можно заменить на более новую, и вся накопленная обвязка автоматом конвертируется в еще лучший результат.
То есть улучшения накапливаются и переносятся. Каждая задача, которую она решает, помогает ей оптимизировать саму себя, превращая её во всё более мощный оптимизатор.
Причем для этого не нужен никакой файнтюн, просто обычный API-доступ.
Поэтому Poetiq говорят "статичные бенчмарки мертвы", и вместо них предлагают динамически генерируемые тесты, заточенные под слабые места конкретной модели, на которые невозможно натренироваться.
Технарям рекомендую
это видео на ютубе, если хотите сделать харнесс дома (или просто скормить агенту)
@tips_ai #news