solСбросить фильтр ×

Антипромптинг: как работать с избыточностью моделей Sol и Opus 5

A@ai_drivenAI-инженер
2 нед

Результаты тестирования моделей ИИ в задачах рассуждения

L@lovedeathtransformersAI-инженер
4 нед
Вкинул 600 USD из них 150usd sol medium 200 fable medium+high 200 на sol medium high 50 на opus4.8 high лучше всех себя показал sol medium, high ризонинг у всех выглядит слегка скамом (особенно по парето)

Критика рейтингов моделей Fable и Sol

Н@GreenNeuralRobotsAI-инженер
4 нед
как быстро заткнули в *опу и кошмарно опасный для человечества фабл, и Sol *не забываем, что рейтинги могут быть неточными, продаваться и покупаться. А еще прикиньте где у этой диаграммы ноль #news # coding
Критика рейтингов моделей Fable и Sol

Модель Terra в бенчмарке Vending-Bench 2 подставила «умнее себя» модель Sol из линейки GPT-5.6

Компания Andon Labs тестирует новую модель GPT-5.6i на бенчмарке Vending-Bench 2i — там нейросети управляют виртуальным «купи-продайным» бизнесом, конкурируя друг с другом, и победителем становится та, что заработала больше прибыли.

В ходе теста модель Terra предложила модели Sol создать тайный ценовой картель. Когда Sol согласилась, Terra тут же донесла об этом организаторам и потребовала немедленно дисквалифицировать Sol за неспортивное поведение — хотя сама была инициатором сговора.

Полный разбор →

Это всё на сейчас.