Результаты тестирования моделей ИИ в задачах рассуждения
L@lovedeathtransformersAI-инженер
4 недПользовательский тест производительности моделей sol, fable и opus 4.8 в задачах с разным уровнем сложности.
Личный опыт сравнения эффективности ИИ-моделей в задачах разной сложности.
- Пользовательский тест показывает разницу в производительности моделей sol, fable и opus 4.8.
- Автор отмечает низкую эффективность функций глубокого рассуждения у текущих моделей.
- Результаты подчеркивают важность выбора конкретной модели под специфические задачи.
Вкинул 600 USD из них
150usd sol medium
200 fable medium+high
200 на sol medium high
50 на opus4.8 high
лучше всех себя показал sol medium, high ризонинг у всех выглядит слегка скамом (особенно по парето)
Кратко (AI)
Автор делится личным опытом тестирования различных ИИ-моделей, потратив 600 долларов на запросы разной сложности. По его мнению, модель sol medium показала лучшие результаты, в то время как функции высокоуровневого рассуждения (reasoning) у всех протестированных моделей вызывают сомнения.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖