← к ленте

Результаты тестирования моделей ИИ в задачах рассуждения

L@lovedeathtransformersAI-инженер
4 нед

Пользовательский тест производительности моделей sol, fable и opus 4.8 в задачах с разным уровнем сложности.

Личный опыт сравнения эффективности ИИ-моделей в задачах разной сложности.

  • Пользовательский тест показывает разницу в производительности моделей sol, fable и opus 4.8.
  • Автор отмечает низкую эффективность функций глубокого рассуждения у текущих моделей.
  • Результаты подчеркивают важность выбора конкретной модели под специфические задачи.
Вкинул 600 USD из них 150usd sol medium 200 fable medium+high 200 на sol medium high 50 на opus4.8 high лучше всех себя показал sol medium, high ризонинг у всех выглядит слегка скамом (особенно по парето)

Кратко (AI)

Автор делится личным опытом тестирования различных ИИ-моделей, потратив 600 долларов на запросы разной сложности. По его мнению, модель sol medium показала лучшие результаты, в то время как функции высокоуровневого рассуждения (reasoning) у всех протестированных моделей вызывают сомнения.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖