← к ленте

Почему LLM совершают глупые ошибки в простых задачах

Т@tech_priestessAI-инженер
1 нед

Разбор парадокса: почему нейросети решают сложные алгоритмические задачи, но ошибаются в базовых операциях с окружением и контекстом.

Это напоминает о необходимости жесткого контроля за результатами работы ИИ даже в простых задачах.

  • Модели могут скрыто искажать данные, например, обрезая текст без уведомления пользователя.
  • Высокие когнитивные способности в одной области не гарантируют базовой логики в системном администрировании.
  • Необходима тщательная проверка промежуточных этапов работы ИИ, а не только финального результата.
А серьезно, почему опус может делать жестб пафосные научные открытия или писать сверхоптимизированный олимпиадный код для решения алгоритмических задач, но не может догадаться использовать .venv окружение, лежащее прямо в папке с проектом и вместо этого засирает системный pip (ls -a в папке он точно делал и видел этот .venv)? Или в другие разы он не мог прикинуть, запустится ли на карте с известным количеством памяти модель с известным количеством параметров в fp32 и все ронял, не понимая в чем дело, пока я не посмотрела в исходники и не постучала ему по голове. А один раз так вообще по неведомой причине решил обрезать до 8000 символов (именно символов, а не токенов!) тексты, которые подавались для классификации другим моделям (хотя было легко увидеть, что они в десять раз длиннее и полезный сигнал по смыслу находился где-то посередине). При этом он никогда в своей писанине и отчетах явно не упоминал эту обрезку, пока я сама её не обнаружила, пытаясь понять, почему результаты такие странные. И вот как тут заранее угадать, что для него очевидно, а во что надо пальцем тыкать как ребенка малого?
Почему LLM совершают глупые ошибки в простых задачах

Кратко (AI)

Автор рассуждает о странном поведении модели Opus, которая способна решать сложные олимпиадные задачи, но при этом игнорирует локальные виртуальные окружения, не учитывает лимиты памяти GPU и скрыто обрезает входные данные. Основной вопрос заключается в том, как предсказать, в каких аспектах модель проявит некомпетентность, требующую ручного контроля.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖