Стартап Engram и компания Harvey протестировали модель Qwen 3.8 в юридических задачах, показав превосходство над Opus 4.8 по эффективности и стоимости.
📌
Qwen 3.8 решает юридические задачи лучше и дешевле Opus 4.8
Стартап Engram, который занимается памятью для ИИ-агентов, вместе с легалтех-компанией Harvey
проверил, что будет, если агент заранее изучит рабочее пространство фирмы, а не будет каждый раз перечитывать документы.
Для эксперимента собрали синтетическую юрфирму Calderwood & Harkness: 100 млн токенов, 9 286 файлов, 266 клиентских дел - от судебных споров до сделок M&A и раундов финансирования.
Модель Qwen3.8-27B не просто получила этот массив на вход - она изучала его тысячами прогонов, сама генерировала себе обучающие данные и записывала заметки.
Часть знаний осела в весах через LoRA, часть - в структурированных заметках, куда агент потом ходит поиском. Исходные 100 млн токенов ужались в 1 млн токенов заметок.
🟡
Результаты
Выше оказалась не абсолютная точность, а интеллект на токен. По этой метрике кастомная Qwen дает 190,8 балла на 100 тысяч токенов против 129,3 у Opus 4.8 и 104,2 при высоком уровне рассуждений.
По доле полностью верных ответов модель тоже обошла Opus 4.8 - 30% против 25%, - и обошлась в 0,13 доллара за запрос против 1,32.
Это примерно десятикратная разница по ценам OpenRouter на август 2026.
Отдельно измерили, сколько модель усвоила в веса. Отвечая на вопросы о фирме вообще без инструментов и заметок, до изучения она была права в 4,7% случаев, после - в 72,6%.
Поменялось и поведение. Обученная модель в 99,2% случаев начинает с точечного поиска, тогда как базовая в 94% случаев первым делом лезет открывать заметки. До нужного дела обученная доходит за 3,7 хода против 5,9.
Рабочее пространство в эксперименте статично, а в реальной компании документы меняются каждый день, и меняются сами вопросы.
Как дешево и непрерывно обновлять память без переобучения - открытая задача, и Engram называет ее своим основным направлением.
@ai_machinelearning_big_data
#news #ai #ml
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖