← к ленте

Qwen 3.8 превосходит Opus 4.8 в юридических задачах при меньшей стоимости

1 нед

Стартап Engram и компания Harvey протестировали модель Qwen 3.8 в юридических задачах, показав превосходство над Opus 4.8 по эффективности и стоимости.

Развитие специализированных ИИ-агентов позволяет компаниям значительно сократить расходы на автоматизацию сложных интеллектуальных задач.

  • Специализированное обучение моделей на корпоративных данных повышает точность ответов в разы.
  • Использование кастомных моделей позволяет снизить стоимость обработки юридических документов в 10 раз.
  • Эффективность работы агентов с памятью становится критическим фактором для внедрения ИИ в бизнес-процессы.
📌Qwen 3.8 решает юридические задачи лучше и дешевле Opus 4.8 Стартап Engram, который занимается памятью для ИИ-агентов, вместе с легалтех-компанией Harvey проверил, что будет, если агент заранее изучит рабочее пространство фирмы, а не будет каждый раз перечитывать документы. Для эксперимента собрали синтетическую юрфирму Calderwood & Harkness: 100 млн токенов, 9 286 файлов, 266 клиентских дел - от судебных споров до сделок M&A и раундов финансирования. Модель Qwen3.8-27B не просто получила этот массив на вход - она изучала его тысячами прогонов, сама генерировала себе обучающие данные и записывала заметки. Часть знаний осела в весах через LoRA, часть - в структурированных заметках, куда агент потом ходит поиском. Исходные 100 млн токенов ужались в 1 млн токенов заметок. 🟡Результаты Выше оказалась не абсолютная точность, а интеллект на токен. По этой метрике кастомная Qwen дает 190,8 балла на 100 тысяч токенов против 129,3 у Opus 4.8 и 104,2 при высоком уровне рассуждений. По доле полностью верных ответов модель тоже обошла Opus 4.8 - 30% против 25%, - и обошлась в 0,13 доллара за запрос против 1,32.
Это примерно десятикратная разница по ценам OpenRouter на август 2026.
Отдельно измерили, сколько модель усвоила в веса. Отвечая на вопросы о фирме вообще без инструментов и заметок, до изучения она была права в 4,7% случаев, после - в 72,6%. Поменялось и поведение. Обученная модель в 99,2% случаев начинает с точечного поиска, тогда как базовая в 94% случаев первым делом лезет открывать заметки. До нужного дела обученная доходит за 3,7 хода против 5,9.
Рабочее пространство в эксперименте статично, а в реальной компании документы меняются каждый день, и меняются сами вопросы. Как дешево и непрерывно обновлять память без переобучения - открытая задача, и Engram называет ее своим основным направлением.
@ai_machinelearning_big_data #news #ai #ml
Qwen 3.8 превосходит Opus 4.8 в юридических задачах при меньшей стоимости

Кратко (AI)

Стартап Engram совместно с Harvey протестировал модель Qwen 3.8 на синтетическом массиве юридических данных. Результаты показали, что кастомная модель превосходит Opus 4.8 по эффективности использования токенов и точности ответов, при этом стоимость запроса снизилась в 10 раз.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖