← к умной ленте

Т-Технологии открыли модель T-Search для агентного поиска по корпоративным документам

Т-Технологии выложили в открытый доступ T-Search — первую русскоязычную модель для Agentic RAGi, которая выполняет многошаговый поиск по внутренним документам компании и отдаёт готовый контекст любой LLM для генерации ответа. Модель построена на Qwen3.6-35B-A3B, работает как MoE с ~3B активных параметров и запускается на одной GPU Nvidia H100, тогда как сопоставимое качество раньше требовало кластеров из 16+ карт.

Вместе с моделью опубликованы харнесс для интеграции в существующий поиск (совместим и с bm25, и с эмбедингами) и два датасета для оценки — TRuST и SynthComp, всё под лицензией Apache 2.0 на Hugging Face. По заявлению разработчиков, решение снижает стоимость инференса поисковой агентики на 20–50% и позволяет обрабатывать пиковые нагрузки без расширения GPU-кластера, при этом данные не покидают инфраструктуру компании.

35B-A3Bразмер модели (MoE, ~3B активных параметров)
1 H100минимум GPU для запуска модели
55.96 → 61.33рост среднего Recall@10 при тройном роллауте
  • Внутри агент работает по ReAct-циклiу с тремя инструментами: search_corpus (поиск), save_and_advance (сохранение найденных чанков и переход в новый раунд) и finalize_ranking (финальный ранжированный список evidence-чанков); саму генерацию ответа модель не делает — её берёт на себя любая LLM
  • Контекст удерживается в пределах ~32K токенов за счёт передачи между раундами не полной истории вызовов, а сжатой памяти; при заполнении 75% окна поиск блокируется, и агент либо сохраняет память для нового раунда, либо финализирует результат
  • По среднему Recall@10 T-Search обходит более крупные открытые модели — Qwen3.5-397B, GLM-5.2 и Kimi-K2.6; при трёх параллельных роллаутах с RRF-слияниеiм средний Recall@10 вырастает с 55.96 до 61.33
  • Модель протестирована на стандартных бенчмарках BrowseComp и SealQA, а также на собственном собранном вручную русскоязычном бенче TRuST
  • По данным Александра Горного, экономия на инференсе оценивается в 20–100% в зависимости от сценария; по данным остальных источников (Метаверсище и ИИще, Борис опять, Data Secrets) — 20–50%
  • Модель презентовал Анатолий Потапов, руководитель группы фундаментальных технологий LLM в Центре искусственного интеллекта Т-Банка, на конференции ML Conf
  • Датасеты для эвала доступны отдельно: huggingface.co/datasets/t-tech/SynthComp и huggingface.co/datasets/t-tech/TRuST
Что дальше

Команда обещает опубликовать подробный отчёт о модели на Хабре и рассказать о деталях на митапе TurboML.

Это произошло: Т-Банк открыл исходный код рекомендательного фреймворка Perseus →

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖