ragСбросить фильтр ×

Сбер выпустил новое поколение эмбеддинг-моделей GigaEmbeddings

Сбер открыл в открытом доступе новую линейку GigaEmbeddings — моделей, которые переводят текст в числовые векторы для семантического поиска, RAGi-систем, классификации и кластеризации. Линейка состоит из трёх моделей — 480M, 3B и 10B-A1.8Bi — и распространяется бесплатно под лицензией MIT на HuggingFace и GitVerse.

Качество таких эмбеддингов напрямую влияет на точность ответов ИИ-ассистентов и снижает риск галлюцинаций, что критично в поддержке клиентов, работе с юридическими и финансовыми документами и внутренними базами знаний. Новое поколение стало заметно быстрее и сильнее в английском языке и коде, при этом не потеряв качество на русском.

74,99результат флагмана 10B-A1.8B в ruMTEB
14,5 пунктаприрост модели 3B в обработке кода
2 разаускорение инференса 10B-A1.8B на vLLM

Полный разбор →

Что такое RAGFlow и как он решает проблему нарезки документов

Х@habr_comмедиа / агрегатор
3 дн
Что такое RAGFlow и как он решает проблему нарезки документов

Как правильно тестировать AI-агентов: от роутинга до траекторий

В отличие от RAGi-систем, где оценка строится вокруг четырёх измерений (данные, кандидатогенератор, реранкер, ответ LLM), тестирование AI-агентов сложнее из-за недетерминированности их поведения. Разбор статьи инженера Postgres AI Hybrid Manager описывает поэтапный подход к эвалюации агентов — от простой проверки маршрутизации запросов до анализа полных траекторий действий.

Автор статьи прошёл путь от простых проверок к сложной системе тестирования и поделился граблями: обычные REST-подходы (статус-коды, JSON-схемы) не работают, поскольку LLM может решить задачу «другим путём» или красиво ответить, упустив суть.

0.7–0.85порог прохождения теста TCR

Полный разбор →

Memora: структурированная память для ИИ-агентов

Н@GreenNeuralRobotsAI-инженер
2 нед
Memora Tot одна память для агентов Структурированное хранение, семантический поиск, граф знаний, RAG-чат. MIT-лицензия, 636 звёзд на GitHub. Фишки: typed edges между воспоминаниями (implements, supersedes, contradicts), авто-связывание по семантической близости, защита документных фрагментов от случайного удаления/мtрджа. • Встраивается как MCP-сервер • Векторный поиск: OpenAI (по умолчанию), локальные sentence-transformers (~2 ГБ) или TF-IDF • Облачные бэкенды: Cloudflare D1, R2, S3-совместимые • LLM и эмбеддинги конфигурируются раздельно - можно OpenRouter для чата + Cloudflare для векторов #agent #memory

Оптимизация локальных LLM: от квантования до стриминга с SSD

К@quant_prune_distillAI-инженер
2 нед

Внедрение гибридного поиска в PersMarket

М@ITcanflyавтор про «it»
3 нед

Что такое GraphRAG и когда его использовать

M@mashkka_dsAI-инженер
3 нед
Что такое GraphRAG и когда его использовать

Headroom: инструмент для сжатия контекста ИИ-агентов

C@campcodeAI-инженер
3 нед
Срезаем ИИ-агентам аппетит — нашел на GitHub прикольную тулзу Headroom, которая сжимает логи, файлы, RAG-выдачу и результаты инструментов до отправки в модель. По собственным тестам проекта, это экономит 15–20% токенов у кодинг-агентов и до 60–95% на JSON 🤔 Headroom работает локально как библиотека, прокси или MCP-сервер, отдельно обрабатывает код, текст и структурированные данные. Оригиналы не пропадают: они остаются в локальном кэше, и агент может запросить нужный фрагмент обратно. Поддерживаются Codex, Claude Code, Copilot, Cursor и ещё пачка агентов — есть даже общая память между ними. Экономим токены смолоду 💃

Constella: локальная база знаний для AI-агентов

1 мес

Дайджест материалов DeepSchool за июнь-июль

D@deep_schoolAI-инженер
1 мес

Агентные вики: новый паттерн работы с LLM

P@ruspmпродакт / фаундер
1 мес

Т-Технологии открыли модель T-Search для агентного поиска по корпоративным документам

Т-Технологии выложили в открытый доступ T-Search — первую русскоязычную модель для Agentic RAGi, которая выполняет многошаговый поиск по внутренним документам компании и отдаёт готовый контекст любой LLM для генерации ответа. Модель построена на Qwen3.6-35B-A3B, работает как MoE с ~3B активных параметров и запускается на одной GPU Nvidia H100, тогда как сопоставимое качество раньше требовало кластеров из 16+ карт.

Вместе с моделью опубликованы харнесс для интеграции в существующий поиск (совместим и с bm25, и с эмбедингами) и два датасета для оценки — TRuST и SynthComp, всё под лицензией Apache 2.0 на Hugging Face. По заявлению разработчиков, решение снижает стоимость инференса поисковой агентики на 20–50% и позволяет обрабатывать пиковые нагрузки без расширения GPU-кластера, при этом данные не покидают инфраструктуру компании.

35B-A3Bразмер модели (MoE, ~3B активных параметров)
1 H100минимум GPU для запуска модели
55.96 → 61.33рост среднего Recall@10 при тройном роллауте

Полный разбор →

Создание локального LLM-бота для чата с функциями RAG и ролеплеем

Х@habr_comмедиа / агрегатор
1 мес

Бесплатный курс по ИИ-инженерии из 503 уроков

N@notboring_techAI-инженер
1 мес
🎓 В открытый доступ бесплатно выкатили гигантский курс по ИИ-инженерии — в нём 503 (!) урока на 320 часов, которые объединили в 20 этапов. • Обучает всей базе с нуля: от линейной алгебры и основ машинного обучения до LLM, RAG, ИИ-агентов и автономных систем. • В уроках не только теория, но и куча практических задач и примеров готового кода, который можно запустить самому. • Если что-то непонятно: можно вставить урок в NotebookLM и получить наглядные объяснения сложных концептов. Кладезь знаний для ИИ-инженеров — тут. @notboring_tech

FRIDA: эффективность эмбеддера для RAG и результаты в ruBEIR

D@dealerAIAI-инженер
1 мес
FRIDA все ещё хороша, как эмбеддер для вашего RAG. 📦 Теперь и на ruBEIR 🚬 Всегда говорил, всяким там типа разрабам местных LLM – вот вы тюнинг делаете под бенчи, ругаетесь, что там, где вы не в топе, не вы проиграли, а бенчи плохие. А мудрость в том, что хорошие модели на любом бенче, даже на самом сомнительном стабильно в топе - эт и есть мастерство. 😎 #ИИзнанка, #ГордостьДня

TG-RAG: фреймворк для борьбы с когнитивным дрейфом LLM

Д@stuffyNLPAI-инженер
1 мес

Нужен ли вашему продукту ИИ: системный подход к выбору технологий

P@productsenseпродакт / фаундер
1 мес

RPC-Bench: новый бенчмарк для оценки LLM и VLM на научных статьях

1 мес
Ещё ↓