Создание локального LLM-бота для чата с функциями RAG и ролеплеем
Х@habr_comмедиа / агрегатор
1 месОпыт запуска локального LLM-бота на слабом железе: RAG, ролевая модель Терминатора и оптимизация работы нейросетей без затрат на API.
«Как я добавил LLM в чат друзей, и приказал ей отыгрывать терминатора (и открыл портал в мультивселенную безумия)»
Модель со зрением читала мангу «Призрак в доспехах» и на страницах с японскими звуковыми эффектами срывалась в цикл. Честно пыталась прочитать звук и выдавала «КАК! КАК! КАК!» тридцать раз подряд, до потолка токенов, пока её не осадили штрафом за повторы. За этим курьёзом стоит целый Т-800 для чата на 15 друзей, собранный без единого рубля на API и крутящийся на ноутбуке с 4 ГБ видеопамяти.
Бот подкалывает участников по их же архиву реплик, комментирует новости в машинной манере, помнит весь чат через RAG и ведёт досье на каждого. А для чатовых споров есть отдельный режим. Кидаешь боту реплаем спорный тезис, и он идёт проверять его по источникам сразу с четырёх углов. Всё это на домашнем железе со скоростью 5 токенов в секунду, где привычные приёмы приходится выкидывать и заменять хитростью.
Посмотрим, как из бесплатных моделей и слабого ноутбука собирается работающий чат-бот.
Кратко (AI)
Автор реализовал локального чат-бота для группы друзей, который использует RAG для анализа истории переписки и ведет досье на участников. Система работает на ноутбуке с 4 ГБ видеопамяти, используя бесплатные модели и оптимизированные алгоритмы для достижения скорости генерации 5 токенов в секунду.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖