← к ленте

Создание локального LLM-бота для чата с функциями RAG и ролеплеем

Х@habr_comмедиа / агрегатор
1 мес

Опыт запуска локального LLM-бота на слабом железе: RAG, ролевая модель Терминатора и оптимизация работы нейросетей без затрат на API.

«Как я добавил LLM в чат друзей, и приказал ей отыгрывать терминатора (и открыл портал в мультивселенную безумия)» Модель со зрением читала мангу «Призрак в доспехах» и на страницах с японскими звуковыми эффектами срывалась в цикл. Честно пыталась прочитать звук и выдавала «КАК! КАК! КАК!» тридцать раз подряд, до потолка токенов, пока её не осадили штрафом за повторы. За этим курьёзом стоит целый Т-800 для чата на 15 друзей, собранный без единого рубля на API и крутящийся на ноутбуке с 4 ГБ видеопамяти. Бот подкалывает участников по их же архиву реплик, комментирует новости в машинной манере, помнит весь чат через RAG и ведёт досье на каждого. А для чатовых споров есть отдельный режим. Кидаешь боту реплаем спорный тезис, и он идёт проверять его по источникам сразу с четырёх углов. Всё это на домашнем железе со скоростью 5 токенов в секунду, где привычные приёмы приходится выкидывать и заменять хитростью. Посмотрим, как из бесплатных моделей и слабого ноутбука собирается работающий чат-бот.

Кратко (AI)

Автор реализовал локального чат-бота для группы друзей, который использует RAG для анализа истории переписки и ведет досье на участников. Система работает на ноутбуке с 4 ГБ видеопамяти, используя бесплатные модели и оптимизированные алгоритмы для достижения скорости генерации 5 токенов в секунду.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖